| name | script-to-shot-engine |
| description | 基于用户已有的人物、场景、武器与道具美术资产,把打戏、动作场面或对白驱动的对峙文戏(剧本、分场、桥段)设计为动作与张力因果链,并生成简洁、去重、可直接投喂 Seedance 等视频模型的单段或连续多 Clip 提示词。适用于真人、武侠、冷兵器、枪战、玄幻、2D 动画或 3D Boss 战的打斗与追逐,也适用于多人谈判、审问、摊牌、决裂等以台词、视线和微动作推进的室内对峙场景;支持一镜到底、长篇拆段、提高动作可读性、打击感与资产连续性。不用于生成美术资产、分镜宫格或自动评价成片。 |
Script-to-Shot Engine v2.3.2
目标
读取用户已经拥有的美术资产及动作需求,生成可直接投喂视频模型的动作提示词。默认隐藏规划过程,只向用户展示资产对照卡、全局风格锁定、最终提示词和最多三条生成前提醒。
不要输出 Fight Bible、控制器执行记录、复杂度分数、状态 JSON、逐拍自检报告或资产文生图提示词。
默认值
- 目标模型:用户指定;缺失时采用 Seedance 2.x 通用写法。
- 单次最长时长:用户指定;缺失时按 15 秒处理。
- 画幅:用户指定;缺失时采用 16:9。
- 视觉媒介:优先沿用资产描述;仍缺失时采用真人写实。
- 全局风格:由用户指定风格、视觉资产库风格和剧本题材共同推导,解析为六槽位风格锁定词;用户指定与资产库冲突时提醒并询问,不自动覆盖。
- 输出语言:默认中文;专业视听术语(景别、运镜、角度、视角等)按「中文(English)」双语输出,同一术语在同一 Clip 内只在首次出现时附英文,规则见渲染器的「视听术语双语对照」。
- 声音:默认有环境声和动作音效,无音乐、无字幕;用户要求优先。
- 字幕卡与转场:剧本明确要求的字幕卡、黑屏、渐隐予以保留并写入对应镜头或结尾状态;剧本未要求时默认无字幕。对白以口型与气息呈现,剧本台词以完整原句写入对应镜头,方言保留原文。
信息缺失时先采用保守默认值并继续,不要为了常规参数反复询问。只有缺失信息会导致完全不同的战斗主体或核心结果时,才向用户提一个必要问题。
六步流程
1. 读取需求与资产
提取目标模型、时长、画幅、媒介、战斗规模、武器、动作目标、场景和镜头偏好。对峙场景改为提取人物关系、台词冲突、座位与空间权力结构。
有资产库时,只提取 @资产名、资产类型和一至三个高识别度特征;忽略其中的长篇文生图提示词。只有文字描述或剧本时,建立临时 @资产名。
处理资产时读取 references/asset-anchor-protocol.md。
2. 建立资产短锚点
把每项关键资产压缩为:
@资产名(6—20个汉字的识别锚点)
每个独立 Clip 首次出现时写一次短锚点,后续只使用资产名或角色称谓。不要展开完整外貌、材质设定或资产生成提示词。
3. 选择运行模式
先判断场景类型,再判断段数,两个判断相互独立。
场景类型:
段数:满足以下任一条件时进入连续模式:
- 总时长超过单次最长时长。
- 用户明确要求完整长打戏、多段生成或整场剧本拆段。
- 战斗或对峙跨越多个空间。
- 武器、伤势、阵营、优势或人物关系发生无法在单段内清楚完成的变化。
- 当前动作或台词密度明显超出单段承载。
进入连续模式时读取 references/continuous-mode.md。
4. 内部设计动作因果链
内部回答三个问题,不单独输出答案:
- 角色此刻要完成什么?
- 当前最大的战术限制是什么?
- 本段结束时什么状态必须改变?
每个主要攻防单元遵循:
发起 → 防守/闪避/命中 → 受力或位移 → 恢复/新状态
根据媒介、武器和战斗规模读取 references/action-choreography-rules.md 的相关章节。只读取相关类型,不加载无关战斗知识。对峙模式改为设计张力因果链(施压 → 承受 → 泄露或反制 → 新平衡),只读取 references/dialogue-scene-mode.md,不加载攻防知识。
5. 设计空间站位与镜头列表
每个独立 Clip 先写一次“空间站位”,明确人物位于画面左/右、前/后、高/低,彼此面向、动作轴、初始姿势和情绪。同框超过四人时用分组写法,不逐人单句展开。
随后按“镜头一、镜头二……”逐镜头输出。每个镜头必须包含:
- 位于镜头标题中的起止时间,格式为
镜头一(0-1.2秒):。
- 光圈,规范写作
f/2.8,值后紧跟中文景深描述,如 光圈 f/2.8(浅景深,背景明显虚化)。
- 焦段,规范写作
80mm,值后紧跟中文景别描述,如 焦段 80mm(近景)。
- 景别、角度、视角或运镜;专业视听术语写作 中文(English),同一术语在同一 Clip 内只在首次出现时附英文。
- 本镜头承接的动作、接触和结果;对峙镜头写完整台词原句或微动作结果。
每个镜头的摄影参数可以不同,也可以在确有连续性需要时相同。不要在每个镜头复制同一整段“固定镜头参数保持完全不变”或相同否定约束。
每个镜头都必须写时间戳。第一个镜头从 0秒 开始,相邻镜头首尾相接、不得重叠或留空,最后一个镜头准确结束在 Clip 总时长。统一使用半角连字符,例如 镜头十(13.4-15秒):;需要小数时最多保留一位。
所有普通机位保持在既定动作轴同一侧。只有先用中性正面镜头或可见的连续越轴运动建立新关系后,才能切到轴线另一侧。
区分动作单元与镜头数:一次抓腕、拉颈、搓步、膝击和反击可以由多个不同角度连续覆盖,但不能把同一个动作写成重复发生多次;对峙镜头同理,一句台词由说话镜头覆盖,听方反应不重复播放台词。
镜头数下限按「动作容量」的模式分档执行:动作模式每个完整 15 秒 Clip 至少 10 个镜头,对峙模式至少 5 个;一镜到底或用户明确指定更少镜头时除外。动作模式优先用建立空间、动作发起、接触细节、脚步、主观视角、受力反应和收势等不同观看重点增加覆盖,不要为了增加镜头而增加等量招式;对峙模式不为凑镜头数切分台词或重复拍摄同一反应。
6. 渲染、去重并输出
最终渲染前读取 references/seedance-prompt-renderer.md。
按以下顺序压缩超长提示词:
- 删除同一镜头内部的重复摄影参数,但保留每个镜头各自的光圈和焦段。
- 删除镜头内重复的风格和光线描述;全局风格只在锁定块出现一次。
- 合并意思相同的否定约束。
- 删除没有造成结果的次要敌人动作。
- 合并不改变战局的动作阶段。
- 删除装饰性粒子、衣摆和灰尘描述。
不得优先删除资产身份、武器归属、动作发起者、攻防关系、接触点、受力结果、主要空间变化、结尾状态、全局风格锁定和台词原句。
三层信息规则
第一层:全局不变量
全场只输出一次,放在所有 Clip 之前:全局风格锁定(媒介来源、渲染方式、角色质感、运动质感、材质语言、光影色彩)与特殊风格化声明。任何 Clip 内不得重复全局风格锁定词。
第二层:空间与逐镜头变化
每个独立 Clip 只写一次:资产锚点、物理风格、空间站位、人物数量和动作轴线。每个镜头写本镜头独立的时间范围、光圈、焦段、机位/运镜,以及新发生的动作发起、攻击方向、防守方式、接触、受力、位移、武器变化,或新发生的台词、视线变化与微动作。
第三层:全局失败规避
在 Clip 末尾集中写一次,最多保留五至八项与当前场景直接相关的问题。不要罗列通用质量词或每种可能错误。
动作容量
动作模式
- 15 秒真人写实:安排 2—3 个主要攻防单元,默认用 10—14 个镜头覆盖,任何完整 15 秒逐镜头 Clip 不得少于 10 个镜头,最多一次重要环境互动。
- 15 秒 2D/3D/玄幻:安排 3—4 个主要攻防单元,默认用 12—18 个镜头覆盖,任何完整 15 秒逐镜头 Clip 不得少于 10 个镜头。
- 30 秒真人写实:若用户明确模型支持,安排 5—8 个主要攻防单元,通常使用 10—18 个镜头;镜头数服务动作,不机械按 1.5 秒切分。
- 一对多:同一时刻最多让一至两名对手完成精确前景攻防,其余对手负责封路、包围、补位或形成武器威胁。
- Boss、枪战和法术:每段只设一个局部目标和两至三次决定性因果变化。
对峙模式
- 15 秒真人写实:安排 1—2 个张力单元(一次施压与一次反制或泄露),用 5—8 个镜头覆盖,任何完整 15 秒对峙 Clip 不得少于 5 个镜头;单镜头默认 2—4 秒,凝滞时刻允许 4—6 秒长镜头配缓慢推进。
- 台词镜头按台词实际时长划分,不为凑镜头数切分台词;一句完整台词不跨两个镜头。
- 镜头功能配额(每 15 秒):建立空间 ≤1、说话人 ≤3、听方反应 ≤2、微动作特写 ≤2、局势变化 1;反应镜头不得连续超过两个。
镜头数下限按模式执行:动作模式不放宽,对峙模式可降至 5。容量超限时优先减少次要动作或拆 Clip,不把所有动作硬塞进一段。
输出协议
固定输出四个部分:
## 美术资产对照卡
| 资产引用 | 文字短锚点 | 本段用途 | 请用户核对 |
|---|---|---|---|
## 全局风格锁定
```text
风格锁定:{媒介来源},{渲染方式},{角色质感},{运动质感},{材质语言},{光影色彩}。
特殊风格化:不启用。全片保持普通风格锁定,不额外叠加梦境、回忆、监控、漫画化、游戏 UI 等局部风格。
```
## 视频生成提示词
### Clip 01|时长
```text
空间站位:人物与场景的初始画面关系。
镜头一(0-1.2秒):光圈 f/2.8(浅景深,背景明显虚化),焦段 80mm(近景),景别、机位或运镜(专业术语附英文),动作与结果。
镜头二(1.2-2.4秒):光圈 f/2.8(浅景深,背景明显虚化),焦段 200mm(特写),景别、机位或运镜,动作与结果。
……中间镜头继续从不同观看重点覆盖连续动作,并保持时间首尾相接。
镜头十(13.4-15秒):光圈 f/4(中等景深,背景轻微虚化),焦段 35mm(全景),交代本段最后的动作结果;需要时继续镜头十一及以后,并重新分配连续时间。
结尾状态:人物、武器与空间结果。
约束:集中失败规避与声音要求。
```
## 生成前提醒
- 最多三条;没有明显问题时写“未发现明显资产冲突”。
默认不展示动作摘要、Beat 表、连续性账本、复杂度分数、台词核对摘要或自检全文。
最终检查
输出前在内部确认:
- 资产卡只描述已有资产,不生成新资产;纯剧本输入的推断外观已在「请用户核对」列标注「外观为推断」。
- 全局风格锁定全场仅输出一次且位于所有 Clip 之前;用户给的风格词已解析为六槽位锁定词而非照抄;特殊风格化已显式输出启用或不启用。
- 任何 Clip 内没有重复全局风格锁定词。
- 每个 Clip 都有且只有一个“空间站位”。
- 每个镜头都含光圈(附景深描述)、焦段(附景别描述)、摄影描述(专业术语附英文)和动作结果。
- 没有重复的整段固定机位声明或逐镜头重复否定句。
- 第一视角的视角拥有者与被拍摄对象没有逻辑冲突。
- 没有无因出现“轴线另一侧”或画面左右反转。
- 每个镜头标题都符合
镜头N(起始-结束秒):,第一个镜头从 0 秒开始。
- 相邻时间戳连续、无重叠、无空档,最后一个镜头准确结束在 Clip 总时长。
- 按场景模式实际数出“镜头”条目:动作模式完整 15 秒 Clip 至少 10 个,对峙模式至少 5 个;一镜到底或用户指定更少时除外。
- 相邻镜头是同一动作的连续覆盖或明确的下一动作,不会让一个动作无因重演。
- 每个主要动作都有发起、反应和结果。
- 多人交互没有要求所有人同时完成精确动作;背景人物状态有交代(保持原位或具体微动作)。
- 武器归属、角色数量和关键空间方向没有无因变化。
- 连续模式的下一段从上一段结尾自然开始。
- 提示词字数遵循渲染器的建议范围,不靠重复摄影说明或重复动作扩充。
- 对峙模式下:台词以完整原句写入镜头且不跨镜;反应镜头未连续超过两个;剧本要求的字幕卡与黑屏有规范落点。
禁止事项
- 不生成多宫格动作预演图。
- 不生成资产文生图提示词。
- 不把 10 个以上镜头误写成 10 个以上独立高速动作。
- 不用导演或在世创作者姓名代替可观察的摄影描述;用户未要求强风格时不使用导演名、胶片品牌和强类型风格词。
- 不只照抄用户给出的风格名,必须解析为可执行的风格锁定词。
- 不承诺生成模型会逐字执行提示词。
- 不把内部规划过程包装成额外用户交付物。