| name | script-to-storyboard |
| description | 将已有剧本拆解为专业分镜故事板,提取人物/场景/道具并生成视觉设定prompt,输出分镜生图prompt和图生视频prompt,可直接用于AI生图和图生视频工作流。触发关键词:剧本转分镜、script to storyboard、分镜故事板、生成分镜、剧本拆分、故事板设计、生图prompt清单、视频prompt、分镜prompt。当用户提供剧本并希望生成可用于AI创作的分镜设计、生图提示词或视频提示词时,必须使用本skill。 |
Script-to-Storyboard Skill
将文字剧本转化为专业分镜故事板,并输出可直接使用的 AI 生图 prompt 和图生视频 prompt。
整体工作流
Phase 0 建立制作总纲(启动问卷 → 视觉基准文档 VBD)
↓
Phase 1 剧本 → 镜头列表(含角色/场景/道具清单)
↓ ↓(并行)
Phase 2 镜头列表 → 故事板 Phase 3 视觉设定系统(CHAR/LOC/PROP prompt)
↓ ↓
QA I(检查故事板 + 视觉设定完整性)
↓
Phase 4 生成分镜生图 prompt
↓
Phase 5 补充图生视频 prompt
↓
QA II(检查 prompt 质量和连贯性)
↓
输出最终完整 prompt 清单
Reference 文档路径
所有 reference 文档打包在 skill 目录内:
<skill_dir>/references/(即本 SKILL.md 同级的 references/ 子目录)
| 文件 | 用途 | 在哪个阶段读取 |
|---|
references/REF-00-制作总纲模板.md | 启动问卷结构 + VBD 格式 | Phase 0 |
references/REF-01-叙事分镜规范.md | 剧本分析方法 + 镜头列表字段规范 | Phase 1 |
references/REF-02-故事板设计规范.md | 景别/运镜/调度/转场词表 | Phase 2 |
references/REF-03-视觉设计系统.md | 角色/场景/道具设定 prompt 规范 | Phase 3 |
references/REF-04-Prompt工程规范.md | 生图/视频 prompt 结构模板 | Phase 4/5 |
references/REF-05-QA检查清单.md | QA I/II 检查项和评判标准 | QA I, QA II |
执行每个 Phase 前,必须先读取对应的 Reference 文档(路径相对于本 SKILL.md 所在目录)。
默认输出路径
除非用户另有指令,所有生成物默认存入 Vault Inbox:
/Users/pixies/Library/Mobile Documents/iCloud~md~obsidian/Documents/Mydoc/Inbox/AI-Gen/Script-to-Storyboard/Output/[项目名称]/
目录结构:
[项目名称]/
├── VBD-视觉基准文档.yaml
├── Phase1-镜头列表.md
├── Phase2-故事板.md
├── Phase3-视觉设定VID.md
├── QA-I报告.md
├── Phase4-生图prompt清单.md
├── Phase5-完整prompt清单.md
└── QA-II报告.md
Phase 0:建立制作总纲
读取: REF-00-制作总纲模板.md
向用户逐项提问(8 道问卷),收集:
- 画面风格(必填)
- 目标媒介与画幅(必填)
- 色调与光线倾向(必填)
- 生图目标模型(必填)
- 图生视频目标模型(必填)
- Prompt 语言(默认英文)
- 镜头时长偏好(默认 3-5s)
- 特殊约束(可选)
问卷完成后,按 REF-00 中的 YAML 格式生成 视觉基准文档(VBD),保存到输出目录。
VBD 是全流程的锚点,后续所有 Phase 引用同一份 VBD。
Phase 1:剧本 → 镜头列表
读取: REF-01-叙事分镜规范.md
核心任务:将剧本按镜头逻辑重组,输出镜头列表。
关键要求:
- 原剧本所有台词必须完整保留,不可改写
- 每个镜头有 shot_id、scene_id、location、characters、action、dialogue、emotion、duration、narrative_note
- 文档末尾附加三个清单:角色清单(CHAR)、场景清单(LOC)、重要道具清单(PROP)
保存为 Phase1-镜头列表.md。
Phase 2 & Phase 3(并行执行)
Phase 2:镜头列表 → 故事板
读取: REF-02-故事板设计规范.md
在 Phase 1 表格基础上,为每个镜头补充:
- 景别(shot_size)
- 镜头角度(angle)
- 调度模式(staging)
- 运镜类型(camera_move)
- 转场方式(transition)
- 音效提示(sfx)
- 最终时长确认
180度轴线原则必须遵守。音效字段禁止出现配乐词汇。
保存为 Phase2-故事板.md。
Phase 3:视觉设定系统
读取: REF-03-视觉设计系统.md
基于 Phase 1 的 CHAR/LOC/PROP 清单,为每个元素生成视觉设定 prompt:
- 角色(CHAR):3:2 横版转面卡 prompt,遵守 REF-03 强制技术要求
- 场景(LOC):多角度概念图 prompt
- 道具(PROP):360°多角度设定图 prompt
每个条目必须有锚点 ID(CHAR-001-xxx / LOC-001-xxx / PROP-001-xxx),并填写 visual_keywords 字段(Phase 4 依赖)。
保存为 Phase3-视觉设定VID.md。
QA I
读取: REF-05-QA检查清单.md(模块 A/B/C/D)
同时检查 Phase 2 故事板和 Phase 3 视觉设定。
判定标准:
- ❌ 阻断项:必须修复后才能进入 Phase 4
- ⚠️ 警告项:记录但可继续
输出 QA-I报告.md,列出所有问题和结论。如有阻断项,修复后重新执行 QA I。
Phase 4:生成分镜生图 Prompt
读取: references/REF-04-Prompt工程规范.md
输入:故事板(Phase 2)+ 视觉设定文档 VID(Phase 3)+ VBD(Phase 0)
生图 Prompt 核心质量要求
生图 prompt 的目标是:用户拿着 Phase 3 生成的设定图作为参考图上传到生图平台,结合 prompt 能准确还原该镜头的构图、场景、人物形象、人物动作/表演、画面氛围和视觉风格。
因此每条生图 prompt 必须达到以下标准:
人物描述:
- 不能只写人名,必须从 VID
visual_keywords 提取关键视觉特征(性别、年龄感、民族、发型、着装、体型气质)
- 示例:余准 → "a lean Chinese man in his mid-30s, neat black side-parted hair, dark suit jacket, white shirt with loosened tie, concealed holster at waist, controlled expression"
- 多人场景:所有出场人物均需简要描述,并标注相对位置关系
场景描述:
- 从 VID
visual_keywords 提取场景的架构、灯光方向、色调、关键陈设元素
- 描述足够让生图 AI 还原该场景而不是依赖参考图去猜
动作/表演描述:
- 不能直接引用剧本动作描述,必须转化为生图能理解的画面状语
- 描述人物肢体位置、面部表情、视线方向、与道具/环境的交互
- 示例:不写"余准从椅子上站起来",而写"a Chinese man in mid-motion of rising from a wooden chair, hands pressing on armrests, body slightly forward, tense jaw"
镜头参数:
- 景别(ECU/CU/MCU/MS/MLS/LS/WS/EWS)+ 焦距感描述
- 镜头角度(eye level/low angle/high angle/Dutch angle/overhead)
- 构图偏向(centered/off-center left/off-center right,rule of thirds等)
- 景深(shallow DOF/deep focus)
氛围与风格:
- 来自 VBD 的风格关键词必须每条 prompt 都包含
- 情绪氛围词需与故事板 emotion 字段匹配
生图 prompt 按 7 层结构构建:
- 主体描述(场景+人物外形简述)
- 动作/表演描述(具体画面动作)
- 镜头参数(景别+角度+构图+景深)
- 场景环境(来自 VID 场景关键词)
- 画面氛围(情绪+光线)
- 风格基准(来自 VBD style_keywords,每条必含)
- 负向约束(negative prompt,含全局禁忌)
每条 prompt 注释标注引用的锚点 ID。
保存为 Phase4-生图prompt清单.md。
Phase 5:补充图生视频 Prompt
读取: references/REF-04-Prompt工程规范.md(视频 prompt 部分)
在 Phase 4 基础上,为每个镜头补充视频 prompt,目标是:用户拿着该镜头的生图结果作为首帧图上传给视频 AI,结合 prompt 能准确还原人物演出、镜头运动、台词口型时机、音效。
视频 prompt 按 6 层结构构建:
- 起始画面状态(与生图 prompt 一致的场景简述,锚定首帧)
- 主体运动(人物/主体的具体动作轨迹,必须描述,不能只有镜头运动)
- 镜头运动(与故事板 camera_move 一致)
- 时长(明确秒数)
- 台词/音效(仅当有实际内容时才写入,无台词或无音效则完全省略该项,不写"台词:—"或"音效:—")
- 技术约束(每条必须包含 "no music, no score, no bgm",无论是否有其他内容)
按目标视频模型 Seedance 适配语法(自然语言叙事型,中文描述为主)。
输出格式(每个镜头一个条目):
## S001 | SC_001 余准出租屋 | WS | 5s
**生图Prompt**(引用: CHAR-001, LOC-001):
[prompt 内容]
**图生视频Prompt**:
[prompt 内容]
保存为 Phase5-完整prompt清单.md。
QA II
读取: REF-05-QA检查清单.md(模块 E/F/G)
检查生图 prompt 质量 + 视频 prompt 质量 + 整体连贯性。
阻断项修复后重新执行 QA II。
输出 QA-II报告.md。
最终交付
QA II 通过后,告知用户:
- 所有文件已保存到 Vault 输出目录
- 总镜头数
- 角色/场景/道具设定数量
- 是否存在 QA 警告项需关注
执行注意事项
- 每次启动必须先执行 Phase 0 问卷,不可跳过
- Phase 2 和 Phase 3 并行执行,但两者都依赖 Phase 1 完成
- QA I 有阻断项时不得进入 Phase 4
- 所有输出文件默认存入 Vault,除非用户指定其他路径
- 台词保护:任何阶段都不得改写原剧本台词
- 视觉一致性:Phase 4/5 的每条 prompt 必须引用对应的锚点 ID
- 配乐禁忌:视频 prompt 中严禁出现音乐/配乐相关词汇