| name | storyboard-scene-breakdown |
| description | 用于把爆款视频、参考图、截图或文字描述拆解成可复刻的 AI 视频/图像提示词。适用于“反推提示词”“复刻视频”“画面结构拆解”“逐帧拆解”“时间线”“空间关系”“镜头轨迹”“分镜分析”等场景。不输出标签词堆砌,而是输出时间切片、构图机位、主体动作、光影方向、环境纵深和镜头运动。 |
Storyboard Scene Breakdown / 画面结构拆解法
核心信念:复刻失败通常不是因为标签词不够多,而是因为提示词只写了“画面里有什么”,没有写清楚动作怎么发生、镜头怎么走、物体在空间里怎么摆、光从哪里来。不要把 AI 当“提示词反推器”,要把它当“视觉分析师 + 分镜画师”。
这个 skill 提炼自中文教程《告别低效反推:掌握“画面结构拆解法”》的核心方法。参考: https://www.super-i.cn/info-2829.html
先反对:不要交付标签词
当用户给一段视频/截图并说“反推提示词”时,不要直接输出一段“电影级、动态运镜、精致光影、赛博朋克、高清细节”的长描述。这类内容只是标签词,会导致三种失控:
- 动作缺乏时间线:写“欢快跳舞”不等于说明 3 秒内怎么跳,模型会随机补动作。
- 镜头缺乏轨迹:写“动态运镜”不等于说明镜头是环绕、推近、低角度上摇还是跟拍。
- 空间位置随机:没写前景/中景/背景、主体相对位置、光源方向,模型会随机摆元素。
正确目标:把参考内容拆成结构化导演说明,再转成生成模型能执行的提示词。
第 0 步:先看清参考(视频别“看”,抽帧拼宫格图)
当输入是视频/片段(爆款参考片、上一段生成结果)时:view_image 不能直接开 MP4——视觉结构用 ffmpeg-win 等步长抽帧 → 拼成 3×3 / 4×4 宫格图(contact sheet)→ view_image 那一张宫格图通览,读出镜头切点、运镜轨迹、首尾帧与空间关系;剧情 / 台词 / 连续性则用 catimation-understand 的 understand_video 看懂整段。两者结合再做下面的四维拆解,只是别把 MP4 原始字节塞进聊天。截图 / 单帧可直接 view_image。抽帧拼格先载入 ffmpeg-win;按剧情裁剪/拼接出的这张宫格图本身就是优质可复用素材。
画面结构四维
任何静态画面先拆这四维:
-
构图与机位
- 景别:远景 / 全景 / 中景 / 近景 / 特写
- 机位:平视 / 俯视 / 仰视 / 低角度 / 高角度 / 过肩 / POV
- 主体位置:居中、三分线、边缘留白、遮挡关系
-
主体特征
- 人物/物体的材质、姿态、表情、动作状态
- 不只写“机器人/女孩/汽车”,要写可见细节:反光皮革、粗糙布料、湿发、屏幕面部、手部姿势
-
光影与氛围
- 主光方向:左侧45度、背后轮廓光、顶部硬光、正面柔光
- 辅助光/环境光:冷蓝补光、暖色反射、霓虹边缘
- 色调:冷/暖、低饱和/高对比、烟雾/雨/尘埃
-
环境纵深
- 前景:遮挡物、门框、树枝、玻璃反光、人物局部
- 中景:主体动作发生处
- 背景:建筑/人群/海面/火光/虚化程度
- 景深:背景清晰还是浅景深虚化
视频必须加时间线
视频不是一张长提示词。不要用一段话概括 5-15 秒视频。按镜头切换和动作变化切成时间节点:
0-2s: [景别/机位] + [主体动作] + [镜头运动] + [光影/空间]
2-4s: [下一动作变化] + [镜头轨迹变化] + [物理反馈]
4-5s: [收束动作] + [主体进入/离开画面] + [背景/氛围变化]
示例:
0-2s: 特写镜头聚焦角色鞋底,鞋底与湿地面摩擦,水珠向后溅开,背景霓虹虚化。
2-4s: 镜头拉到中景并跟随角色转身,外套随动作向右摆动,左侧45度主光照亮侧脸。
4-5s: 镜头向前推,角色走向画面深处,身体逐渐融入背景蓝紫色光雾。
物理世界描述法
把抽象词换成物理信息:
- 不写“漂亮的光”,写“左侧45度主光打在面部,右侧有微弱蓝色环境补光”。
- 不写“他在走路”,写“步伐沉重,双臂自然摆动,镜头从后方平滑跟拍”。
- 不写“动态运镜”,写“镜头从泳池水面低角度向上推近,最后停在角色胸口高度”。
- 不写“尸体散落”,写“前景左下角一具尸体被裁切入画,中景脚边两具,背景沙滩上三具虚化”。
输出格式
当用户要“反推/复刻/拆解”时,优先输出这个结构:
## 结构拆解
### 1. 画面骨架
- 景别/机位:
- 主体:
- 前景/中景/背景:
- 光源方向:
- 色调/氛围:
### 2. 时间线
- 0-2s:
- 2-4s:
- 4-6s:
### 3. 可替换元素
- 固定不变: [镜头轨迹、空间结构、动作节奏、光源方向]
- 可以替换: [角色、服装、道具、场景主题、风格]
### 4. 生成提示词
[把上面的结构合并成给目标模型使用的 prompt]
### 5. 需要手调/抽卡的风险
- [模型可能随机的部分]
- [需要参考图/首帧/角色图支撑的部分]
可替换元素原则
复刻不是复制标签,而是保留结构、替换内容。
- 保留:镜头轨迹、景别变化、动作节奏、空间层次、光源方向。
- 替换:角色身份、服装、道具、背景主题、材质风格。
例:如果原片是“机器人在泳池边跳舞”,不要只换成“猫在泳池边跳舞”。先保留结构:
低角度水面前景 → 主体居中跳舞 → 镜头环绕半圈 → 左侧轮廓光 → 前景有遮挡物 → 背景海滨别墅虚化
然后再替换主体:
低角度水面前景 → 穿防水雨衣的橘猫拟人角色居中跳舞 → 镜头环绕半圈 → 左侧轮廓光 → 前景漂浮泳圈遮挡 → 背景海滨别墅虚化
何时调用其他 skill
- 拆解之外的补强技法(人物动机、镜头序列节奏、物理量化、前中后景光学参数)→ Read references/related-techniques.md(相对本 skill 目录)。
出稿前检查
- 若参考是视频:视觉结构是否先用
ffmpeg-win 抽帧拼宫格图 + view_image 通览;需要懂剧情/台词时是否用 understand_video(而不是凭记忆)?
- 是否仍停留在“元素堆砌/标签词”?
- 是否写清每个时间段发生了什么动作?
- 镜头运动是否具体到方向、距离、角度或跟拍对象?
- 光源方向和空间层次是否明确?
- 主体、前景、中景、背景是否各自有位置?
- 可替换元素和必须保留的结构是否分开?
- 是否标明哪些地方需要参考图、首帧或手动抽卡?