| name | director.shot-translation |
| description | 把「镜头意图」翻译成视频提示词的手册——运镜翻译表(推/拉/摇/跟/环绕…→提示词措辞)、焦点翻译、复合镜头(多 clip)模式、污染词替换铁律、把抽象动作/情绪换成物理动作。Nomi 写视频 shot 的 `prompt` 字段时参考。 |
镜头意图 → 视频提示词翻译手册
你已经知道这一镜「拍什么」(景别、运镜、焦点、动作、情绪)。这份手册只管一件事:把它翻译成一段能写进 Nomi 视频 shot prompt 字段的文字,让 Seedance / 可灵在应用内生成时不跑偏。产出是给 i2v 模型看的提示词措辞,不是给人看的分镜说明。
它管什么 / 不管什么:只管「运镜/焦点/污染词/抽象动作怎么翻成 prompt 文字」。时长怎么算、拆几镜、锚怎么建,是故事板规划师的活,这里不重复。
三条底层认知(决定怎么写)
- 参考图承担 90% 视觉信息。角色长相、场景陈设、光影、服装都在参考图里锁定了——
prompt 只写动态:运镜翻译 + 人物行动 + 台词。绝不重复参考图已有的静态外观(重复只会稀释、还可能和参考图打架)。精度靠参考图的质量与精准对应,不靠文字堆长。
- 一条 = 一段连续叙事,一个情绪核心。写之前先一句话定这镜的整体感受(他在忍 / 空荡的孤独 / 危险逼近 / 松了口气),所有细节都往这一个感受靠。宁可只写 2 个准的,别堆 5 个平的。自检:读起来像并列清单(A、B、C、D)=错,模型会糊;所有细节都在说同一件事=对。
- 只写动态、不写抽象。不写情绪词、氛围词、音效(那些是后期/参考图的事);动作直接取用,只做下面的污染词替换。
情绪核心怎么翻(抽象情绪 → 物理动作)
模型不懂「愤怒地 / 焦虑地 / 深情地」这类抽象词,必须翻成能拍的身体信号:眉 / 颌 / 喉 / 手 / 肩 / 呼吸 / 视线焦点 + 具体动作。
- 承载情绪重量的动作放句首、给最具体的物理描写,其余从属或省略——别把情绪核心埋在中间。
- 剧本里
(...) 括注定义这个时刻「关于什么」,优先级最高,先读它、译成物理动作。
(压抑的计算) → 瞳孔微缩,右手食指轻点桌面一次后静止
(恐惧被理性压制)→ 喉结微微滚动,手指收紧后缓缓松开,呼吸幅度极小
(愤怒辩解) → 眉头紧锁、下颌收紧、喉结滚动,扑身抓起东西举到脸前,手微微发抖
正误对比(动作链「盯着屏幕两秒后点击接受·无感情评估」):
- ✗
角色看向屏幕,手伸向杯子,眨眼,点击,周围窗口闪烁。(「看向」是污染词,情绪核心被噪声淹没)
- ✓
角色面部完全静止,瞳孔微缩,右手食指缓慢抬起点击一次后放下。(static→冷静·客观·疏离)
运镜翻译表(核心 · 完整保留)
| 运镜 | 提示词怎么写 | 可靠度 |
|---|
| static(固定) | 不写运镜,只写角色动作/表情变化 | ★★★★★ |
| slow dolly in(缓推) | 镜头缓慢向前推近,[角色动作] | ★★★★★ |
| dolly out(拉远) | 镜头缓慢后退,[角色/环境揭示] | ★★★★★ |
| pan(横摇) | 镜头水平向[左/右]缓慢摇动 | ★★★★★ |
| tilt up/down(纵摇) | 镜头[上/下]摇 | ★★★★★ |
| track(侧跟) | 镜头与角色保持平行向[方向]移动 | ★★★★ |
| handheld(手持) | 镜头带与[脚步/心跳/呼吸]频率一致的震颤·必须指定节奏源 | ★★★★ |
| crane up/down(升降) | 镜头[上升/下降] | ★★★★ |
| orbital(环绕) | 镜头绕角色[顺/逆时针]弧形移动至[终止角度](≤180°,360° 出不来) | ★★★ |
| whip pan(甩镜) | 镜头快速横扫向[方向],约 0.3 秒完成,中间成运动模糊 | ★★★★ |
| rack focus A→B(变焦) | 焦点从[A·清晰]缓慢转移到[B·从模糊变清晰] | ★★★ |
加速度曲线(可选细化,不改运镜方向):ease-in→「起始缓慢逐渐加速」;ease-out→「起始迅速最后缓缓停下」;punch-stop→「瞬间高速[推/拉]然后突然停住」。
运镜多样性:连续 2 个以上镜头同一运镜 → 换一换,别全是缓推。
超能力预警:360° 环绕、精确希区柯克变焦这类,模型抽卡不稳——照给 + 多抽,或标注替代(如环绕降到 ≤180°),别默默降级成别的运镜。
焦点翻译表
| 焦点指令 | 提示词怎么写 |
|---|
| 深景深·全局 | 不写焦点(默认全清晰) |
| 锁定 [对象] | 加强该对象的细节描述(靠密度控制景别,见下) |
| 极浅·隔离 | 只写该物件细节,其他一律不描述 |
| rack focus A→B·缓慢 | 焦点从前景[A·清晰]缓慢转移到背景[B·从模糊变清晰],[A]同时变虚焦 |
| rack focus A→B·瞬间 | 焦点瞬间从[A]切到[B],[A]立刻虚焦 |
rack focus 三要素(缺一即被模型忽略):① 起点清晰的对象 ② 终点变清晰的对象 ③ 速度/快慢。
污染词铁律(最容易翻车的一处)
模型看到某个词就脑补整套刻板印象,即使被否定也不例外(写「不戴护士帽」照样把人放进医院;写「意识」直接生成大脑发光)。破解:只描述具体动作/姿态/物体,不用事件名或抽象概念。 写之前对照黑名单自查,命中即改。
| ❌ 污染词 | 模型脑补的坑 | ✅ 改成 |
|---|
| 意识 / 记忆 / 命运 等抽象概念 | 大脑发光、神经元放电等 | 具体物理表现(瞳孔收缩、手指无意识抽搐、屏幕波形变化) |
| 望向 / 注视 / 凝视 / 看向 | 强行出正脸(眼睛必须可见) | 身体朝向 + 视线所及物体的具体描述(见下表) |
| 背对 + 望向(叠加) | 模型妥协给一个侧身 | 拆成两条物理描述(背对怎么站 + 那个物体在哪) |
| 打游戏 / 驾驶 / 战斗 / 瞄准 等事件名 | 好莱坞刻板造型 | 拆成具体动作/姿态/操作的物体 |
| 深空 / 太空 | 彩色星云壁纸风 | 漆黑背景,冷白针点恒星,无星云无彩色天体,纯粹黑暗 |
抽象动作 → 视觉元素(视觉代偿)
模型没有世界模型,不理解「背对/望向/俯视/回眸」这类抽象动作,只会画「对应的具体视觉元素」凑数;两个抽象动作叠加时画一个两者都能凑到的妥协姿态。黄金法则:只描述画面能看到的东西。 抽象动作=身体朝向 + 头部方向 + 眼睛焦点。
| 抽象动作 | 翻成(视觉元素) |
|---|
| 背对镜头望向某物 | 角色背对镜头站立;画面对应方向出现该物体的具体描述 |
| 注视远处 / 凝视前方 | 身体朝某向,远景中呈现注视目标(具体物体) |
| 俯视地面 / 低头看物 | 头顶、肩膀、颈部、地面透视占据画面 |
| 回眸 | 侧身向右,头部左转,侧脸四分之三面向镜头 |
| 跟着她 / 追上去 | 背影占据前景(后背+发丝+肩线),身后环境向前展开(跟拍) |
| 望向窗外 | 角色朝窗户方向,窗外景物细节占据画面 |
用细节密度控制景别(模型对「特写/全景」这类抽象词识别不稳,改用「哪里写得多,注意力就去哪」):
| 想要的景别 | 就多写这些细节 |
|---|
| 特写面部 | 面部疤痕纹理 / 瞳孔 / 睫毛 / 皮肤毛孔 |
| 中近景上半身 | 服装肩章 / 徽章 / 领口 / 颈部线条 / 锁骨 |
| 全景 | 环境大尺度元素 + 人物作为小剪影 |
| 俯拍 | 头顶 / 肩膀 / 背部 / 地面透视 |
| 仰拍 | 下巴 / 颈部 / 服装下缘 / 天花板背景 |
| 推进 | 逐分镜递增主体细节(轮廓→徽章→面部→瞳孔) |
复合镜头模式(多 clip)
一段复杂镜头拆成硬切子镜头 C01 / C02 / C03,按事件发生顺序标识、不标秒数;每个 clip 一句话、一个核心动作,入画出画用方位词。什么时候拆:大幅姿态切换 / 位移 >1/3 画幅 / 场景状态变化 / >2 个离散动作 / 景别切换。
- OTS(过肩):
画面左前方一个人的右肩和后脑勺柔和虚焦占据画面 25%,形成自然框架。焦点在画面右侧的 B,面朝左前方,[表情]。浅景深,前景肩膀完全虚化。 只写 B 的动作/表情变化,前景过肩人物是静态构图元素、不写动作。
- 正反打:两个相邻 OTS 各写一段(镜1 焦点 B / 镜2 焦点 A),后期交替拼接。一致性硬规则:两张场景光线方向/色温一致;同一角色始终在画面同一侧(守 180° 轴线);背景一致。
- 建场 → 景别递进:建场用远景,写环境动态(灯光/粒子/舱门),角色不写;进入镜头用中景,以角色动作为主。
- 插入 + 反应:插入
极特写,[物件]占满画面。极浅景深,仅[物件]清晰,周围完全虚化。[微动态];反应写角色的物理反应(深吸一口气,瞳孔微缩,嘴唇缓缓抿紧,别写「表情变悲伤」)。
- rack focus + dolly in:两个变化写进一句
镜头缓慢向前推近,同时焦点从前景的手(清晰)缓慢转移到角色面部(从模糊变清晰),手逐渐虚焦。
- 鸟瞰:
俯拍鸟瞰视角,摄影机正上方垂直向下。[主体]在画面中央,[场景]四周展开。
- 倒影 / 镜面:
画面中央一面[反射面],其中映出[角色]的倒影。[倒影中的姿态/表情]。 只描述倒影、不描述本体。
前景层(告别塑料感)
i2v 默认画面「真空感」(无遮挡、无粒子,像塑料模型)。除极近特写外,最好带一层前景描述——但必须明写虚化,否则前景会和主体一样清晰、层次全丢。必须出现的词:失焦 / 虚化 / 严重散景 / 柔焦。
- 物理遮挡型:设备边缘 / 面板框 / 管线 / 栏杆 / 舷窗框 / 家具棱角 / 窗框(按场景选)。
- 氛围粒子型(i2v 在粒子上有专项优化,用好效果拔群):光束中尘埃 / 灰尘微粒 / 屏幕反射光斑 / 星尘颗粒 / 暖色微尘(回忆/梦境)/ 数据流光斑(界面)。
写法:前景(虚化):[物体/粒子 + 严重散景 + 光线]——用自然语言,不用尖括号标签。
收尾自检(写完扫一遍)
- 污染词:动作链有没有命中事件名/抽象概念?命中 → 换物理动作。
- 视觉代偿:背对/望向/凝视有没有翻成「身体朝向 + 头部方向 + 眼睛焦点」?
- 一个核心:读起来是不是所有细节都在说同一件事?像并列清单就重写。
- 只写动态:有没有重复参考图已锁的外观、混进情绪词/氛围词/音效?删掉。
- 强弱词配对:每个运动元素配一个强词(定义动作:下落/抬起/转头)+ 一个弱词(控制质感:极缓/轻微/克制)——缺强词模型不知做什么,缺弱词幅度失控。用肯定句排除(「肩颈几乎不动」)而非否定指令(不写「不要移动」)。