| name | director.sound |
| description | 声音设计知识——环境音/音效/配乐情绪/沉默设计/听觉记号(leitmotif)/声画对位,仅供叙事规划与后期剪辑参考;⚠️视频生成提示词不含音频,这些内容不写进 shot 的 prompt,是给 Nomi 时间轴后期配音/配乐用的。 |
声音设计知识(叙事规划 + 后期参考)
先读这一条:这套知识不写进视频提示词
视频生成模型的提示词不含音频——环境音、音效、配乐、台词都不在画面模型的能力范围里,写进去要么被忽略、要么污染画面。所以这个技能的产出绝不写进 shot 的 prompt。
它服务两个阶段:
- 叙事规划阶段:给角色建声音标签、给场景设声音签名、规划听觉记号,作为一层薄薄的「听觉设计意图」跟着分镜走。它是规划时的参考,不是要塞进任何生成字段。
- Nomi 时间轴后期阶段:等画面生成好、进了 Nomi 时间轴,用于音频轨的后期配音 / 音效 / 配乐规划——按这套方法给每段画面配底层环境声、中层间歇声、前层动作音效,选配 BGM 情绪曲线。
核心理念:观众闭上眼睛也应该能「听出」这是哪个场景、谁在说话、现在是什么情绪。 声音不是画面的附属品,是独立的叙事层。
角色声音标签
给每个主要角色一套声音标签,作为规划参考、后期配音时照它统一。四个维度:
- 说话节奏 — 语速(快/中/慢/极慢);停顿习惯(频繁停顿/流利不停/关键词前停顿);句长(短句 ≤5 字 / 中句 / 一口气长句)。
- 声线特征 — 音高(低沉/中等/偏高);质感(沙哑/清亮/鼻音重/气声);力度(轻声/正常/有力/压着嗓子)。
- 情绪表达方式 — 外放型(生气会吼、开心笑出声)/ 内收型(生气压低音量、开心只语调微升)/ 极端内收(任何情绪几乎不改变声线)。
- 标志性声音习惯 — 说话前清嗓、句尾叹气、思考时「嗯」的鼻音等。小习惯给角色「声音辨识度」。
记录格式示例(全片保持一致):
| 角色 | 语速 | 句长 | 声线 | 情绪表达 | 标志习惯 |
|---|
| 角色A | 中偏快 | 短句 | 平板单调 | 极端内收 | 说完话后沉默·语气几乎无起伏 |
| 角色B | 慢 | ≤5 字 | 低沉厚重 | 内收 | 句尾带鼻音哼声 |
环境音层次设计
每个场景的声音由三层构成,从远到近:
底层(Ambience / Room Tone) — 持续不变的背景声,定义「这是什么空间」,同一场景全程一致。例:
- 走廊:引擎/管线低频嗡鸣 + 远处液冷循环声
- 舰桥/机房:多终端低频电子嗡声 + 空调系统低鸣
- 静室/卧室:远处设备极弱低鸣 + 空气循环微弱气流声
- 户外空旷 / 深空:接近或完全寂静——寂静本身就是空间的声音签名
中层(Specific Sounds) — 间歇出现,增加真实感:广播通知、远处脚步、门的开合、杯子落桌、设备蜂鸣。
前层(Foreground / Action Sounds) — 角色动作产生、与画面动作精确同步:脚步声(不同材质地面声音不同)、呼吸声(平静/急促/屏气)、操作声(按钮/触屏/翻页/拉杆)。
场景声音签名
给每个场景定义一个声音签名——一听就知道「到了这里」。在角色第一次进入该场景时建立,后续每次回到都保持一致:
| 场景 | 底层 | 特征音 | 情绪感受 |
|---|
| 舰桥/机房 | 引擎低鸣 + 终端嗡声 | 键盘敲击、投影嗞嗞声 | 冷静有序的技术空间 |
| 医护/维生区 | 循环泵脉冲 + 密封吱呀 | 偶尔气泡上升、辅助设备嘶嘶 | 令人不安的安静·机械维生感 |
| 主角独处的房间 | 远处低鸣 | 空气循环微弱气流 | 独处的安全感·极简 |
听觉记号(Sound Motif / Leitmotif)
一个反复出现的声音元素,每次出现承载不同含义——和视觉母题(反复出现的物件)是同一逻辑。
设计原则:
- 一部作品 2-3 个听觉记号就够,太多失去辨识度。
- 首次出现要足够清晰,让观众「记住」这个声音。
- 后续出现可变形(速度变化、混响变化、叠加其他声音)。
- 最后一次出现应有「回收」感——回到最初形态,或彻底变形。
示例:
- 某段引擎启动声:第一次 = 任务开始;中段 = 逃离;结尾 = 归途。
- 某段循环水声:初到 = 陌生不适;适应期 = 平静背景;危机期 = 戛然而止。
硬规则:听觉记号限定在声效层(环境声/机械声/自然声/角色签名声),不包括音乐旋律——旋律属于后期配乐工序。
配乐(BGM)情绪
BGM 是后期独立工序,不在任何视频生成环节。规划时只需给出情绪曲线(哪段紧张、哪段舒缓、哪段留白),到 Nomi 时间轴后期按曲线选配或整段留白:
| 情绪段落 | 配乐倾向 | 常见手法 |
|---|
| 开场/铺垫 | 克制、留白 | 少量氛围垫底,或纯环境声无 BGM |
| 推进/悬疑 | 低频脉动、渐强 | 持续低音 + 逐渐加密的节奏 |
| 高潮/爆发 | 满配、强节奏 | 打击乐/弦乐齐上,与硬同步音效叠 |
| 收尾/落点 | 回收主题、渐弱 | 呼应开场动机,留一段安静收束 |
声画同步
- 硬同步(Hard Sync) — 声音与动作精确对齐(拳到的瞬间听到撞击)。用于动作、打击、爆炸、门的开合、物体碰撞。
- 软同步(Soft Sync) — 情绪上匹配、不精确到帧。用于环境音随场景渐变、音乐跟随情绪起伏。
- 反向同步(Counter Sync) — 声音与画面情绪相反(画面暴力但声音安静,或画面安静但声音紧张)。制造不安、讽刺、超现实感——极强的叙事工具,慎用。
沉默的使用:突然的寂静比任何声音都更有力量。用在震惊、顿悟、死亡、时间凝固。原则:寂静之前必须有声音(有对比才有效果),持续一般不超过 2-3 秒。
后期配音描述(给 Nomi 时间轴音频轨用,不写进生成提示词)
进了 Nomi 时间轴后,按三层给每段画面写配音说明:
底层:[场景声音签名的底层描述]
环境:[中层间歇声音]
动作音效:[前层动作声音,与画面动作对应]
示例:
底层:走廊的引擎持续低频嗡鸣,管线液冷循环声若隐若现。
环境:远处偶尔传来门开合的沉闷声,走廊尽头有人说话的模糊回响。
动作音效:角色A靴子踩金属地板的均匀脚步声——每步间隔约一秒。
一句话收束
- 声音标签 / 场景签名 / 听觉记号都是规划参考 + 后期指导,全片保持一致,不进视频提示词。
- 场景签名在首次出现该场景时建立;听觉记号与视觉母题并列规划。
- BGM 是后期独立工序,规划只给情绪曲线,落地在 Nomi 时间轴的音频轨。
- AI 视频生成对声音控制力有限——精确的声音设计更多是给 Nomi 后期的指导。