| name | video-prompt-director |
| description | 视频生成提示词导演技能。用于把剧情、镜头组或场景段落转成简洁、可视、可听、可执行的视频提示词,控制人物绑定、动作节拍、台词时机、镜头运动、时长容量、参考图适配和生成风险。 |
| version | 1.0.0 |
| author | Hermes Agent |
| license | MIT |
| metadata | {"hermes":{"tags":["video-prompts","directing","ai-video","shot-design","continuity"],"related_skills":["script-to-shot-table","image-art-direction","creative-production-pipeline"]}} |
视频提示词导演
目标
把提示词写成可执行的导演指令,不写成小说。保留用户意图,同时减少歧义、事件过载、人物身份混乱和模型误解。
适用于视频生成模型、Director 类工具、图生视频、文生视频、镜头组转视频、短片片段提示词等场景。
核心原则
- 场景先行。 先写时间、地点、可见环境,再写人物、动作、镜头和声音。
- 只写能看见或听见的内容。 删除文学性心理、抽象气氛和不可视指令。
- 一个短片段只承载有限动作。 动作过载会造成跳切、错位、身份漂移或结尾不清。
- 镜头组优先。 先把故事整理成一个可生成的视频段落,再写提示词;不要把每个单镜头都当成独立生成任务。
- 参考图必须实际检查。 不看文件名直接绑定参考图,会导致画质、景别、风格或人物错误。
- 每个可见人物只绑定清楚一次。 不在同一提示词里反复切换同一人物的不同参考图。
- 台词必须写具体内容和时机。 用户要求某语言或某句台词时,不能只写“他说话”。
- 不要用负面补丁掩盖结构问题。 先简化镜头和人物绑定,再考虑少量避免项。
- 未经用户明确要求,不提交生成任务。 默认交付提示词或生成计划。
执行流程
-
拆解导演意图
- 判断片段要传达的是世界建立、人物生活、动作推进、冲突前兆、情绪转折、产品卖点、氛围展示或其他目标。
- 完成标准:能用一句话说明本片段的戏剧任务。
-
确认镜头覆盖
- 哪些信息由远景/全景建立,哪些由中景、近景、特写、行动镜头或生活镜头承担。
- 不要让宏大世界观自动变成全片只有大全景。
- 完成标准:镜头景别服务镜头组的叙事任务,而不是只追求宏大或逐镜头完整。
-
检查参考图
- 实际打开候选图,判断画面内容、景别、人物活动、清晰度和画风。
- 参考图不足时,先列出缺口;需要补图时先写补图计划或提示词,不硬绑定。
- 完成标准:每张参考图都有明确用途:身份、服装、场景、动作、构图、情绪或风格。
-
控制时长容量
- 4 秒:一个动作节拍,最多一句很短台词。
- 6 秒:一个动作节拍加一到两句短对白。
- 8 秒:两到三个简单节拍。
- 10-12 秒:三到四个连续节拍,最多包含一句短台词。
- 15 秒:四到五个连续节拍;复杂多地点动作仍需拆分。
- 完成标准:动作节拍不超过时长承载能力。
-
写提示词
- 顺序:时间地点环境 → 人物位置关系 → 连续动作/表演 → 台词和说话时机 → 有动机的镜头运动 → 结束画面 → 视觉风格 → 声音与字幕。
- 完成标准:每句话都能被画面或声音验证。
-
诊断风险
- 人物重复、人物数量不准、跳切、动作过载、参考图不够、台词缺时机、镜头指令冲突、声音需求不清。
紧凑模板
单个镜头组:
【时间、地点、可见环境】。【人物(参考图)的位置与关系】。【本镜头组的连续动作节拍】。人物在【时机】用【语言】说:“【具体台词】”。镜头从【起始画面】推进到【结束画面】。【视觉风格】。【声音与字幕要求】。
与当前镜头无关的字段直接省略。不要为了填满模板而扩写提示词。
蒙太奇:
镜头1:【时间、地点、可见环境】。【单一动作或信息点】。镜头【运动或构图】,停在【结束画面】。镜头2:【时间、地点、可见环境】。【单一动作或信息点】。镜头【运动或构图】,停在【结束画面】。整体为【视觉风格】。【声音与字幕要求】。
蒙太奇每个镜头应只有一个清楚任务。若不同镜头不在同一时空,必须说明它们是独立镜头,不要写成一次连续空间移动。
参考图绑定规则
- 每个具名人物选择一张主要参考图。
- 多张图属于同一人物时,只说明一次,并为当前镜头选择最适合的一张。
- 大全景、城市建立镜头、环境镜头,通常只绑定一张主场景参考图。
- 背景人物不重要时,优先不写或使用画外音。
- 候选参考图画质差、主体不清、风格不统一或无法支撑镜头时,先报告并替换,不硬用。
台词与声音
台词写法:
她退到柱子后,喘息着用日语说:“弾がない。”
旁白写法:
低沉、克制的成熟男声旁白,用中文缓慢说:“……”
规则:
- 台词紧跟触发它的动作。
- 必须写明说话者、语言、具体台词和时机。
- 如果启用声音,明确人物语音、旁白音色、环境声或动作声。
- 不要默认加入配乐、BGM 或主题曲;除非用户明确要求音乐。
- 用户要求字幕时写字幕;否则不要默认承诺字幕。
常见反模式
- 小说式心理:
她略显疲惫,内心警觉。
- 模糊视觉:
氛围高级,命运感强。
- 负面补丁:
全程无跳切,无重复人物,无克隆。
- 单镜头碎化:把一个镜头组拆成多个互不连贯的短 prompt,导致剪辑跳断和角色漂移。
- 动作过载:一个 6 秒片段里写追逐、打斗、换武器、说两句台词和爆炸。
- 参考图混乱:同一人物在提示词里交替绑定图1、图2、图3。
- 台词不落地:只写“说日语”,不给台词内容和时机。
交付前检查