| name | story-to-realistic-video-prompt |
| description | 把一句话点子或一小段剧情扩写成中文真人电影感视频生成提示词(IMAX质感),默认15秒/2500字左右。五段结构输出,带时间段标注。适用于 Sora/Veo/可灵/即梦/Runway 等文生视频。 |
| argument-hint | 一句话点子或一小段剧情,可选 [素材名] =素材名 与【全局约束】 |
剧情转真人电影感视频提示词
核心目标
输入:一句话点子或一小段剧情。输出:一条可直接投喂视频模型的中文提示词,IMAX真人实拍质感。默认15秒,2500中文字符左右(2300-2700区间)。只输出提示词正文,不解释不写大纲。每个时间结点(【Xs-Ys】)必须按分镜时间评估(见下文)由每个节拍的真实时长估算得出,而非把15秒平均切分。生成后保存为工作区根目录 场景名-YYYYMMDD-HHMMSS.md。保存后用本skill目录下的 scripts/count_chars.py 验证字数是否达标,不达标则调整后重新保存。若评估总时长超过15秒,必须在提示词正文之后追加时长告警块(见输出文件结构)。
写作前静默提取(不向用户复述)
主体/地点/事件节拍/情绪/场景类型/全局约束/素材引用。缺主体或缺地点且无法推断时才提问。若工作区存在 assets/整体风格.md、assets/人物圣经.md、assets/场景圣经.md 则默认读取,不写进正文。优先级:用户要求 > 素材引用 > 圣经文件 > 本skill默认。
素材引用规则
- 提示词以素材引用行开头,格式固定为
[素材显示名] =素材标识,同一行用中文逗号分隔,固定顺序:主场景→人物→怪物→道具/语音。素材引用结束后必须换行,再进入下一段正文。
- 默认可用素材引用格式:
[邪恶洞窟] =洞窟, [野蛮人] = 野蛮人, [女巫] = 女巫, [亚马逊] = 亚马逊, [沉沦魔萨满] =沉沦魔萨满, [沉沦魔] =沉沦魔, [亚马逊语音] =亚马逊语音, [女巫语音] =女巫语音, [沉沦魔萨满语音] =沉沦魔萨满语音
- 有素材引用的主体/场景:正文中不描述外貌/服装/发型/建筑/空间结构,也不写"参考素材"等声明性废话。但必须写手中武器/道具(如"野蛮人双手各握一把手斧""女巫右手持法杖"),这是后续动作逻辑的前提。
- 有素材引用场景:只写本镜头的光线/天气/氛围动态,不复述空间结构。
- 未素材引用的主体:给3-5个外观锚点(出场即定义)。
- 同一素材引用形态的多个个体(如4只沉沦魔):只写个体间差异点(伤疤/体型/武器变体等)。
- 生成前静默核对素材引用中的手部占用、道具状态、服装约束、空间结构,确保动作不冲突。冲突时优先改写动作适配素材。
- 声音资产引用:
- 只引用"说话角色"的声音——本条提示词中有台词或出声(呼喊/惨叫/吟唱等)的角色,才在素材引用行末尾(道具之后)追加其声音资产,格式同其它素材:
[角色语音] =角色语音。
- 背景声、环境音、打斗/法术等音效不是资产,一律不引用,按「音频规则」写成普通文字。
- 镜头外(画面看不到)但有声音的角色也必须引用其声音资产——如画外呼喊、幕后说话者、远处嘶吼,只要音轨里能听到该角色的声音,就要在素材引用行声明其声音资产。
- 声音资产只出现在素材引用行;正文对白处直接写台词内容,不再重复标注语音引用。无说话角色时,不写任何声音资产。
音频规则
不写"语音参考""音色参考"等声明性废话——说话角色(含镜头外出声角色)的声音通过素材引用行的声音资产声明(见素材引用规则的「声音资产引用」),正文对白只写台词内容。提示词中只写:无字幕、无背景音乐 + 列举本场景具体音效。环境音、背景声、打斗/法术音效写成普通文字,不作资产引用;对白直接写台词内容。
五段输出结构
段间空行分隔,不加标题/编号:
- 素材引用行+约束:第一行写素材引用,如
[邪恶洞窟] =洞窟, [野蛮人] = 野蛮人, [女巫] = 女巫, [亚马逊] = 亚马逊, [沉沦魔萨满] =沉沦魔萨满, [沉沦魔] =沉沦魔, [亚马逊语音] =亚马逊语音, [女巫语音] =女巫语音, [沉沦魔萨满语音] =沉沦魔萨满语音;素材引用结束后换行,下一行写【用户约束】或直接进入全局规格。
- 全局规格+音频:画质+渲染+排除项+具体音效列举(1-2句)
- 基调情绪+场景环境:情绪一句 + 光线/天气/氛围动态(合为一段)
- 主体锚点:每个角色的位置/朝向/手中武器/动态状态。多个体只写差异点。
- 运镜+动作时间线+收尾:运镜总纲1-2句(交代起始机位、整体运动方式、景别走向),随后按
【Xs-Ys】 时间段推进(15秒分3-5段),每段内必须写明景别+运镜+动作+物理反馈+微表情同句绑定。每段的起止秒数不是平均切分,而是按「分镜时间评估」对该段核心节拍估算出的真实时长累加得出(详见下文)。
景别要求:每个时间段必须明确标注当前景别,从以下选取:
- 远景/大全景:交代环境全貌、人物与空间关系
- 全景:人物全身可见,展示身体动作与站位
- 中景:膝盖以上,展示肢体动作与互动关系
- 中近景:胸部以上,兼顾表情与上肢动作
- 近景/特写:面部或局部细节(表情、手部、武器、伤口反应等)
景别转换要有逻辑:远→近为揭示/聚焦,近→远为释放/全局交代。同一时间段内景别只写一个主景别(可含"推至""拉至"的动态变化)。
时间段格式:【0s-3s】中景,……【3s-7s】中近景推至近景,……【7s-12s】……【12s-15s】全景,……,段间自然连贯不换行。每段秒数由「分镜时间评估」累加得出,相邻段首尾相接、不留空隙、不重叠。
分镜时间评估(移植自 shotlist-builder)
核心思路:镜头时长不能凭感觉平均切分,而要由每个节拍「实际发生的内容」推算出固有时长。先逐节拍估时,再累加,最后对照15秒预算判断是否超时。
节拍时长基准表
按节拍类型给出真实银幕时长(中文台词按 4-5 字/秒 + 自然停顿换算):
| 节拍类型 | 估计时长 |
|---|
| 硬切闪现 / 瞬间空间定位(split-second 大全景/远景) | 0.3–0.5秒 |
| 插入 / 特写定格(道具、武器、伤口、表情瞬间) | 0.3–2秒 |
| 单个简单动作(一次挥击、一个转身、迈一步、抬手) | 1–2秒 |
| 一次完整攻击链(蓄力→命中→余波/受击反馈) | 2–4秒 |
| 一句台词(中长,含起话与收尾停顿) | 3–7秒 |
| 无台词反应镜头(带完整情绪弧) | 5–10秒 |
| 情绪特写完整弧(5–7个编号微表情节拍) | 8–15秒 |
估时方法(生成时静默执行)
- 拆节拍:把场景拆成离散节拍——一个核心动作、一句台词、一次反应、一个插入,各算一个节拍(呼应铁律「一个时间段一个核心动作」)。
- 逐拍估时:每个节拍对照基准表取一个时长。台词按字数折算(数清字数 ÷ 4–5 字/秒,再加 0.5–1 秒收尾停顿);动作按复杂度(单动作取下限,攻击链取中段);情绪弧按编号微表情节拍数(每个微表情节拍约 1–1.5 秒)。
- 累加定结点:从 0 开始顺序累加,得到每段的
【Xs-Ys】 真实起止秒数。结点是算出来的,不是凑出来的。
- 对照预算:
- 累计 ≤15 秒:正常输出,时间结点止于
【…-15s】 或更早。
- 累计 >15 秒:优先压缩——删次要节拍、合并同类动作、把过长的情绪弧缩短微表情节拍数、把独立插入并进相邻段;能压回 15 秒内最好。
- 压缩后仍 >15 秒(内容确实装不下):保留真实结点(末段可写到
【15s-Xs】),并在正文后追加「时长告警」块,说明超时原因。
取舍优先级(压缩时)
删减顺序:装饰性插入 > 重复的余波镜头 > 多余的反应停顿 > 次要角色的并行动作。绝不删:核心动作的命中帧、因果关键节拍、收尾全景。宁可少节拍、短弧,也不要把一条提示词塞爆——多出来的内容应建议拆成下一条提示词。
铁律
- 一个时间段一个核心动作,动作多就拆时间段。
- 运镜与动作同句绑定:每个时间段内镜头行为与角色动作写在一起。
- 出场即定义:角色首次出现写清位置+手中武器+动态状态。
- 删元指令:不写"强化氛围""务必""拉满"等不可成像的废话。
- 去重复形容词:同义词只留一个最准的。
- 只写视觉可见/听觉可闻:一切描述必须能在画面上看到或在音轨中听到。气味/味觉/内心独白等不可成像信息,必须转化为角色的可见反应(表情、肢体、动作)。例:不写"烤鸡很香",写"角色仰头闭眼深吸一口气,喉结上下滑动"。
多人打斗规则
- 每个时间段只聚焦一组对决:如A对D和E,则画面只有A、D、E。不同时间段可切换聚焦。
- 一对多时非交战对手不能傻站:必须有并行动作(爬起/绕侧翼/蓄力/冲来),为下个节拍铺垫威胁。
- 打斗结束必给收尾全景:最后时间段后拉/俯拍,同时展示所有参战者最终状态(胜方站姿+败方倒地+战场痕迹)。
暴力尺度
保持动作电影级暴力感,禁止:断肢、大量鲜血喷涌、内脏外露、详细出血描写。替代手段:力量反馈(击退/击飞)、声音暗示(闷响/钝响)、姿态暗示(瘫倒/痉挛/武器脱手)、环境碎片(泥水/碎石/尘土)、镜头回避(切到表情/武器特写)。
场景类型→节奏路由
- 动作类:蓄势慢→命中快→余波慢,每时间段聚焦一个攻击主体。
- 叙事类:跟拍/并行/缓推,靠雨雾火风承载氛围。
- 对话类:过肩+反应特写表现权力转移。
- 混合类:类型切换要有可见过渡。
连续性自检(静默执行)
- 空间:谁在正/背/高/低/远,攻击路径与视线方向合理。
- 物理:抛出物体会落下,受击有反馈,无瞬移无凭空新姿态。
- 因果:高潮由前面动作推动,不突兀出现。
- 群像多个体:素材引用同形态则只写差异点;未素材引用则体型/装备/伤痕要有辨识度。
- 时长:逐节拍估时累加,结点首尾相接无空隙;累计 >15 秒时已尝试压缩,仍超则末段保留真实秒数并触发「时长告警」块。
- 声音资产:正文里每个有台词/出声的角色(含镜头外出声角色)都在素材引用行声明了声音资产,且无缺漏;非说话角色、环境音、音效均未被错误地引用为声音资产。
密度控制
字数预算花在:动作物理因果、运镜、微表情、动作触发的环境反馈。不花在:素材形象复述、声明废话、重复形容词。每句必须新增可见信息。
负面约束
禁止:动漫/卡通感、塑料/AI感、无身体表现的抽象情绪、同时间段矛盾的光线或镜头方向、过多无名新增角色、不可成像的元指令。
输出文件结构
仅当评估总时长 >15秒 时,在「提示词」正文之后、「角色位置时间线」之前插入「时长告警」块;≤15秒时整块省略。
# 提示词
(五段结构正文,2500字左右)
---
# ⚠️ 时长告警
预计总时长 **约 X 秒**,超出 15 秒上限约 Y 秒。
逐段估时:
- 【As-Bs】<节拍简述>:约 N1 秒(<超时贡献点,如台词约18字≈4秒、攻击链含蓄力+命中+余波≈4秒>)
- 【Bs-Cs】<节拍简述>:约 N2 秒(……)
- …
主要超时来源:<点名是哪一/几段、各占多少秒导致累计超15s>。
压缩建议:<具体建议,如删去某装饰插入省X秒 / 把末段反应弧移到下一条提示词>。
---
# 角色位置时间线
| 时间点 | 角色A | 角色B | 角色C | 敌人 |
|--------|-------|-------|-------|------|
| 开场(0s)| 位置,朝向 | 位置,朝向 | 位置,朝向 | 位置 |
| 事件1(~Xs)| 动态 | 动态 | 动态 | 动态 |
| 结尾(~15s)| 最终状态 | 最终状态 | 最终状态 | 最终状态 |
位置用相对空间关系描述("路中央""身后半步""左前方3米"),朝向写清楚,未移动写"原地"。