| name | fuke |
| description | Reverse-engineer reference videos into high-fidelity AI video prompts, especially for 即梦全能参考 and Seedance 2.0. Use when the user asks to 复刻视频、反推视频提示词、拆解分镜、把产品图引用进参考视频、校准原视频口播,或要求按时间输出镜头描写、场景、动作、口播、表情和情绪。 |
视频复刻提示词
核心原则
把“复刻原视频”设为最高目标。以实际视频画面为主要事实来源,逐镜还原场景、人物、产品呈现、包装、道具、构图、动作、运镜、光线、文字和剪辑节奏。
把用户提供的产品图作为产品身份与跨镜头一致性锚点。使用 @图片1 引用,但不要让参考图的白底、盘子、拍摄角度或静物构图进入视频,也不要借产品图擅自改写原视频的产品状态、份量、配料和展示方式。
把用户提供的口播、商品名、重量、价格及促销信息视为最高优先级的文字事实。它们覆盖根据画面或音频作出的推测。修正后彻底删除旧内容,不要让错误名称或数值以“禁止出现……”的方式残留在最终提示词中。
默认只输出纯文本。不使用表格、代码块或附件,除非用户明确要求。
工作流程
1. 收集输入
确认并读取:
- 参考视频文件;
- 产品参考图;
- 用户提供的原口播或字幕;
- 目标模型、生成时长和画幅;
- 用户指定的输出字段。
没有口播文本时,不把根据画面创作的文案冒充逐字转录。应明确它是“按画面节奏反推的口播”。用户随后提供原口播时,重新匹配全部分镜并清除旧文案。
2. 读取视频事实
先读取时长、画幅、分辨率、帧率和音轨信息,再分析画面。不要只看封面或少量截图。
优先使用 scripts/extract_video_reference.py 生成:
- 每秒关键帧;
- 每半秒关键帧接触表;
- 场景变化候选时间;
- 低码率音轨预览;
- 媒体元数据。
示例:
python scripts/extract_video_reference.py "E:\\视\\5.mp4" --output "<workspace>\\video-analysis"
脚本会先寻找系统 FFmpeg,再寻找剪映随附的 FFmpeg。若自动定位失败,使用 --ffmpeg <完整路径>。
3. 建立逐镜时间线
结合每秒帧、每半秒帧和切点附近的原尺寸帧,记录:
- 镜头开始与结束时间;
- 景别、机位、角度、主体占比和焦点;
- 推进、跟随、手持、固定或俯拍等运镜;
- 人物、产品、包装和道具在画面中的位置;
- 动作开始、动作高潮和镜头收尾;
- 产品在盆中、夹起、装袋、称重、翻拌、配餐等状态;
- 屏幕文字、价格、重量和促销信息;
- 硬切或其他真实转场。
用户要求时间只有整数时,把切点整理为整数秒,但仍用原始帧判断动作归属,不要因取整而调换动作顺序。
4. 分析产品图
提取产品的稳定视觉特征:主色、辅色、颗粒大小、切法、纤维、湿润度、光泽、酱汁和可见配料。
让视频决定产品如何被展示,让 @图片1 保证每个镜头出现的是同一产品。保持原视频中的堆放量、包装方式、工具互动和食用搭配。
若视频、图片和用户文字出现冲突,按以下顺序处理:
- 用户明确更正的文字事实;
- 原视频可见事实;
- 产品图的身份与纹理;
- 模型自行推断。
不要在最终提示词中讨论冲突过程,只保留最终正确版本。
5. 对齐口播
逐句保留用户提供的原文,不擅自同义改写、添加卖点或替换商品名。
按语义把句子放入对应镜头:
- 降价、品质、份量:整盆展示或夹起特写;
- 正规包装、克重:装袋或称重;
- 辣味、香气、混合后食欲:翻拌、淋汁或食物微距;
- 米饭、拉面等搭配:配餐镜头;
- 库存和购买提醒:包装展示收尾。
检查每句能否在分配秒数内自然说完。若原片本身是高速口播,描述“快速但清晰的日语口播”,不要删词。若必须调整,优先移动分镜边界,不修改用户确认的原文。
6. 编写全局一致性提示词
只保留典型且真正跨镜头的内容:
- 视频规格和整体实拍风格;
- 复刻原视频的核心目标;
@图片1 的产品身份与跨镜头一致性;
- 人物造型连续性;
- 场景、包装和主要道具连续性;
- 运镜与剪辑风格;
- 原视频固定文字;
- 必要的生成缺陷限制。
不要把每个镜头的具体动作塞进全局提示词。
7. 编写每个分镜
严格使用以下字段和顺序:
分镜编号:01(0—4秒)
镜头描写:
场景设定:
画面与动作描述:
对应口播:
表情和情绪描述:
镜头描写必须写清景别、机位高度、拍摄角度、构图、主体占比、运镜、焦点变化和切换方式,不能只写“近景”或“特写”。
场景设定只写该镜头实际可见的空间、光线、背景和道具位置,不补充原视频没有的装饰。
画面与动作描述按时间顺序写动作:起始姿势、工具如何接触产品、运动方向、动作高潮、自然物理反馈和结束画面。
对应口播只放该镜头真实对应的原句。不要附加替代版本、旧版本或与口播冲突的卖点。
表情和情绪描述必须具体写眼神方向、眉毛、眼睛、嘴部、头部、视线切换、手部节奏以及它们与口播节点的同步关系。人物不露脸时明确写“人物面部不入镜”,再用手部节奏和动作力度表达情绪。
8. 输出前强制复查
必须逐项检查:
- 镜头描写是否能让模型重建原视频的机位、构图和运镜;
- 口播是否逐字使用最终确认版本,并放在语义匹配的镜头;
- 表情和情绪是否具体、可表演、与口播同步;
- 产品是否在所有镜头保持同一身份和视觉特征;
- 产品数量、包装、配餐和工具是否复刻原视频;
- 时间是否覆盖完整视频且无重叠、无遗漏;
- 旧的错误商品名、重量、价格和文案是否已从所有位置彻底删除;
- 输出是否为用户要求的纯文本格式。
提交前必须阅读 references/pitfalls.md,并按其中清单再检查一次。
输出要求
先输出“全局一致性提示词”,再按时间顺序输出全部分镜。直接给出最终可复制提示词,不解释分析过程,不给多个候选版本,不保留修订痕迹。