| name | media-guard |
| description | 视频/图片生成强制确认流程(v3.0 双层问卷确认)。触发关键词:生成视频、做个视频、制作视频、生成海报、做个图、生成广告图、拍个视频。
检测到触发词后强制执行渐进式选择题(视频12步 + 图片9步),包含文化合规审查、场景方案组装、时间渐进规划。
|
| user-invocable | false |
Media Guard — 视频/图片生成强制确认技能
铁律:检测到用户要求"生成/制作/创建"视频或图片时,必须弹渐进式多轮选择题。
铁律:用户只是问文字问题(如"视频怎么做""海报策略""广告分析")时,正常回答,不弹选择题。
铁律:所有选项必须根据用户原始提问动态生成,不可套用死板模板。
触发 vs 不触发
✅ 触发 — 必须弹选择题
用户要求实际产出媒体文件:
生成视频 做个视频 制作视频 创建视频 拍个视频 做一个视频 搞个视频
生成海报 做个图 做张图 生成一张图 生成图片 做个广告图 制作海报
生成广告片 做个广告片
❌ 不触发 — 正常文字回答
咨询/分析/策略类问题,不弹选择题:
"视频广告怎么做" "阿联酋视频营销策略" "海报设计要注意什么"
"推荐什么视频风格" "视频多长合适" "图片用什么色调"
一句话判断:用户要的是文字方案还是媒体文件?
渐进式确认流程(视频:12步 + 双重问卷确认)
Q1 必须当场作答(无「暂不确定」):Q1 的语言选择决定后续所有问答的呈现语言,不能跳过。
Q2-Q7 每个问题均包含「暂不确定,稍后选择 ⏸」选项。选择暂不确定后,系统记录为"待定",在进入Q8场景组装前统一回退补选并完成第一层问卷确认。
双重确认机制:Q2-Q7 基本参数确认 → Q8 场景组装 → Q9-Q11 场景细节确认 → Q12 最终确认。
用户原始提问(如"帮阿联酋银行做一个AI机器人客服的宣传视频")
│
▼
┌──────────────────────────────┐
│ Q1: 语言选择 (固定,必问) │ ← 题干三语,选项各自单语,无「暂不确定」
│ 中文 / English / العربية │ 必须当场作答(后续问答语言基础)
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q2: 目标用户群体(固定,必问)│ ← 含「暂不确定 ⏸」;**无专家定⭐**
│ 动态生成受众选项 │ (用户自行决定目标受众)
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q3: 是否出现人物? │ ← 含「暂不确定 ⏸」+ 动态说明
│ 要 / 不要 / 专家定 ⭐ │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q4: 是否出现地标/建筑? │ ← 含「暂不确定 ⏸」+ 动态说明
│ 要 / 不要 / 专家定 ⭐ │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ ⚠️ Q5: 文化冲突预警 │ ← 含「暂不确定 ⏸」
│ 逐条列出潜在风险+解释+建议 │
│ [继续] [回退修改] │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q6: 人物细节 (Q3=要时必问) │ ← 含「暂不确定 ⏸」+ 动态生成
│ 4个选项 + 专家定 ⭐ │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q7: 地标/场景细节 (Q4=要时) │ ← 含「暂不确定 ⏸」+ 动态生成
│ 4个选项 + 专家定 ⭐ │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ 🔄 回退检查:是否有暂不确定项? │ ← Q7之后强制执行
│ 有 → 逐条回退补选 │ 补选完成后,再次检查
│ 无 → 继续 │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ ✅ 问卷确认 ①:Q2-Q7 基本参数 │ ← 罗列Q2-Q7所有最终选择
│ 完整摘要表格(不含Q1语言) │ 允许逐项修改 / 全部确认
│ 确认通过 → 进入Q8场景组装 │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q8: 场景方案组装 ⭐ │ ← 根据Q1-Q7所有已确认项,推演
│ 4个完整场景描述 + 1个自定义输入 │ 4个实际可行的完整场景方案
│ 每个方案串联所有选定元素 │
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ Q9: 生成段数(5秒拆分) │ ← 根据场景复杂度动态定范围
│ 每段=1个5秒视频片段 │ 纵横比子项
│ (复杂≥3段15秒,简单可1段) │
└──────────────┬───────────────┘
│
┌──────┴──────┐
▼ ▼
有室外/有窗场景 纯室内无窗场景
│ │
▼ ▼
┌──────────────┐ 跳过Q10/Q11
│ Q10: 单片段时间切换?│ 直接进入
│ 要 / 不要 / 专家定⭐ │ Q12问卷确认
└──────┬───────┘
▼
┌──────────────────────────────┐
│ Q11: 时间渐进建议 │ ← ⚠️ 先展示时间轴可视化 → 再出5个建议
│ ① 强制:12档时间轴可视化 │ ② 5个渐进序列建议 + 1个可编辑自定义
└──────────────┬───────────────┘
▼
┌──────────────────────────────┐
│ ✅ Q12: 问卷确认 ②(最终) │ ← 罗列Q8-Q11所有场景/段数/时间选择
│ Q8场景方案 + Q9段数/纵横比 │ 允许逐项修改 / 全部确认通过
│ + Q10+Q11时间序列(如有) │
└──────────────┬───────────────┘
▼
┌──────────────────────────────────────┐
│ ⚠️ 跨片段视觉连续性规则(强制执行) │
│ 时间轴规划表 → 时间单调递进 → 世界一致 │
│ → 合规自检清单 → 开始生成 │
└──────────────────────────────────────┘
渐进式确认流程(图片/海报:9步 + 语言多选)
Q1 必须当场作答(题干三语,选项单语,无「暂不确定」)。Q1.5 海报语言多选。Q2-Q4 每个问题均包含「暂不确定,稍后选择 ⏸」选项。
Q1: 对话语言 → Q1.5: 海报上呈现哪些语言?(多选)
→ Q2: 目标用户群体 → Q3: 是否出现人物 → Q4: 是否出现地标/建筑
→ ⚠️ Q5: 文化冲突预警 → 🔄 回退检查(补选暂不确定项)
→ Q6: 场景方案组装(4场景+1自定义)→ Q7: 问卷确认 → Q8: 尺寸/格式
图片跳过人物细节、地标细节、段数、时间渐进(不需要)。
Q1.5: 海报上呈现哪些语言?(多选,Q1之后立即执行)
Q1 决定对话/互动语言,Q1.5 决定海报画面上出现哪些语言的文字。两者独立,不可混淆。
设计原则:阿联酋是多语言市场(阿拉伯语为官方语言,英语广泛通用,中文面向华人社群)。海报文字组合直接影响品牌定位和受众触达。
固定选项结构(多选,至少选一项):
| # | 选项 | 含义 |
|---|
| 1 | 🇨🇳 中文 | 海报上出现中文标题/文案 |
| 2 | 🇸🇦 العربية | 海报上出现阿拉伯语标题/文案(右到左排版,需 arabic-reshaper + bidi 处理) |
| 3 | 🇬🇧 English | 海报上出现英文标题/文案 |
默认组合建议(由专家推荐,但用户可自由选择):
- 中国品牌出海阿联酋 → 中文 + 阿拉伯语(本地信任 + 中国源头)
- 面向全市场 → 阿拉伯语 + 英语(覆盖本地+外籍)
- 仅中文社群渠道 → 仅中文
Q1.5 无「暂不确定 ⏸」(必须当场确认,因为直接影响后续Q6场景方案中文字排布的视觉规划)。
Q1.5 无「专家定 ⭐」(海报语言是品牌决策,由用户自行决定)。
⚠️ 技术约束:阿拉伯语文字必须通过代码叠加(AI 图像生成器无法正确渲染阿拉伯文)。实际做法:AI 生图(不含任何文字)→ Python Pillow + arabic-reshaper + python-bidi 在指定区域叠加正确文字。详见 uae-edtech-poster-design 技能。
各步骤详解
Q1: 语言选择(固定,必问)
| 语言 | 后续所有问题、选项、地标均用此语言 |
|---|
| 🇨🇳 中文 | 迪拜塔、帆船酒店、大清真寺、棕榈岛、白袍、黑袍、阿联酋身份证 |
| 🇬🇧 English | Burj Khalifa, Burj Al Arab, Grand Mosque, Kandura, Abaya, Emirates ID |
| 🇦🇪 العربية | برج خليفة، برج العرب، المسجد الكبير، نخلة جميرا، بطاقة الهوية الإماراتية |
三语题干 + 单语选项(强制):Q1 是后续所有问答的语言基础。问题题干(header) 必须同时用中文、English、العربية 三语呈现,确保只会其中一种语言的用户也能看懂问题。但每个选项只用自己语言的文字——选中文就看中文按钮,选English就看English按钮,选العربية就看العربية按钮。
必须当场作答,无「暂不确定」:如果 Q1 跳过,Q2 该用什么语言提问无从确定。因此 Q1 不设「暂不确定 ⏸」选项。
Q1 无「专家定⭐」(语言由用户自行决定)。
AskUserQuestion 选项(按顺序,每个选项只用自身语言):
| # | label | 描述 |
|---|
| 1 | 中文 | 迪拜塔、帆船酒店、大清真寺 —— 白袍、黑袍 |
| 2 | English | Burj Khalifa, Burj Al Arab, Grand Mosque — Kandura, Abaya |
| 3 | العربية | برج خليفة، برج العرب، المسجد الكبير — كندورة، عباية |
⚠️ 关键规则:问题题干(header)用三语:请选择对话语言 / Select conversation language / اختر لغة المحادثة。选项 label 只用自身语言,不混入其他语言。
Q2: 目标用户群体(固定,必问)
设计原则:明确视频/图片面向的核心受众群体。受众决定了后续所有场景设计、人物选择、地标选择的基调和侧重。
动态生成逻辑:
| 用户问题场景 | 受众选项生成思路 |
|---|
| AI/科技产品 | 阿联酋本地企业B端客户 / 外籍企业高管 / 政府决策层 / 消费者大众 |
| 银行/金融 | 本地高净值客户 / 外籍商务人士 / 年轻白领 / 家庭客户 |
| 旅游/酒店 | 中国出境游客 / 海湾本地游客 / 欧洲游客 / 商务旅客 |
| 零售/电商 | 年轻消费者 / 家庭购物者 / 外籍社群 / 本地居民 |
| 政府服务 | 本地市民 / 政府公务员 / 外籍居民 / 企业客户 |
固定输出模板:
Q2: 这个视频主要面向哪类用户群体?
选项(根据用户问题动态生成,每项附简短说明。Q2 无专家定⭐,用户自行决定。暂不确定排在最后一个预定义选项之后):
1. {动态选项1} — {场景化的简短描述}
2. {动态选项2} — {场景化的简短描述}
3. {动态选项3} — {场景化的简短描述}
4. 暂不确定,稍后选择 ⏸ — 回退检查时补选
Q3: 是否出现人物?(动态说明+选项)
设计原则:不是机械地问"要人物吗",而是结合用户原始问题给出一句上下文说明。
示例:
- 用户问AI机器人 → "这个宣传视频要不要出现使用AI服务的真人用户,展示他们和机器人交互?"
- 用户问银行App → "画面中要不要出现正在使用手机银行的真实人物?"
- 用户问旅游景点 → "要不要出现游客的身影?"
固定选项结构:
| 选项 | 含义 |
|---|
| 要,出现人物 | 继续Q6细选人物类型 |
| 不要人物 | 跳过Q6,纯场景/产品展示 |
| 由阿联酋市场专家来定 ⭐ | 根据用户问题场景自动推荐 |
| 暂不确定,稍后选择 ⏸ | 排在专家定之后、自定义输入之前,回退补选 |
Q4: 是否出现地标/建筑?(动态说明+选项)
设计原则:结合用户问题和Q3答案给出上下文说明。如果用户问的内容涉及政府/银行/公共场所,联动建议相应场景。
示例:
- 用户问AI机器人客服 → "画面背景要不要出现阿联酋标志性建筑或银行网点实景?"
- 用户问旅游App → "要不要把迪拜塔、大清真寺等地标放入画面?"
固定选项结构:
| 选项 | 含义 |
|---|
| 要,出现地标/建筑 | 继续Q7细选具体地标 |
| 不要地标/建筑 | 跳过Q7,用抽象/室内背景 |
| 由阿联酋市场专家来定 ⭐ | 根据用户问题场景自动推荐 |
| 暂不确定,稍后选择 ⏸ | 排在专家定之后、自定义输入之前,回退补选 |
⚠️ Q5: 文化冲突动态预警(核心创新)
这是整个流程最重要的安全阀门。 在Q3/Q4确定后、具体参数之前执行。
工作方式:
- 分析用户原始提问中的关键词
- 结合Q3(是否有人物)、Q4(是否有建筑)的答案
- 从文化冲突知识库中交叉匹配
- 输出逐条预警,每条包含:风险描述 + 阿联酋实际情况 + 建议处理方式
- 用
AskUserQuestion 让用户确认 [继续] 或 [回退修改]
文化冲突扫描维度
| 维度 | 关键词触发 | 风险等级 | 阿联酋现状 | 建议处理 |
|---|
| 机器人/AI人形 | 机器人、AI、人工智能、智能助手、虚拟人 | 🟡 中 | 阿联酋AI战略积极,设有AI国务部长;但伊斯兰传统对"造像"(taswir)有保留,保守群体敏感 | 避免高度拟人化面部;推荐抽象几何AI界面/全息投影/语音交互;如必须出现人形,用侧面/背影/剪影 |
| 银行/金融 | 银行、金融、理财、利息、贷款、投资 | 🟡 中 | 伊斯兰银行遵循Shariah合规,禁止riba(利息);但传统银行和伊斯兰银行并存 | 避免出现利息数字/百分比符号;用"收益""回报"替代;如展示货币,不超过真实场景 |
| 政府/官方 | 政府、签证、护照、身份证、警察 | 🔴 高 | 阿联酋国旗、国徽、领导人肖像有严格使用规范;AI生成画面中出现官方符号属于伪造/滥用,后果严重 | 🚫 绝对禁止在AI生成内容中出现国旗、国徽、领导人肖像、官方徽章等一切政府符号;不可在prompt中描述这些符号试图让AI"规范展示";唯一正确做法是彻底避开;使用阿联酋身份证需去敏感信息模糊化 |
| 男女互动 | 男女、情侣、牵手、拥抱、同框 | 🔴 高 | 非家庭成员(mahram)间公共场合禁止亲密接触;但商业场景自然交流可接受 | 男女同框保持≥1米距离;无身体接触;办公场景用"工作交流"姿势 |
| 女性形象 | 女性、女孩、女士、母亲 | 🟡 中 | 各酋长国保守度不同:沙迦>阿布扎比>迪拜;但UAE整体偏保守 | 肩至膝覆盖;长发建议盘起或遮盖;避免紧身/透视/短袖;阿布扎比/沙迦场景默认Abaya |
| 宗教符号 | 清真寺、祷告、古兰经、十字架、佛像 | 🔴 高 | 伊斯兰为国教;其他宗教有特定场所;公共场合禁止非伊斯兰传教符号 | 清真寺场景人物需脱鞋、静默;不出现其他宗教符号;祷告时间不做喧闹行为 |
| 饮食场景 | 餐厅、吃饭、喝酒、猪肉 | 🟡 中 | 酒精仅限持牌场所;猪肉仅限指定区域;斋月白天公开禁食 | 不出现酒精特写/饮酒动作;不出现猪肉;斋月场景白天无进食饮水 |
| 斋月 | 斋月、Ramadan | 🟡 中 | 日出至日落禁食禁饮;公众场合需尊重 | 白天场景人物不进食饮水;BGM用舒缓乐曲;色调暖黄/灯笼氛围 |
| 音乐/BGM | 配乐、BGM、背景音乐 | 🟢 低 | 部分保守学者对器乐有保留,但UAE商业场景普遍接受 | 避免宗教颂词做背景;斋月用舒缓器乐;商业场景现代BGM可接受 |
| 无人机/航拍 | 无人机、航拍、鸟瞰 | 🟡 中 | 无人机需GCAA注册;禁飞区严格(机场/军事/皇宫周边) | 城市航拍地标需确认可飞区;沙漠/海滩一般可飞;避免军事敏感区域 |
| 奢侈品 | 黄金、钻石、豪车、奢华 | 🟢 低 | 迪拜是奢侈品消费中心,炫富文化部分接受 | 避免过度炫富引发不适;平衡"品质"与"炫耀" |
预警输出格式(强制执行两步走)
铁律:必须先在对话中展示完整风险表格,然后才能弹 AskUserQuestion!不可跳过表格直接提问。
步骤1 — 先在对话中展示风险表格:
────────────────────────────────
⚠️ 文化冲突预警 — 基于"用户问题关键词"和Q3/Q4选择,检测到{N}条潜在风险:
| # | 维度 | 风险 | 冲突原因 | 阿联酋实际 | 建议处理 |
|---|------|------|---------|-----------|---------|
| 1 | 🤖 AI人形 | 🟡中 | 涉及"AI",伊斯兰传统对"造像"(taswir)有保留 | 官方积极推AI战略(2031愿景),商业场景接受度高 | 避免高度拟人化面部;推荐抽象AI界面/全息投影/语音交互 |
| 2 | 🏛️ 政府/官方 | 🔴高 | ... | ... | ... |
| ... | ... | ... | ... | ... | ... |
> 以上建议基于阿联酋各酋长国的一般规范。具体广告需通过 National Media Council 审核。
步骤2 — 然后弹 AskUserQuestion:
────────────────────────────────
选项:[继续,按建议处理] / [回退,修改之前的选项] / [暂不确定,稍后评估 ⏸]
暂不确定排在最后(回退修改之后、自定义输入之前),回退检查时重新评估。
Q6: 人物细节(仅Q3选"要"时触发)
设计原则:选项必须根据用户问题场景动态生成,不是写死的。
动态生成逻辑:
| 用户问题场景 | 人物选项生成思路 |
|---|
| AI/科技产品 | 科技公司白领、政府办事人员、外籍通勤者、多族裔用户群、专家定⭐ |
| 银行/金融 | 商务白袍Kandura、职业女性Abaya、外籍银行经理、家庭客户、专家定⭐ |
| 旅游/酒店 | 中国游客、欧洲游客、海湾家庭、商务旅客、专家定⭐ |
| 零售/电商 | 年轻消费者、家庭购物、快递员、店员、专家定⭐ |
| 政府服务 | 办事市民、公务员白袍、外籍职员、警察/安保、专家定⭐ |
固定输出模板:
Q6: 具体出现什么样的人物?(多选,最多选2类)
选项(根据用户问题动态生成,每项附简短说明,暂不确定排在专家定之后):
1. {动态选项1} — {场景化的简短描述}
2. {动态选项2} — {场景化的简短描述}
3. {动态选项3} — {场景化的简短描述}
4. 由阿联酋市场专家来定 ⭐
5. 暂不确定,稍后选择 ⏸ — 回退补选
此外再问两个必问子项:
- 多选:人物年龄(20-35/35-55/全年龄/专家定⭐)
- 单选:着装风格(正式Kandura+Abaya/商务休闲/现代日常/专家定⭐)
Q7: 地标/场景细节(仅Q4选"要"时触发)
设计原则:根据用户问题场景和Q6人物选择,动态推荐相关建筑/场景。
动态生成逻辑:
| 用户问题场景 | 地标/场景选项 |
|---|
| AI/科技/政府 | 未来博物馆、DIFC金融区、ADGM广场、智能政府大厅、专家定⭐ |
| 银行/金融 | DIFC/ADGM金融区、银行总部大楼、ATM网点、手机界面场景、专家定⭐ |
| 旅游/景点 | 迪拜塔、大清真寺、棕榈岛、帆船酒店、沙漠、专家定⭐ |
| 零售/消费 | Dubai Mall、黄金街、City Walk、社区超市、专家定⭐ |
| 物流/交通 | 迪拜机场、杰贝阿里港、Metro站、高速公路、专家定⭐ |
强制选项结构:3-4个具体场景选项 + 专家定⭐ + 暂不确定 ⏸(排在专家定之后、自定义输入之前)+ 一个可编辑补充输入框。
再追加必问子项:
- 光线/时段:黄金时刻日落/白天自然光/夜景灯光/室内柔光/专家定⭐
- 色调倾向:暖金色调/冷蓝科技/电影冷暖对比/沙漠大地色/专家定⭐
🔄 回退检查:补选暂不确定项(Q7之后、问卷确认①之前强制执行)
在进入 Q2-Q7 问卷确认①之前,必须检查Q1-Q7中是否有选择「暂不确定 ⏸」的项目。如有,逐条回退要求用户补选;补选完成后再次检查,直到所有项确定为止。
执行逻辑:
检查 Q2-Q7 各题答案:
IF 任何题目选择了「暂不确定 ⏸」 THEN
输出待补选清单 → 逐条重新弹 AskUserQuestion(只弹跳过的问题)
→ 用户补选完成 → 再次检查
ELSE
所有项已确定 → 继续进入「问卷确认 ①:Q2-Q7 基本参数」
输出格式:
🔄 回退检查 — 以下问题尚未确定,请补选:
| 问题 | 待定项 |
|------|-------|
| Q3 | 人物是否出现尚未确定 |
| Q6 | 人物类型未确定 |
| ... | ... |
现在逐条补选 ↓
补选时按原问题顺序逐一弹出 AskUserQuestion,选项与原问题完全一致(不含新的「暂不确定」——这是补选轮,不能再跳过)。补选完成后确认"全部已确定 ✓"再继续。
✅ 问卷确认 ①:Q2-Q7 基本参数(回退检查后、Q8之前强制执行)
回退检查全部通过后,在进入Q8场景方案组装之前,必须将 Q2-Q7 的所有已确定答案整理成问卷摘要,展示给用户确认。只有确认通过后才进入Q8。
注意:Q1语言选择不在此处确认——语言已在Q1选定且贯穿全程,无需二次确认。
执行逻辑:
- 收集 Q2 到 Q7 的所有最终答案(含回退补选后的结果)
- 以表格形式在对话中完整罗列
- 弹 AskUserQuestion 提供 [全部确认,生成场景] / [需要修改某项]
- 用户若选择"需要修改",在"其他"输入框中指定要修改的问题编号和新的选择,执行修改后重新展示完整问卷
- 循环直到用户确认"全部确认",然后进入 Q8
输出格式:
✅ 问卷确认 ① — 基本参数汇总(Q2-Q7)
┌──────┬──────────────────┬───────────────────────────┐
│ 步骤 │ 问题 │ 您的选择 │
├──────┼──────────────────┼───────────────────────────┤
│ Q2 │ 目标用户群体 │ 阿联酋本地市民 │
│ Q3 │ 是否出现人物 │ ✅ 要,出现人物 │
│ Q4 │ 是否出现地标 │ ✅ 要,出现地标/建筑 │
│ Q5 │ 文化冲突预警 │ ✅ 已确认,按建议处理 │
│ Q6 │ 人物类型 │ 政府服务人员 + 男女市民 │
│ Q6 │ 年龄 │ 全年龄段 │
│ Q6 │ 着装 │ 传统与现代融合 │
│ Q7 │ 地标/场景 │ DIFC金融区 + ADGM广场 │
│ Q7 │ 光线/时段 │ 由专家定 ⭐ │
│ Q7 │ 色调 │ 由专家定 ⭐ │
└──────┴──────────────────┴───────────────────────────┘
以上参数将作为Q8场景方案组装的依据。
如有不满意的选择,请告知需要修改哪一项。
例如:"修改Q7光线 → 黄金时刻" 或 "修改Q6着装 → 传统正式"
如全部确认无误,选择「全部确认,生成场景」。
AskUserQuestion 选项:
选项:
1. ✅ 全部确认,开始生成场景方案 — 进入Q8,基于以上参数组装4个场景方案
2. ✏️ 需要修改某项 — 通过"其他"输入框说明要修改的问题编号和新选择
修改后,重新输出完整问卷摘要,再次等待确认。循环直到用户选择"全部确认"。
Q8: 场景方案组装 ⭐(所有步骤的融合)
这是整个流程的核心创意步骤。 根据用户从Q1到Q7的全部已确定选择,生成4个完整的、实际可行的视频/图片场景方案。
生成规则:
- 每个方案是一个完整的叙事场景,把所有选定元素串联起来
- 4个方案各不同,覆盖不同叙事角度/情绪/节奏
- 方案长度2-4句话,足以让用户想象成品
- 必须衔接到下一题(段数)——方案复杂度直接决定建议段数
- 第5个方案E为用户自定义——通过 AskUserQuestion 的"其他"输入框实现
输出与交互规则(强制执行):
步骤1 — 先在对话中展示完整方案描述:
────────────────────────────────
将4个方案(A/B/C/D)的详细场景描述直接写在对话文字中,
让用户完整阅读后再选择。每个方案末尾附带推荐段数范围。
步骤2 — 然后用 AskUserQuestion 弹选项:
────────────────────────────────
选项固定为方案A、方案B、方案C、方案D 四个可点击按钮。
❌ 不允许出现"由专家来定 ⭐"——这4个方案本身已经是专家定制的。
✅ 用户可通过"其他"输入框自由输入方案E。
组装公式:
方案 = [人物] + 在[地标/场景] + 做[用户问题的核心动作] + [情绪/氛围词] + [视觉风格提示]
示例输出(以"银行AI机器人客服视频"为例,中文,选了要人物+要地标+白袍+未来博物馆):
步骤1 — 先在对话中展示方案文字描述:
方案A — "未来银行大厅"
一位阿联酋白袍商务人士走进未来博物馆风格的智能银行大厅,
与全息投影AI助手自然对话完成业务,暖金色调,专业信赖感。
建议 2-3段 / 10-15秒
方案B — "指尖智能"
多族裔用户(本地+外籍)在不同场景(办公室、家中、地铁)
使用手机端AI银行服务,快速切换,快节奏,冷蓝科技感。
建议 3-5段 / 15-25秒
方案C — "社区温度"
阿联酋家庭(父母+孩子)在社区银行网点与友好的AI服务终端互动,
温暖室内光,强调"科技服务每一个家庭"的人文温度。
建议 3-4段 / 15-20秒
方案D — "效率之美"
外籍通勤者在DIFC金融区快速通勤途中,通过语音AI完成跨境汇款,
都市夜景灯光,极简高效,好莱坞电影节奏。
建议 4-6段 / 20-30秒
✏️ 也可通过下方输入框提交您的自定义方案E。
--- 然后弹 AskUserQuestion:---
Q8: 请选择场景方案 ↓
选项(固定4个,无"专家定"):
1. 方案A — 未来银行大厅
2. 方案B — 指尖智能
3. 方案C — 社区温度
4. 方案D — 效率之美
(用户可通过"其他"输入框提交方案E)
Q9: 生成段数(复杂度自适应)
⚠️ 技术铁律:单次视频生成上限为5秒。无论用户需要多长的视频,都必须拆分为多个5秒片段分别生成,最后拼接。
- 10秒视频 = 2个5秒片段
- 15秒视频 = 3个5秒片段
- 20秒视频 = 4个5秒片段
- 30秒视频 = 6个5秒片段
- 以此类推:片段数 = 总秒数 ÷ 5(向上取整)
所有片段必须参考 Q1-Q8 的全部选择,形成连贯的场景叙事,而非各自独立的无关画面。
设计原则:根据Q8用户选中的方案的复杂度,动态确定段数范围和最小限制。每段对应一个5秒视频片段,多段拼接构成完整视频。
| 场景复杂度 | 最低段数 | 典型范围 | 约合时长 | 拆分片段数 |
|---|
| 简单(单场景单人物) | 1段 | 1-2段 | 5-10秒 | 1-2个5秒片段 |
| 中等(多场景或多人) | 2段 | 2-4段 | 10-20秒 | 2-4个5秒片段 |
| 复杂(多场景+多人物+地标) | 3段 | 3-6段 | 15-30秒 | 3-6个5秒片段 |
| 叙事级(完整故事线) | 5段 | 5-8段 | 25-40秒 | 5-8个5秒片段 |
输出格式:
Q9: 您选择的场景方案复杂度为「{复杂}」,建议至少{最小}段(约{最小*5}秒)。
⚠️ 技术说明:单个视频生成上限为5秒。如果您选择{N}段({N*5}秒),
将拆分为{N}个5秒片段分别生成,每个片段承接前一片段的场景和叙事,
最终拼接为完整的{N*5}秒视频。
请确认生成段数:
选项(根据复杂度动态生成):
1. {最小}段(约{最小*5}秒 = {最小}个5秒片段)— 紧凑版
2. {最小+1}段(约{(最小+1)*5}秒 = {最小+1}个5秒片段)— 标准版
3. {最小+2}段以上 — 详细版
4. 由阿联酋市场专家来定 ⭐
追加子项:
- 纵横比:16:9横屏 / 9:16竖屏 / 1:1方形(仅图片)/ 专家定⭐
场景类型检测(Q9之后、Q10之前执行)
判断是否需要触发Q10/Q11。仅当所选场景方案涉及"室外"或"有窗室内"时,才弹出Q10和Q11。纯室内无窗场景直接跳过,进入连续性规则。
检测规则
扫描Q8用户选中的场景方案文字描述,以及Q7的地标/场景选择,判断场景类型:
| 场景类型 | 判定条件 | 是否触发Q10/Q11 |
|---|
| 纯室外 | 场景描述含:天际线、海面、广场、街道、沙漠、海滩、公园、城市全景、帆船酒店外观、迪拜塔外观、DIFC街区、ADGM广场等室外关键词 | ✅ 触发 |
| 有窗室内 | 场景描述含:玻璃幕墙、落地窗、窗外可见、阳光透过窗户、天窗、自然光透过、写字楼(带窗)等 | ✅ 触发 |
| 纯室内无窗 | 场景描述含:数据中心、机房、服务器室、暗室、录音棚、无窗办公室、封闭会议室、纯色背景、抽象空间等 | ❌ 跳过 |
判定逻辑:
IF 场景含任何室外关键词 OR 场景含任何有窗关键词 THEN
触发 Q10 和 Q11
ELSE
跳过 Q10 和 Q11,直接进入「跨片段视觉连续性规则」
说明:即使没有出现地标(Q4选"不要地标"),但如果场景描述中出现了阳光、天色等自然光元素(如"角色走在街上的抽象场景"),也属于"室外"类型,需要触发Q10/Q11。
Q10: 是否希望单个片段内的时间有切换?(条件触发)
仅当场景类型检测判定为「室外」或「有窗室内」时触发。
设计原则:室外/有窗场景中,光线会随时间推移自然变化。这个问题的目的是确认是否在单个5秒片段内展现这种时间流逝感。
示例说明:
- 场景方案是"迪拜塔日出",5秒片段内天色从暗蓝渐变到金色 → 有时间切换 ✓
- 场景方案是"迪拜塔日出",5秒片段内保持稳定的日出光线 → 无时间切换 ✓
- 纯室内场景不涉及此问题,直接跳过
固定选项结构:
Q10: 是否希望单个5秒片段内出现时间/光线的自然变化?
选项:
1. 要,片段内有时间切换 — 每个5秒片段内光线有小幅渐变(如日出天色渐亮、日落天色渐暗),增强时间流动感
2. 不要,片段内保持稳定光线 — 每个5秒片段内光线状态稳定不变,片段之间才切换时间
3. 由阿联酋市场专家来定 ⭐ — 根据场景方案自动推荐最合适的处理方式
Q10答案对Q11的影响:
| Q10选择 | 对Q11建议的影响 |
|---|
| 要(片段内切换) | Q11建议中每个片段标注起始→结束两个时间档位(如"日出③→早上④"),允许单片跨≤2档 |
| 不要(片段内稳定) | Q11建议中每个片段只用一个时间档位(如"日出③"),相邻片段间时间递进 |
Q11: 时间渐进序列建议(条件触发)
仅当Q10已触发并回答后,才弹出Q11。基于Q10选择 + Q8场景方案 + Q9段数,生成5个时间渐进序列建议 + 1个可编辑自定义。
设计原则:
- 先从Q8场景方案中提取主要场景位置和叙事功能
- 结合Q9确认的段数N,在12档时间线上选取连续的N个时间区间
- 根据Q10选择(有/无单片内切换),决定每个片段是双档位还是单档位
- 生成5个各具特色的时间渐进方案,每个方案对应不同的视觉情绪和叙事节奏
12档完整时间线:
凌晨 → 黎明 → 日出 → 早上 → 上午 → 中午 → 下午 → 傍晚 → 日落 → 黄昏 → 晚上 → 深夜
① ② ③ ④ ⑤ ⑥ ⑦ ⑧ ⑨ ⑩ ⑪ ⑫
⚠️ 步骤0(强制)—— 时间轴可视化
铁律:在输出5个建议之前,必须先以可视化方式展示完整的12档时间轴,标注每个档位和编号。不可跳过此步骤直接出建议。
展示格式(必须在对话中输出,配合 AskUserQuestion 弹出):
以 ASCII 时间轴或 show_widget 图表形式在对话中展示:
⏰ 12档时间轴 — 全天光线档位一览
冷暗 ──────────────────────────────→ 亮暖 ──────────────→ 暖暗 ──────→ 冷暗
凌晨 黎明 日出 早上 上午 中午 下午 傍晚 日落 黄昏 晚上 深夜
① ② ③ ④ ⑤ ⑥ ⑦ ⑧ ⑨ ⑩ ⑪ ⑫
██ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██
#0a0a2e #1a2a4a #4a3a1a #6a5a3a #8a7a5a #ffe8c0 #ffd4a0 #ffaa60 #ff8030 #cc4020 #2a1040 #0a0a2e
暗蓝黑 深蓝灰 暖金暗 暖棕金 中性暖 亮暖白 暖金黄 暖橙色 橙红金 深橙红 深蓝紫 暗蓝黑
📍 基于场景方案"{方案名}",{N}段×5秒,{N}段需要在时间线上选取连续的 {N}×2=约{M}档 区间(或 N 个单档节点)
可视化配色说明:每个档位用渐变色块展示从冷→暖→冷的光线变化,色块下方标注颜色描述词(暗蓝黑/深蓝灰/暖金暗/暖棕金/中性暖/亮暖白/暖金黄/暖橙色/橙红金/深橙红/深蓝紫/暗蓝黑),让用户一眼感知全天光线变化。同时标注当前方案的段数需要覆盖的时间范围。show_widget 可用于渲染交互式时间轴。
展示完毕后,仅用一句话过渡:"以下是根据您的场景方案生成的5个时间渐进建议 ↓",然后继续。
5个建议的动态生成逻辑
根据Q8场景方案的情绪基调和场景位置,从以下角度生成5个差异化的时间序列:
| 建议编号 | 角度 | 时间选取思路 | 情绪色调 |
|---|
| 建议1 | 经典递进(日出→黄昏) | 从早到晚完整一天,最通用的叙事 | 暖金→暖白→暖橙→冷蓝,完整弧线 |
| 建议2 | 黄金时刻(日落为主) | 集中在日落前后,阿联酋最具辨识度的金色时段 | 暖金→暖橙→金色,统一暖调 |
| 建议3 | 都市夜光(傍晚→深夜) | 从傍晚到深夜,科技感都市夜景 | 暖橙→冷蓝→深蓝,渐入冷调 |
| 建议4 | 晨光启程(凌晨→上午) | 从黎明到上午,象征"新开始""新机遇" | 暗蓝→暖金→亮白,渐暖上扬 |
| 建议5 | 全天快切(精选跳跃点) | 选取全天关键转折点快速切换,冲击力最强 | 多色调快速交替,节奏感强 |
输出格式(以4段、Q10选"要片段内切换"为例):
Q11: 基于您选择的场景方案"{方案名}"、{N}段×5秒、片段内允许时间切换,为您生成以下5个时间渐进建议:
建议1 — "经典一天" 🌅
日出→早上 → 上午→中午 → 下午→傍晚 → 日落→黄昏
每段呈现2档自然过渡,暖金渐变暖橙再到深蓝冷调,完整叙事弧线。
适合:通用品牌宣传、需要完整情绪曲线的叙事
建议2 — "黄金时刻" ✨
下午→傍晚 → 日落→黄昏 → 黄昏→晚上 · 黄昏→晚上
集中在日落前后,阿联酋最具辨识度的金色光线时刻。
适合:强调地域特征、温暖人文基调的品牌
建议3 — "都市夜光" 🌃
傍晚→日落 → 日落→黄昏 → 黄昏→晚上 → 晚上→深夜
从傍晚暖橙渐变到深夜冷蓝,迪拜都市夜景的科技魅力。
适合:科技企业、金融品牌、强调现代化城市感的宣传
建议4 — "晨光启程" ☀️
凌晨→黎明 → 日出→早上 → 早上→上午 → 上午→中午
从黎明暗蓝到正午亮白,象征新机遇的开启。
适合:新品牌发布、创新型企业、强调"新开始"的叙事
建议5 — "全天快切" ⚡
日出 → 中午 → 日落 → 深夜
单档快速切换,色彩对比强烈,现代MV节奏。
适合:短视频平台传播、年轻化品牌、追求视觉冲击力
✏️ 也可通过下方输入框提交您的自定义时间序列。
(输入格式示例:片段1:日出→早上 / 片段2:上午→中午 / 片段3:下午→傍晚 / 片段4:日落→黄昏)
Q10选"不要片段内切换"时的输出差异:
每个建议中的片段改为单档位标注,如:
- 建议1:"日出 / 上午 / 下午 / 日落"(每个片段光线稳定,片段之间递进)
与跨片段连续性规则的衔接:
Q11用户的选择(或自定义输入)将直接作为「时间轴规划表」的依据,跳过规则中"自动生成时间轴"的步骤,直接进入合规自检。
✅ Q12: 问卷确认 ② — 场景细节最终确认(Q11之后、连续性规则之前强制执行)
这是第二层确认,只涉及 Q8-Q11 的场景方案、段数和时间选择。Q2-Q7 基本参数已在「问卷确认 ①」中锁定,此处不再重复。
在进入「跨片段视觉连续性规则」之前,必须将 Q8-Q11 的所有答案整理成摘要表格,展示给用户确认。允许用户对场景方案、段数、时间序列等不满意的地方进行修改。
执行逻辑:
- 收集 Q8 到 Q11 的所有最终答案(如果纯室内跳过了Q10/Q11,则收集Q8-Q9)
- 以表格形式在对话中完整罗列
- 弹 AskUserQuestion 提供 [全部确认,开始生成] / [需要修改某项]
- 用户若选择"需要修改",在"其他"输入框中指定要修改的问题编号和新的选择,执行修改后重新展示完整问卷
- 循环直到用户确认"全部确认"
注意:如果用户要求修改 Q8 场景方案,可能需要连锁调整 Q9(段数)和 Q11(时间序列),必须重新评估。
输出格式:
✅ 问卷确认 ② — 场景细节汇总(Q8-Q11)
┌──────┬──────────────────┬───────────────────────────┐
│ 步骤 │ 问题 │ 您的选择 │
├──────┼──────────────────┼───────────────────────────┤
│ Q8 │ 场景方案 │ 方案D · 双城智慧·2031愿景 │
│ Q9 │ 段数 │ 5段(约25秒) │
│ Q9 │ 纵横比 │ 16:9 横屏 │
│ Q10 │ 单片时间切换 │ ✅ 要,片段内有时间切换 │
│ Q11 │ 时间渐进序列 │ {所选建议名称} │
└──────┴──────────────────┴───────────────────────────┘
如有不满意的选择,请通过下方输入框告知需要修改哪一项。
例如:"修改Q8场景方案 → 方案C" 或 "修改Q9段数 → 6段"
如全部确认无误,选择「全部确认,开始生成」。
AskUserQuestion 选项:
选项:
1. ✅ 全部确认,开始生成 — 进入连续性规则,按规划表生成视频
2. ✏️ 需要修改某项 — 通过"其他"输入框说明要修改的问题编号和新选择
修改后,重新输出 Q8-Q11 完整摘要,再次等待确认。循环直到用户选择"全部确认"。
范围限定:Q12 只覆盖 Q8-Q11 的场景/段数/时间选择。若用户在此阶段想修改 Q2-Q7 基本参数(如人物类型、地标选择),需回退到「问卷确认 ①」阶段,因为场景方案(Q8)需要基于修改后的参数重新生成。
⚠️ 跨片段视觉连续性规则(强制)
铁律:多段视频不是各自独立的画面,而是同一部影片的不同镜头。背景世界必须连贯,时间必须渐进。
此规则在Q12问卷确认后、编写各片段prompt前强制执行。
1. 世界一致性原则
所有N个片段必须让观众感觉身处同一个视觉世界中。
- 同一叙事空间:所有片段共享同一个城市/区域/空间体系(如"迪拜城市"、"同一栋智能大厦")
- 地点可以切换,世界不能断裂:从DIFC切到ADGM是同一城市内切换 ✓;从迪拜城市突然切到沙漠绿洲是世界断裂 ✗
- 类比:就像马戏团表演——表演者可以换,道具可以变,但镜头始终在马戏团舞台上,不会突然跳到马戏团外面
- 视觉锚点:至少有一个持续出现的视觉元素贯穿所有片段(如天际线、城市轮廓、地标远景、统一色温体系),让观众潜意识知道"还在同一个地方"
2. 时间渐进性原则
跨片段时间规则(强制)
| 规则 | 说明 | 示例 |
|---|
| 单调递进 | 片段(i+1)的起始时间 ≥ 片段(i)的结束时间,禁止时间回溯 | 片段1到傍晚了,片段2不能又回到早上 |
| 选取连续段 | N个片段必须在时间线上选取连续的、不跳跃的时间区间 | 4段选"日出→早上→上午→中午"✓;选"日出→中午→日落→深夜"✗(跨度过大) |
| 单片档位限制 | 单片段时间变化 ≤ 2个档位。若Q10选"不要切换"则为0个档位(单档静态) | "日出→早上"✓(2档);"凌晨→下午"✗(6档) |
单片段内时间规则
- 若Q10选"要片段内切换":单个5秒片段内可以有小幅光线渐变(如天色渐亮/渐暗),但不可突变
- 若Q10选"不要切换":单个5秒片段内光线稳定不变
- 允许的渐变示例:日出时天色从暗蓝渐变到金色 ✓
- 禁止的突变示例:一个5秒片段内从正午突然变到深夜 ✗
3. 时间轴规划表(生成前强制执行)
在编写任何片段prompt之前,必须先制定时间轴规划表,并在对话中展示给用户。
如果Q11用户已选择时间序列,直接使用该序列作为时间轴,跳过默认生成逻辑。
格式如下:
📅 时间轴规划 — 方案"{方案名}",{N}段×5秒
| 片段 | 时间段 | 光线描述 | 色温基调 | 场景位置 | 叙事功能 |
|------|--------|---------|---------|---------|---------|
| 1/4 | 日出→早上 | 金色暖光,太阳刚升起 | 暖金 | 帆船酒店海面 | 开场建立 |
| 2/4 | 上午→中午 | 明亮自然光 | 中性偏暖 | DIFC写字楼 | 推进叙事 |
| 3/4 | 下午→傍晚 | 金色暖光渐转暖橙 | 暖橙 | ADGM广场 | 情感转折 |
| 4/4 | 傍晚→黄昏 | 暖橙渐转深蓝,城市灯光亮起 | 暖橙→冷蓝 | 迪拜塔全景 | 收尾升华 |
4. Prompt 编写规则(每条片段必须遵守)
每个片段的 prompt 必须包含以下要素:
- 时间标注:明确该片段处于一天中的哪个时间段
- 光线描述:与时间段匹配的光线状态(如"日出金色暖光"、"傍晚暖橙色夕阳")
- 承接上下文:明确说明时间如何从前一片段延续(如"时间推进到上午,光线从日出金色变为明亮自然光")
- 世界锚点:保留至少一个与前一片段相同的视觉元素(如城市天际线、远处地标轮廓)
- 场景转换逻辑:如果切换地点,说明与时间的逻辑关系(如"随着天色渐暗,镜头从室外广场转入室内写字楼")
⚠️ Prompt 中绝对禁止描述的内容(强制)
铁律:以下内容不得以任何形式出现在 AI 视频/图片生成的 prompt 中。不是在 prompt 中加上"规范展示"就安全——唯一正确的做法是彻底避开。
| 禁止类目 | 具体禁止项 | 原因 |
|---|
| 🇦🇪 政府官方符号 | 阿联酋国旗、国徽、各酋长国徽章、领导人肖像、官方印章 | AI 生成这些符号属于伪造/滥用,后果严重。Q5 文化预警中「政府/官方」维度明确为 🔴高 风险 |
| 🆔 证件/文件 | 阿联酋身份证(Emirates ID)、护照、签证页、政府公文 | 涉及个人信息和官方文件,不可在AI画面中呈现 |
| 🚔 军警符号 | 军装、警徽、警车标识、军事设施 | 敏感安全符号,禁止在商业宣传中出现 |
| 🕌 非伊斯兰宗教符号 | 十字架(特写)、佛像、其他宗教崇拜物品 | 伊斯兰为国教,公共宣传禁止非伊斯兰传教符号 |
| 🍺 违禁物品 | 酒精饮料特写、猪肉制品、赌博场景 | 伊斯兰文化禁忌 |
⚠️ 你在 Q5 文化预警中已经列出了这些规则——不要在写 prompt 时推翻它们。 如果在 Q5 中说"建议回避国旗",写 prompt 时就绝对不要加入 "UAE flag properly displayed" 之类的描述。言行一致。
5. 合规检查清单(生成前自检)
在提交所有片段生成前,逐条检查:
6. 反例 vs 正例
❌ 反例(禁止)
片段1:凌晨暗蓝色调,帆船酒店
片段2:下午明亮阳光,DIFC写字楼 ← 时间从凌晨跳到下午,跨度过大
片段3:早上金色光线,ADGM广场 ← 时间回溯!下午→早上
片段4:深夜,迪拜塔 ← 单段内无过渡,突然入夜
→ 问题:时间乱序、忽明忽暗、世界断裂感
✅ 正例
片段1:日出→早上,金色暖光,帆船酒店海面 (档位③→④)
片段2:上午→中午,明亮自然光,DIFC写字楼 (档位⑤→⑥)← 接上!
片段3:下午→傍晚,暖金渐转暖橙,ADGM广场 (档位⑦→⑧)← 接上!
片段4:傍晚→黄昏,暖橙渐转深蓝+城市灯光,迪拜塔 (档位⑧→⑩)← 接上!
→ 时间从早到晚单调递进,光线平滑过渡,共享"迪拜城市"视觉世界
图片/海报流程(9步 + 语言多选 + 双重确认)
图片不涉及"段数"和"时间渐进",在场景组装后直接问尺寸/格式。
Q1: 对话语言 → Q1.5: 海报上呈现哪些语言?(多选)
→ Q2: 目标用户群体 → Q3: 人物? → Q4: 建筑/地标? → ⚠️ Q5: 文化预警
→ 🔄 回退检查(补选暂不确定项) → ✅ 问卷确认①:Q1.5+Q2-Q4基本参数
→ Q6: 场景方案组装(4方案+1自定义) → ✅ Q7: 问卷确认②:Q6场景方案
→ Q8: 尺寸+格式+用途
Q1.5 多选项:
- 🇨🇳 中文 / 🇸🇦 العربية / 🇬🇧 English(至少选一项,可全选)
- 无「暂不确定 ⏸」无「专家定⭐」——这是品牌语言决策
Q8项:
- 尺寸:1:1正方形 / 9:16竖版 / 16:9横版 / 自定义
- 用途:Instagram/TikTok封面 / 户外广告牌 / 展会背景板 / App内Banner / 自定义
- 无「专家定⭐」——尺寸和用途由你自行决定,你最清楚海报要用在哪里
与多模态生成技能的衔接
所有确认步骤(Q1→Q12问卷确认)完成后:
-
组装最终中文/英文 prompt:
- 将用户选中的方案展开为详细场景描述
- 嵌入Q6/Q7的子项(年龄/着装/光线/色调)
- 追加Q5文化合规约束作为 negative prompt
- 指定Q9的纵横比和段数
- 嵌入Q11选定的时间渐进序列(如有)
-
⚠️ 视频拆分生成规则(强制执行):
- 单次视频生成上限为5秒,无例外
- 根据Q9确认的段数N,将完整视频拆分为N个5秒片段
- 为每个片段编写独立的 prompt,但所有片段共享同一场景设定(Q1-Q8的选择)
- 场景连贯性要求(详见「跨片段视觉连续性规则」章节):
- 片段1:场景开场/引入(人物出场、环境建立)
- 片段2:承接片段1,推进叙事(如人物移动到新位置、开始交互)
- 片段3:继续推进或转折(如展示产品功能、服务体验)
- ...以此类推,最后一片段收尾
- 每个片段的 prompt 中必须包含"承接上文"的上下文描述(如"紧接着上一幕,人物走向...")
- ⚠️ 时间渐进性(强制):必须使用Q11选择的时间序列(或自动生成的「时间轴规划表」),所有片段的时间段在一天时间线上单调递进,禁止时间回溯和忽明忽暗
- ⚠️ 世界一致性(强制):所有片段共享同一视觉世界,保留至少一个贯穿全程的视觉锚点
- ⚠️ 生成前自检:逐条检查合规清单(时间单调递进、首尾相接、世界一致、单片≤2档、光线平滑过渡)
- 逐个生成:依次调用多模态生成,每次生成一个5秒片段
- 生成全部完成后,告知用户各片段的顺序和内容概述
-
加载「多模态内容生成」技能
-
按上述拆分规则调用生成
-
确认流程中用户的选择优先级 > 多模态生成技能的"零交互原则"
拆分生成示例
用户选择:3段(15秒),方案A"未来银行大厅",Q10选"要切换",Q11选"建议1经典一天"
步骤0 — 使用Q11选定的时间序列作为时间轴规划表:
📅 时间轴规划 — 方案"未来银行大厅",3段×5秒(Q11建议1:经典一天)
| 片段 | 时间段 | 光线描述 | 色温基调 | 场景位置 | 叙事功能 |
|------|--------|---------|---------|---------|---------|
| 1/3 | 日出→早上 | 暗蓝渐变金色晨光,阳光透过玻璃幕墙 | 暗蓝→暖金 | 银行大厅入口 | 开场建立 |
| 2/3 | 上午→中午 | 晨光增强为明亮饱满自然光 | 中性暖白 | AI服务台前 | 推进交互 |
| 3/3 | 下午→傍晚 | 正午暖光渐转暖橙,透过落地窗斜射 | 暖金→暖橙 | 大厅全景 | 收尾升华 |
步骤1 — 根据时间轴编写各片段prompt:
片段1/3(0-5秒 · 日出→早上):
prompt: "日出时分,天色从暗蓝渐变到金色晨光。一位身穿白色Kandura的阿联酋商务人士
走向未来博物馆风格的智能银行大厅入口,晨光透过玻璃幕墙洒入大厅,暖白偏金色调,
全景 establishing shot,电影质感,16:9横屏"
→ 场景建立,人物出场,单片内日出→早上渐变(2档)
片段2/3(5-10秒 · 上午→中午):
prompt: "时间推进到上午,晨光逐渐增强为明亮自然光。紧接着上一幕,白袍商务人士站在
全息投影AI助手前,开始语音对话,镜头从中景推至近景,暖白偏金色调延续,AI界面发出蓝色光芒"
→ 承接片段1,时间推进到上午→中午(2档),光线自然增强
片段3/3(10-15秒 · 下午→傍晚):
prompt: "时间推进到下午,正午暖光渐转暖橙色夕阳。承接上一幕,商务人士微笑着完成操作,
转身离开银行大厅,镜头拉远至全景收尾,暖金色调,画面渐暗,品牌Logo淡入"
→ 收尾,时间到下午→傍晚(2档),光线渐暗后收尾
步骤2 — 自检清单通过后逐个生成。
实现要求
- 每一步用
AskUserQuestion 工具提供可点击选项
- 暂不确定规则(Q2-Q7):Q2到Q7每个问题都必须包含「暂不确定,稍后选择 ⏸」选项。该选项的放置位置:若问题有「专家定⭐」,则排在专家定⭐之后、自定义输入之前;若无「专家定⭐」,则作为最后一个预定义选项(在"其他"自定义输入框之前)。Q1 例外:Q1是后续所有问答的语言基础,不设「暂不确定」——必须当场作答。Q8 例外:选项固定为方案A/B/C/D,不需要「专家定」——方案本身已是专家定制,用户通过"其他"输入方案E。Q11 例外:5个固定建议 + 1个可编辑自定义输入框
- 专家定⭐适用范围:Q3起每轮至少含一个「由阿联酋市场专家来定 ⭐」。Q1(语言)、Q1.5(海报语言)、Q2(目标用户)、Q8(尺寸/用途)不含专家定⭐——这些由用户自行决定。Q1 问题题干须用三语呈现(中文/English/العربية),但每个选项只用自身语言文字,不混入其他语言
- 🔄 回退检查(强制执行):Q7之后、Q8之前,必须扫描Q2-Q7的所有答案。如发现任何「暂不确定 ⏸」,必须逐条回退让用户补选。补选轮中不再显示「暂不确定」选项(已到最后机会)。全部确定后才进入Q8
- Q6/Q7/Q8/Q11 的选项必须根据用户原始问题动态生成,禁止套用死板模板
- Q5 文化预警必须扫描用户问题中的具体关键词,逐个匹配维度,逐条输出。强制执行两步走:先以表格形式在对话中展示全部风险(含维度、冲突细节、原因、建议),再用 AskUserQuestion 弹确认/回退/暂不确定选项。禁止跳过表格直接提问
- Q8 的4个方案必须各不相同且实际可行。交互方式:先在对话中展示4个方案的完整文字描述(含推荐段数),再用 AskUserQuestion 弹 A/B/C/D 选项。Q8本身不含暂不确定——回退检查已确保Q1-Q7全部确定
- Q10 和 Q11 仅在场景类型检测判定为「室外」或「有窗室内」时触发;纯室内无窗场景直接跳过,进入 Q12 问卷确认
- Q11 必须先在对话中展示强制性的12档时间轴可视化(含色块、编号、颜色描述),用一个简洁的过渡句引入后再展示5个时间渐进建议的完整文字(含每个建议的场景描述和适用场景),最后用 AskUserQuestion 弹选项。禁止跳过时间轴可视化直接出建议
- ✅ 双重问卷确认(强制执行):
- 问卷确认 ①(Q2-Q7 基本参数):回退检查全部通过后,必须在对话中输出 Q2-Q7 完整摘要表格。弹 AskUserQuestion 提供 [全部确认,生成场景] / [需要修改某项]。循环直到用户确认"全部确认"后才进入 Q8。
- 问卷确认 ②(Q8-Q11 场景细节):Q11之后(或纯室内跳过Q10/Q11后在Q9之后),必须在对话中输出 Q8-Q11 完整摘要表格。弹 AskUserQuestion 提供 [全部确认,开始生成] / [需要修改某项]。循环直到用户确认"全部确认"。若用户要求修改 Q8,需连锁调整 Q9/Q11。
- 整个流程完成后才允许调用多模态生成
- ⚠️ 视频5秒拆分铁律:单次视频生成上限5秒,N段视频必须拆分为N个5秒片段逐个生成,所有片段须参考Q1-Q8选择形成连贯场景叙事,详见Q9和「与多模态生成技能的衔接」章节
- ⚠️ 跨片段视觉连续性(强制):多段视频必须先制定「时间轴规划表」并展示给用户,所有片段在一天时间线上单调递进(禁止时间回溯和忽明忽暗),共享同一视觉世界(禁止世界断裂),详见「跨片段视觉连续性规则」章节。生成前必须通过合规检查清单自检