| name | aigc-video-cover-gpt |
| version | 1.3 |
| description | 用 GPT Image 2 一步生成「商单/科普视频」高质量横版封面的工作流。输入一张人物参考图 + 一份视频脚本,自动发散标题钩子、套用商单封面公式(构图不固定·暗 / 亮双影调随机)、写出含锁脸与中文大字策略的 GPT Image 2 提示词(中间产物),并一次出若干张可发布的 16:9 封面。当用户说"给这个视频做封面""根据脚本出封面""用 GPT Image 2 做视频封面""把人物参考图做成封面"时触发。 |
AIGC Video Cover (GPT Image 2)
适用场景
把「一张人物参考图 + 一份视频脚本」直接变成若干张可发布的 16:9 横版视频封面,由 GPT Image 2 一步出含中文大标题的整张图。面向商单视频、知识科普、揭秘解说这类需要「缩略图秒懂 + 有点击欲」的封面。
典型触发语:
- "给这个视频做封面 / 出 3 张封面"
- "根据脚本出封面,人物用这张参考图"
- "用 GPT Image 2 把人物参考图做成封面"
- "这条片子要发 B 站,封面帮我搞一下"
与相邻 skill 的区别:
aigc-poster-layout 是保护已定稿原图做手工排版海报,不重绘主体;本 skill 是从零生成封面、接受 GPT Image 2 重画人物。
aigc-prompt-optimizer 是通用 prompt 优化;本 skill 专做「脚本 → 封面」这一条龙,内置商单封面公式与锁脸打法。
核心约定(本 skill 的硬设定)
- 一步出整图:GPT Image 2 直接生成含中文大标题的完整封面,不做「底图 + 后期排版」两段式。
- 接受 ~92% AI 近似:人物用参考图重画,靠「禁美化 + 点名锚点」把身份拽回到工具上限,不做抠图换脸。详见 [[GPTImage2锁脸的脸占比上限_v1]]。
- 只出 16:9 横版:用自然语言
Wide 16:9 horizontal video thumbnail,GPT Image 2 不吃 --ar。
- 若干张 = 多个标题钩子:默认从脚本发散 3 个不同钩子,各出 1 张,而非同一张改比例。
- 构图不固定:人物不锁死在右侧。从「构图库」(见第三步)随机选位——左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏 等都可;一批 3 张默认构图各不相同,让封面有变化、不千篇一律。唯一不变的是「文字与主体不互相糊住、主标题缩略图可读」。
- 暗版 / 亮版双影调随机:每张封面随机走「暗版」或「亮版」影调(见第三步);一批 3 张默认两种影调都出现(如 2 暗 1 亮 / 1 暗 2 亮,随机),让用户在明暗两种风格里挑。
- prompt 是中间产物:先把 prompt 写清楚给用户过目(尤其文字内容、锚点、构图、影调),再调用出图。
第一步:拆参考图 + 拆脚本
1A. 从参考图抽「身份锚点」
找出参考图最强的单一特征(眼睛颜色/形状、脸型、发型、肤色、标志性配饰其一),作为锁脸成败的判据。
锁脸先看锚点有没有还原,不必逐项比对五官。锚点丢 = 锁脸失败([[GPTImage2锁脸的脸占比上限_v1]])。
记录:性别、年龄段、锚点特征、是否戴眼镜、气质(温婉/硬朗/书卷/喜剧)。
1B. 从脚本抽「封面要素」
读完脚本,提炼:
- 核心冲突 / 卖点:这条片子最戏剧的一句话是什么。
- 题材情绪:科技商单 / 揭秘暗黑 / 活泼梗 / 教学正经 —— 决定配色模板(见第三步)。
- 可上封面的钩子词:能做成 2–4 字大标题的核心动词或名词(如「折解」「揭秘」「魔改」「过于先进」)。
- 品牌/栏目信息:记下来但不上封面——IP 名、栏目名、英文 slogan 一律写进视频标题 / 简介,不进画面(见第三步要点 3)。
第二步:发散标题钩子矩阵(默认 3 个)
不要只想一个标题。从脚本发散 3 个不同角度的钩子,每个包含:
| 字段 | 说明 |
|---|
| 主标题 | 2–4 字核心词,缩略图主角 |
| 高亮字 | 标题里最戏剧的 1–2 字,用对比色单独跳出 |
| 副钩子 | 一句吊人的短句,常带「!」或「?」(如「建议低调使用!」「今天你哈了吗?」) |
| 英文幽灵层 | 全大写英文,做低透明度背景字(如 DISASSEMBLE WAR MUSK) |
| 角度 | 这个钩子打的是悬念 / 利益 / 冲突 / 反差 哪一种 |
三个钩子尽量打不同情绪(如:① 悬念式 ② 利益式 ③ 冲突式),让用户有得挑。
第三步:商单封面公式(从高质量模板提炼,核心资产)
这是这套「高质量封面」的统一骨架,每张图都按它搭:
版式骨架(16:9 横版)= 一套元素 + 一种构图
封面恒定由这套元素搭成,但它们在画面里怎么摆是变量(见下「构图库」):
- 超大主标题(2–4 字,必加厚描边/外发光)
- 关键词高亮字(对比色单独跳出)
- 英文幽灵层(半透明大字压在标题后当肌理)
- 主体(人物 / 产品 / IP;没素材时用纯黑剪影 + 高饱和底)
- 副钩子短句(带 !/ ?)
- 顶角留空 + 按「影调」走暗版或亮版背景
下面是最常见的一种摆法(主标左、主体右),但只是构图库里的一个,不是唯一解:
┌─────────────────────────────────────────────┐
│ (顶角留空,不挂品牌条 / 栏目名 / 英文 slogan) │
│ 超大主标题(左) 主体(人物/产品/IP) │
│ ▓▓▓▓ 高亮字 ▓▓▓▓ 3/4 侧身 / 指向标题 │
│ 英文幽灵层(半透明压在标题后) │
│ ── 副钩子短句 ! ── │
└─────────────────────────────────────────────┘
↑ 这只是「主标左·主体右」一种,换构图见下表
这套元素 + 任一构图 暗版亮版通用,差别只在「背景影调 + 主体光照 + 文字撑读方式 + 氛围元素」。
要点:
- 构图从「构图库」随机选,不锁右侧:主体可左 / 中 / 右 / 前景大头 / 底部探出 / 对峙 / 分屏(见下表);核心只有一条——主标题与主体不互相遮糊,缩略图一眼读到标题。
- 主体要够大:人物至少占到半身(前景大头构图更是脸占大头)。脸越小越跑(工具硬上限),封面天然适合给脸足够像素。
- 顶角默认留空——不上品牌条 / 栏目名 / 英文 slogan(如「GenJi冷知识」「DAILY FACT CHECK」这类顶部标签一律不要)。封面只承载「主标题 + 高亮字 + 一句副钩子」,文字越少越秒懂。运营信息(IP 名、栏目名、期号)写进视频简介 / 标题,不上封面。用户明确反馈(2026-06-24)。
构图库:主体不锁右侧(v1.2 核心,随机选位)
同一套元素可以摆成很多构图。每张封面从下表随机抽一种,一批 3 张默认构图各不相同。下列是常用项,不是穷举——也可自由组合 / 新创,只要守住「文字不被主体糊住、缩略图读得到标题」:
| 构图 | 主体位置 | 主标题落点 | 适合 | 一句话画面 |
|---|
| 左置 | 人物在左、3/4 朝右 | 右侧大字 | 人物望向标题、引导视线 | 主体左、视线/手势把眼睛带到右边的字 |
| 居中 | 主体正中、看镜头 | 标题在上下两条或绕主体环抱 | 对视感强、单人高光 | 大头/半身居中,标题分跨顶部与底部 |
| 前景大头(特写) | 脸/上半身怼满、近景大占比 | 标题压在一侧或半透叠脸缘 | 情绪脸、锁脸最稳(脸像素最多) | 超大脸占 50–70%,标题贴边不挡五官 |
| 底部探出 | 主体从画面下缘探半身/露头上来 | 标题占上半幅 | 上文字下人物、留出顶部大字区 | 人物像从下方冒出来,上方一片留给标题 |
| 左右对峙 | 两个主体(或主体 vs 对象)分踞左右 | 标题压中缝 / VS 字 | 对决、挑战、二选一、对比 | 左 A 右 B 中间对冲,红蓝分场 + 中缝大字 |
| 斜角构图 | 主体沿对角线、动势倾斜 | 标题顺另一条对角压角 | 活力、动感、运动、爆点 | 画面被一条斜线切,人物与字各占一斜半 |
| 分屏构图 | 画面竖切/横切成 2–3 格,主体分格 | 标题压在分隔条或跨格 | 前后对比、多状态、流程、Tier | 左「之前」右「之后」,中条嵌标题 |
选位规则:
- 默认随机,一批 3 张构图尽量都不同(如:左置 / 前景大头 / 左右对峙)。
- 题材给暗示就顺着选:对决/挑战 → 左右对峙;情绪脸/单人揭秘 → 前景大头;前后对比/流程 → 分屏;运动/爆点 → 斜角;常规人物解说 → 左置 / 居中 / 底部探出皆可。
- 用户指定构图("我要分屏""都用大头")则不随机,全按指定走。
- 不论哪种构图,主标题与主体不互相遮糊是铁律;前景大头时标题尤其要贴边、别压五官最好看的部分。
影调:暗版 / 亮版双范式(v1.1 核心,随机产出)
同一套版式骨架有两种影调,每张封面随机选一种;一批 3 张默认两种都出现。两者不是好坏之分,是不同情绪气口:
| 维度 | 暗版(悬疑 / 揭秘 / 暗黑) | 亮版(积极 / 科技 / 对决 / 活力) |
|---|
| 背景 | 深色科技底(蓝黑 / 红黑),四角压暗托主体 | 高调明亮底(亮蓝 / 白 / 浅色),通透高曝;亮体育馆、亮办公室、数据中心、亮天空 |
| 主体光照 | 暗部反衬 + 局部边缘高光 | 正面均匀打亮,肤色明亮干净 |
| 文字撑读靠 | 暗底反衬浅色字 | 厚白多层描边 + 投影 + 高饱和填充(亮底上靠描边和饱和度抢出来) |
| 氛围元素 | 危险信号:骷髅 / 警示三角 / 火花 / 暗电光 | 明亮科技:全息 HUD 面板 / 数据流 / 发光 AI 芯片 / 上升箭头 / 发光图标 |
| 强调色 | 警示黄、血红 | 亮蓝、荧光绿、亮黄、橙红 |
亮版的成败关键:背景亮了之后,文字最容易糊。所以亮版主标题必须厚白描边(常 2–3 层)+ 深色投影 + 高饱和填充色,别用低饱和浅字压在亮底上(会糊成一团)。
影调选择规则:
- 默认随机,但保证一批里明暗都有。可显式掷骰(如脚本随机 / 三张按「暗·亮·随机」分配)。
- 题材有强暗黑属性(诈骗、揭秘、危机)可偏暗版;积极向(赚钱、对决、教学、活力)可偏亮版——但不强制,随机更出多样性。
- 用户若指定「都要亮版 / 都要暗版」,则不随机,全按指定走。
字体与文字系统(封面成败关键)
- 主标题:粗黑体或书法体,必加厚描边/外发光保证缩略图可读。常见三种配色:
- 黄字 + 黑描边(揭秘/暗黑:投毒术、魔改)
- 白字 + 局部红字(冲突/严肃:折解、缅北诈骗)
- 白→蓝/紫渐变 + 白描边(科技:影视级视频模型)
- 关键词高亮:标题里最戏剧的 1–2 字换对比色单独跳出(「战争」红、「诈骗」血红书法),其余字保持主色。
- 英文幽灵层:全大写英文,低透明度、大字号,压在主标题后面当背景肌理。
- 副钩子:小一号,带感叹号/问号,可加小色块底。
- 中英文对照:主标题旁配同义英文小字(中文「马斯克」+ 英文
MUSK),增加设计感。
配色情绪模板(按题材选,再叠加影调)
先按题材定基调,再叠加第三步选定的暗版 / 亮版影调:
| 题材 | 暗版基调 | 亮版基调 | 强调色 |
|---|
| 科技 / AI | 蓝黑 + 暗电路光 | 亮蓝 + 白 + 全息 HUD 高曝 | 电光紫 / 青 / 荧光绿 |
| 揭秘 / 暗黑 | 红黑 + 压暗 + 危险信号 | (暗黑题偏暗版;要亮版则亮蓝底 + 强警示色对冲) | 警示黄 / 血红 |
| 对决 / 挑战 | 深色擂台 + 聚光 | 亮体育馆 / 数据中心 + 通透高曝 | 红 vs 黄、亮蓝 |
| 活泼 / 梗 | 暗底高饱和撞色 | 亮底高饱和撞色 + 漫画描边 | 紫 / 青 / 黄 / 荧光绿 |
| 教学 / 正经 | 深蓝 + 暖金 | 亮白办公室 + 浅蓝 | 白 / 暖金 / 亮蓝 |
第四步:写 GPT Image 2 提示词(中间产物)
把第二、三步的决定翻译成一条结构化 prompt。先给用户看 prompt 再出图,重点核对「文字内容」和「身份锚点」两块。
提示词分块(英文为主、中文字符串照抄):
[1·画幅] Wide 16:9 horizontal video thumbnail, bold YouTube/Bilibili cover style.
[2·锁脸] A [年龄/性别] with the EXACT facial identity from the attached
reference photo — keep the same [点名锚点:如 round face, large blue-grey eyes],
same face shape, eyes, nose, lips, skin tone. Do NOT beautify or alter features.
[主体景别与姿态,按本张构图填:half-body / big close-up face / two figures facing off
/ emerging from bottom edge ... , 3/4 turned / looking at camera / pointing].
[3·构图·按本张构图库选项填] Composition: [构图英文,二选一示例:
· 左置 Subject on the LEFT facing right; HUGE bold Chinese title fills the RIGHT ~50%.
· 居中 Subject CENTERED looking at camera; title split across top and bottom bands.
· 前景大头 Extreme close-up face filling 50–70%; title hugs one edge, never covering the face.
· 底部探出 Subject emerges from the BOTTOM edge; title occupies the upper half.
· 左右对峙 Two figures on LEFT vs RIGHT facing off; big title / "VS" down the center seam.
· 斜角 Subject along a diagonal, dynamic tilt; title runs along the opposite diagonal corner.
· 分屏 Frame split into 2 panels (before/after); title sits on the divider or spans panels.
]. Keep title and subject from overlapping; title stays readable at thumbnail size.
[4·文字内容·逐条列清] Render ONLY this exact text — no other text anywhere:
- Main title: "折解" in [color], thick [outline color] outline.
- Highlight: the character "V4" in bright yellow.
- Subtitle: "DeepSeek" white bold below.
- Ghost English behind title: "DISASSEMBLE" large, low-opacity.
- NO top brand bar, NO channel name, NO English slogan in the top corners.
- Keep the top-left and top-right corners clean / empty.
[5·配色氛围 — 二选一,按本张影调]
· 暗版: deep blue-black (or red-black) tech background, vignette darkening the
four corners, moody rim light on the subject, [危险元素: sparks / warning
triangle / circuit lines]. Title in light color reads against the dark base.
· 亮版: BRIGHT high-key background (bright blue / white, airy, overexposed) —
[亮场景: bright arena / bright office / data center / bright sky], frontal even
lighting on the subject, glowing holographic HUD panels / data streams / rising
arrows / glowing AI chip. Title MUST have a thick white multi-layer outline +
drop shadow + high-saturation fill so it stays readable on the bright base.
[6·质感] Cinematic lighting, high contrast, crisp poster typography, ultra-detailed, 4k.
[7·负面] No garbled text, no misspelled Chinese characters, no extra random text,
no top brand bar / channel name / English slogan in the corners,
no watermark, no blurry low-quality.
写 prompt 的硬规则:
- 锁脸块永远在最前面且显式禁美化——GPT Image 2 默认会顺手美化导致跑脸。
- 中文文字必须逐条列出确切字符串 + 颜色 + 位置,别让模型自己编字。
- 主标题字数压到 2–4 字:中文越短越长的句子越容易糊/错字。复杂生僻字尽量避开或换近义短词。
- 负面词必带
no garbled text, no misspelled Chinese characters。
- 每条 prompt 标注本张构图(左置 / 居中 / 前景大头 / 底部探出 / 左右对峙 / 斜角 / 分屏),[3·构图] 块按构图填;一批 3 张构图尽量各不相同。
- 每条 prompt 标注本张影调(暗版 / 亮版),[5·配色氛围] 块按影调二选一填;一批 3 张里明暗都要有。
- 一个钩子一条 prompt;3 个钩子 = 3 条 prompt。
第五步:调用 GPT Image 2 出图
出图机制比 prompt 更决定质量([[出图机制优先律_智能体原生出图vs盲调API_v1]],实测同套 prompt 两个档次):
- 首选「会看图自纠的智能体原生出图工具」:在 Codex / ChatGPT 客户端里直接调原生
image_generation,参考图作身份参照(不是编辑底图),模型出图后能审视结果当场纠错字 / 跑脸,原生输出真 16:9,中文与锁脸最稳。这就是高质量参考封面的来源。
- 只有 API key 时,用 Responses API +
image_generation 工具复刻:responses.create(model=会看图的模型如 gpt-5.5, input=[文字指令 + input_image 参考图], tools=[{"type":"image_generation"}], stream=True)。
- 不要走盲调一次成的
images.edit(gpt-image-1):参考图被当编辑底图绑死、3:2 还要裁切啃字、模型看不到自己的成图无法自纠 → 大标题爱错字 / 画面截断 / 脸漂。
- 把参考图 + 对应 prompt 一起喂,每个钩子出 1 张。中文渲染有概率出错字 —— 预期 1–2 次重试属正常;重试只复述「确切文字 + 禁错字」,别整条重写;复杂生僻字(如「剪」)反复出错时优先换等义常用字,比死磕重出划算。
第六步:自检 + 锁脸补救阶梯
出图后逐张自检:
- 缩到缩略图大小,一眼能读到主标题吗?描边够不够厚?
- 身份锚点(第一步那个最强特征)还在吗?锚点丢就是锁脸失败,进补救。
- 中文有没有错字 / 多余乱码字?
- 顶角是否干净——有没有混进品牌条 / 栏目名 / 英文 slogan 这类不该上封面的小标签?有就重出或裁掉。
- 主体够不够大、够不够抢眼?文字有没有糊住脸最好看的部分?
- 构图对不对:主标题与主体有没有互相遮糊?前景大头是否压住了脸最好看的部分?一批 3 张构图是否各不相同、没全挤成「主体右置」一种?
- 影调对不对:亮版背景是否真的高调通透、主体正面打亮、标题厚白描边没糊?暗版是否压暗到位、浅字反衬清楚?一批里明暗是否都出现了?
- 题材情绪对不对(暗黑题别出成小清新)?
锁脸三级补救阶梯(按性价比,来自 [[GPTImage2锁脸的脸占比上限_v1]]):
- 对话式微调(首选):
The face is not matching the reference. Regenerate with her EXACT face from the photo: [点名锚点]. Keep pose, scene, text the same. —— 只动脸不动景。
- 拉近景别:全身→半身/七分身,脸占比一上去锁脸立刻稳。封面本就该给脸足够像素。
- 两步合成(终极):先出脸部特写确认锁脸,再融合氛围图。要求最高时用。
收尾铁律:锚点对 + 气质对 + 文字无错 = 可定稿。别为修小瑕疵重抽——重抽有脸再次跑偏的风险,见好就收。
交付格式
交付时给:
- 3 张封面图路径(按钩子命名,如
封面_悬念式_折解.png)。
- 每张一句话:用了哪个钩子、哪套配色、保留了什么锚点。
- 用过的 prompt(中间产物,便于用户微调复用)。
不长篇讲设计理论。用户要的是能直接发的封面。
禁止行为
- ❌ 锁脸块不写在最前、不写禁美化(必跑脸)。
- ❌ 中文文字让模型自由发挥,不逐条列字符串(必出错字/乱码)。
- ❌ 主标题塞一长句、堆生僻字(缩略图糊成一团)。
- ❌ 只出一张就交付(要求是"若干张",默认发散 3 个钩子)。
- ❌ 主体做得太小、脸占比太低(违背工具锁脸规律,越缩越跑)。
- ❌ 出图错字直接整条 prompt 重写(应只复述确切文字 + 禁错字重试)。
- ❌ 把暗黑/揭秘题做成小清新配色(题材情绪错位)。
- ❌ 在顶角加品牌条 / 栏目名 / 英文 slogan 等小标签(用户明确不要;运营信息走标题简介)。
- ❌ 一批 3 张全暗版或全亮版、不给明暗对比(除非用户显式指定单一影调);亮版标题不加厚白描边直接压亮底(必糊)。
- ❌ 一批 3 张构图千篇一律全把主体塞右侧(除非用户显式指定单一构图);让主标题被主体遮糊、缩略图读不到标题。
关联文档
- [[出图机制优先律_智能体原生出图vs盲调API_v1]] —— 本 skill 第五步「机制比 prompt 更决定质量」的实测依据(B站封面量产复盘)。
- [[GPTImage2锁脸的脸占比上限_v1]] —— 本 skill 锁脸打法的实测来源(~92% 上限、禁美化、三级补救)。
- [[严格人脸一致性二创的范式阶梯_假说_v1]] —— 若用户要"复制级"真人一致,升级到后期换脸 / InstantID / Nano / LoRA。
- [[aigc-poster-layout]] —— 保护已定稿原图做手工排版海报(不重绘)的姊妹流程。
- [[aigc-prompt-optimizer]] —— 通用 AIGC prompt 优化,本 skill 的 prompt 写法与其同源。
- [[角色一致性金字塔]] —— 角色跨图一致性的总框架。