| name | cs-chatcut |
| description | 当用户要规划一条 ChatCut 短视频,或需要从内容想法到首个 ChatCut 项目的零到一操作指引时使用:先选择最值得做的主题和唯一核心观点,再完成可确认的中文口播稿、素材清单、Motion Graphics 方案、声音方向和逐镜头总表,并说明在 ChatCut 中的交接步骤。用于短视频策划、人工组装前的准备和操作上手;不要用于直接修改时间线、导入导出素材、电商视频复刻、长文写作或外部事实调研。除非用户指定其他语言,默认使用中文输出。 |
| metadata | {"author":"陈硕","collection":"CS Skills","source":"https://github.com/ChenShuo2004/cs-skills","compatibility":"Codex and any agent that supports SKILL.md"} |
ChatCut 视频策划与操作指南
目标与边界
把零散的内容、观点和视频想法收敛成一条有明确受众、观点、证据和行动目标的短视频,再整理为可执行的制作蓝图,帮助用户准备素材并在 ChatCut 中完成组装。
操作指南资源
当用户需要安装 ChatCut Agent、了解从确认脚本到导出成片的操作流程,或排查首次使用的常见步骤时,查阅 references/zero-to-one-guide.html。该指南说明策划与 ChatCut 编辑工作台的交接;实际项目创建、素材导入、时间线编辑和导出仍交由对应的 ChatCut 编辑工作流执行。
严格保持策划边界:
- 不创建、选择或修改 ChatCut 项目。
- 不上传、导入、导出、渲染或把素材放入时间线。
- 不编写 Motion Graphics JSX,不调用 ChatCut MCP 工具。
- 不设计数字人的外貌、服装、头像或表演方式。数字人只通过口播稿和表达标注得到支持。
- 如果用户要求直接操作 ChatCut,说明本 Skill 只负责制作蓝图,并将后续操作交给对应的 ChatCut 编辑工作流。
准确使用 ChatCut 术语:把动画视觉层称为 Motion Graphics,区分透明叠加和全屏不透明画面,并让时间安排对应最终口播结构。
内容与想法阶段
当用户只有一个模糊想法、一段素材或一批选题时,先做内容决策,不要立刻生成分镜或要求完整 brief。
输入与收敛规则
- 单个想法:找出它服务的受众、真实张力、可支撑的事实和最小可拍形式。
- 一批想法:合并重复项,保留 3~5 个候选;按受众相关性、观点张力、事实/素材支撑、制作可行性各评 1~5 分,并说明分数依据与待确认项。
- 用户未给受众、平台或目标时,先根据素材做一个低风险假设并标记;只在该信息会改变选题判断时提问。
- 优先选择“有明确对象、有真实证据、一个视频能讲清、能自然导向下一步”的主题;不要为了凑数量延展成空泛选题。
内容决策交付
在尚未锁定主题时,按以下顺序输出并默认暂停等待确认:
- 推荐主题:一句话核心观点、目标受众和为什么此刻值得讲。
- 候选排序:候选主题、四项评分、可用证据和主要风险。
- 内容切口:推荐的 Hook 方向、承诺给观众的结果,以及不应该承诺什么。
- 最小制作建议:推荐平台、时长、出镜/录屏/素材形式和需要补齐的最小信息。
- 下一步:用户确认一个主题后再进入口播稿阶段。
文章、公众号、长文提纲或非视频内容改写使用 $cs-writer;需要查证产品、市场、竞品或外部数据时使用 $cs-search-skill。本 Skill 可以接收这些产物作为视频原始内容,但不替代它们。
语言规则
- 除非用户明确指定其他语言,所有面向用户的提问、说明、表格和交付内容都使用简体中文。
- 保留产品和技术的标准名称,例如 ChatCut、Motion Graphics、BGM、SFX、A-roll、B-roll、CTA、JSX、MCP。
- 用户提供英文素材时,可以保留必要的英文原文,但解释、结构和制作建议仍使用中文。
- 不要因为
agents/openai.yaml 或路由元数据使用英文技术字段,就把最终交付改成英文。
输入 brief 门槛
把输入分成“内容与想法阶段”“口播稿阶段”和“完整蓝图阶段”。已锁定主题后,不要因为画幅比例、视觉风格或品牌素材还没有确定,就阻塞口播稿生成。
口播稿阶段的必需信息
| 字段 | 必须明确的内容 |
|---|
| 主题与目标 | 视频讲什么,以及观众看完后要理解什么或做什么 |
| 原始内容 | 原稿、笔记、逐字稿、产品事实、案例、参考链接或其他可用资料 |
| 发布平台 | 例如抖音、TikTok、Shorts、Instagram Reels 或其他平台 |
| 成片时长 | 例如 30 秒、60 秒或 90 秒 |
| 目标受众与痛点 | 谁在看、他们处于什么场景、现在遇到什么问题 |
| 核心观点/观众承诺 | 这条视频最终只让观众记住什么,或得到什么结果 |
| 说话人身份与立场 | 谁在说、凭什么说、希望保持什么个人判断或经验感 |
| 语气与节奏 | 例如平静、直接、教程感、紧迫、自然或高能 |
| CTA | 观众下一步要做什么;没有 CTA 时明确写“无 CTA” |
完整蓝图阶段的补充信息
在口播稿确认后,再补充或确认:
- 画幅比例,例如 9:16、1:1 或 16:9。
- 视觉风格、品牌颜色、字体、Logo、产品图片或必须出现的画面元素。
- 已有 A-roll、B-roll、截图、图表、文档或音频素材。
- 字幕或双语字幕要求。
- 参考视频、素材来源、禁止使用的画面或版权限制。
- 语言、声音、发音、数字读法或专用名词要求。
缺少信息时,只列出当前阶段真正阻塞的字段并等待补充。不要因为视觉信息缺失就阻塞口播稿,也不要擅自套用平台、时长、受众或语气。对事实依据不足但不影响继续组织稿件的内容,标记为“待确认”,不要编造。
工作流程
工作流分为三个阶段。用户尚未锁定主题时,先完成内容决策;默认再完成口播稿确认,最后展开完整蓝图。只有用户明确要求“端到端”时,才在同一轮继续,但仍必须完成每一阶段的内部质量检查。
A. 内容与想法收敛阶段
- 整理输入。 区分用户的原始想法、已确认事实、个人观点、案例/数据和待确认内容。
- 合并并排序。 对批量想法去重、评分并选出一个推荐主题;不要把多个主题硬塞进一条视频。
- 定义内容承诺。 写清观众是谁、看完能获得什么、唯一核心观点是什么,以及有哪些不能越过的事实边界。
- 给出最小下一步。 说明用什么形式拍、还缺哪一项真正影响判断的信息;等待用户确认主题。
B. 口播稿确认阶段
- 锁定脚本 brief。 复述主题、目标、平台、时长、受众痛点、核心观点、说话人身份、语气和 CTA。视觉风格暂不作为口播稿阻塞项。
- 提炼事实与素材依据。 内部区分已确认事实、用户观点、案例/数据、待确认内容和禁止夸大的表达。每个主要观点都要能追溯到原始内容或明确标记为“待确认”。
- 确定唯一核心观点。 用一句话写出观众看完后应记住的结论。若原始内容包含多个主题,合并成一条主线,或建议拆成多条视频,不要把多个主题硬塞进一条稿件。
- 设计节拍骨架。 为每个时间段写清观众问题、口播任务、信息推进、证据/例子和画面锚点。默认使用
Hook → 冲突/痛点 → 解释或证据 → 结论 → CTA,但以内容逻辑为准。
- 生成口播稿初稿。 先写完整可朗读的内容,再补表达标注。前 2~3 秒直接进入结果、冲突或问题,不默认问候、自我介绍或泛泛铺垫。
- 执行口语化改写。 用具体主语、动作、场景和结果替换抽象表达;一口气只表达一个意思;删除书面连接词、重复结论、空洞形容词和模板化句式。保留自然停顿,不把稿件压成机械快读。
- 执行三项质量审核。 依次检查事实准确性、朗读自然度和观看推进。按实际可朗读字符数核算时长,不把标点、章节名和表达标注计入字数;偏差超过 10% 时必须重写。
- 交付口播稿确认版。 先交付核心观点、Hook 备选、主稿、口播质检和待确认项。默认暂停,等待用户确认;用户确认后才进入完整蓝图阶段。
C. 完整蓝图阶段
- 补齐制作约束。 确认画幅、视觉风格、品牌素材、字幕要求、参考视频和版权限制。
- 推导素材计划。 只要求能够解释、证明、展示或支持某一句口播或某一个镜头的素材,区分必需素材和可选润色素材。
- 设计 Motion Graphics。 为每个图形指定观看任务、具体形式、口播锚点、时间范围、内部动效节奏、背景模式和安全放置建议。
- 设计声音方案。 给出不干扰人声的 BGM 方向和逐事件 SFX,把人声作为锚点、BGM 作为跟随层。
- 制作逐镜头总表。 将已确认口播、画面、素材、Motion Graphics、声音和素材编号放进同一张时间表。
- 执行完整质量检查。 检查时长、素材依据、画面保护、声音清晰度和交付完整性。不得在确认后的口播稿上静默改写;如必须修改,明确列出修改原因并重新确认。
口播稿质量规则
以下规则是口播稿的硬门槛,不是可选建议:
- 一句话只承担一个动作或观点。 避免连续堆叠多个抽象名词、观点或因果关系。
- 每个节拍都要推进。 必须新增事实、例子、对比、结论或行动,不得只是换一种说法重复上一句。
- Hook 必须具体。 优先使用结果、冲突、反常识、明确问题或高相关场景;禁止默认使用“今天我们来聊聊”“相信很多人都……”等空开场。
- 内容必须可追溯。 统计、评价、保证、见证、产品能力和因果关系没有依据时,必须删掉或标记“待确认”。
- 表达必须适合说出来。 优先短句、主动语态、具体动词和自然连接;避免论文式定义、宣传口号和过度完整的书面句。
- 保留说话人的判断。 不把用户的个人经验、犹豫、限定条件和真实语气改写成无差别的“正确答案”。
- CTA 只保留一个动作。 不要同时要求关注、评论、私信、购买和转发。
- 纯口播与表达标注分开。 纯口播版可以直接复制给配音或数字人;停顿、重音、语速和情绪标注另列,避免标注被误读成台词。
- 必须通过朗读测试。 如果连续朗读时出现喘不过气、语义跳跃、硬拼接或不像真人会说的话,先改稿再交付。
固定输出格式
未锁定主题时,先交付“内容决策交付”;锁定主题后默认分两轮交付,避免低质量口播稿带着素材、Motion Graphics 和分镜一起扩展。
第一轮:口播稿确认版
按以下顺序输出:
- 口播定位:目标受众、核心痛点、唯一核心观点和观众承诺。
- Hook 备选:给出 2~3 个不同机制的开场,并说明各自适合的观看场景;不要只改几个形容词。
- 纯口播稿:输出可直接复制、没有方括号标注的完整台词。
- 表达标注版:在同一稿件上补充必要的停顿、重音、语速和情绪标注。
- 口播质检:报告可朗读字符数、预计时长、语速假设、Hook 进入时间、核心观点是否唯一、事实待确认项和 CTA 动作。
- 待确认项:只列会影响内容判断的事实或用户选择,不用先展开素材和视觉方案。
第一轮默认在这里暂停,等待用户确认或修改口播稿。用户明确要求端到端时,可以继续生成第二轮,但不得跳过第一轮的质量审核。
第二轮:完整蓝图版
用户确认口播稿后,按以下顺序输出。内容要具体到用户可以直接据此找素材和组装视频。
1. 制作策略
包含以下内容:
- 视频目标和观众承诺。
- 平台、时长、画幅比例、受众、语气、节奏和视觉方向。
- 一句话核心结论。
- 故事骨架:
Hook → 问题/承诺 → 关键观点 → 结论 → CTA。
- 推荐节奏、章节数量,以及每个章节的大致时间预算。
- 重要限制、待确认事实、禁止使用或暂时缺失的素材。
不要写与 brief 无关的泛泛策略段落。
2. 素材总清单
为每个素材分配稳定编号,例如 M01、M02、M03。使用以下列:
ID | 优先级 | 类型 | 具体内容 | 用途与出现时间 | 规格 | 获取方式 | 搜索关键词 | 版权/备注
优先级只使用以下三种:
必需:没有它就无法表达重点、完成镜头、证明事实或保持品牌识别。
可选:可以改善质感、节奏或变化,但删除后不影响信息表达。
无需准备:可以由 A-roll、Motion Graphic 或现有项目画面完成。
获取方式使用以下标签:
用户提供:原始视频、产品文件、品牌素材、截图或已核实事实。
素材库搜索:库存视频、图片、图标、环境声或音效。
AI 生成:可以单独生成的图片、视频、声音或图形。
ChatCut 生成:用户确认蓝图后,可交给 ChatCut 生成的素材。
对每个 必需 或 可选 素材写清主体、动作、构图、方向、时长,以及必须保留的文字、Logo、产品、人脸或文档细节。适合素材库搜索时,同时给出中文和英文搜索关键词。禁止只写“相关画面”“适当音效”这类无法执行的描述。
不要默认堆很多装饰性 B-roll。优先选择少量但能准确表达意思的素材。如果某个观点需要证据,要求用户提供来源或标记为“待确认”,不要自行编造证明。
3. 已确认口播稿与时间基准
使用第一轮确认后的版本,不要重新静默改写。完整蓝图中同时保留纯口播版和表达标注版,包含:
- 预计字数/字符数和预计口播时长。
Hook、主体、结论、CTA 四类段落标记。
- 自然的口语标点和能对应画面节奏的短段落。
- 必要时添加
[停顿 0.3s]、[重读:关键词]、[加快]、[放慢]、[语气:坚定] 等表达标注。
- 对发音、数字、品牌名或待确认术语给出备注。
严格遵守原始内容,不添加没有依据的统计、评价、保证、见证或产品能力。任何影响核心观点、事实范围或时长的修改,都必须在交付中说明并重新确认。稿件要能直接交给数字人或配音使用,但不要另起数字人视觉设计章节。
4. 画面视觉与 Motion Graphics
先判断每个节拍需要 A-roll、B-roll、静态图、屏幕录制、全屏画面,还是不需要额外图层;只在能提升理解、定位、强调或节奏时加入 Motion Graphics。
每个 Motion Graphic 都要提供:
MG编号 | 时间段 | 对应口播 | 观看任务 | 表现形式 | 屏幕内容 | 入场/停留/退出 | 背景 | 放置与保护 | 依赖素材
遵循以下规则:
- 给图形指定观看任务,例如身份信息、关键观点、列表、比较、流程、章节、引用或抽象关系。
- 使用具体表现形式,例如姓名条、重点强调、步骤堆栈、关系图、图表、标题节拍或侧边处理。不要默认做一个只装文字的卡片。
- 让开始和结束对应口播短语或画面事件。使用相对于 MG 自身的内部时间,例如
0.0–0.2s 入场、0.2–1.2s 停留、最后 0.2s 退出。
- 叠加在 A-roll 上时使用
透明叠加;替代原画面的刻意视觉节拍使用 全屏不透明。不要在没有说明的情况下用全屏设计遮住人物。
- 用安全区域或构图关系描述位置,不要凭空写固定坐标。保护脸、头、嘴、手、重要产品、Logo、已有图层和字幕区域。
- 写清必须出现的文字、数字、图标、图片或数据。未知内容写“待补充”,不要编造。
- 保持整条视频共享同一套色彩、字体逻辑、信息密度、动效节奏和材质语言;不同观看任务可以使用不同图形形式。
- 如果该节拍不需要图形,明确写“不添加 MG”,并说明原因。
不要输出 JSX、实现代码、猜测的 ChatCut asset ID 或任何直接 MCP 操作。
5. 声音设计
BGM 方向
明确写出:
- 曲风或主要乐器。
- 情绪和能量曲线。
- 大致速度或节拍感觉。
- 在视频中的作用:开场提示、背景铺底、转场抬升或结尾收束。
- 人声政策:口播下通常使用“无明显人声歌词”。
- 搜索/生成关键词。
- 淡入淡出、循环和 ducking 处理。
保护口播可懂度。把人声/旁白作为 anchor,BGM 作为 follower,在讲话时使用自动 ducking 或明确的压低音量建议。不要把有版权的歌曲当作免费素材推荐。
SFX 事件清单
使用以下列:
SFX编号 | 时间点/触发事件 | 音效 | 强度 | 作用 | 搜索关键词 | 混音备注
使用具体编辑事件,例如 Hook 冲击、文字出现、步骤切换、点击、通知、产品接触、转场 whoosh、impact、房间底噪或结尾收束。SFX 要少而准确;如果留白更有力量,就明确保留安静节拍。
6. 逐镜头总表
严格使用以下列顺序:
时间段 | 口播内容 | 画面/素材 | MG 动效 | BGM/SFX | 素材编号
每一行都要与口播稿一致。使用素材 ID、MG 编号和 SFX 编号,避免重复写模糊描述。用户表格统一使用秒数,并确保最后一行覆盖计划时长,不留下无法解释的空档。
素材筛选规则
把素材加入清单前,逐项执行以下筛选:
- 把素材映射到具体口播句子或镜头任务。
- 只有删除后会损害信息、证据、连续性或品牌识别时,才标记为
必需。
- 产品、人物、Logo、产品能力、界面和敏感事实优先要求用户提供原始素材。
- 标明画幅、构图、分辨率、透明度、时长和裁切要求。
- 防止文字、UI、Logo、包装、文档和脸部在裁切或替换时丢失。
- 将视觉素材和 Motion Graphic 内容分开。图表的装饰背景可以生成,但数据必须核实。
- 除非 brief 明确需要,不要默认在开头和结尾前三秒安排 B-roll。
- 对缺失事实、品牌规则或素材可用性使用“待确认”,不要把不确定性藏在肯定语气里。
质量检查
交付前确认:
- brief 已完整,且复述准确。
- 稿件有清晰 Hook、逻辑主体、结论,以及 CTA 或明确的“无 CTA”。
- 稿件只有一个核心观点;每个节拍都推进了事实、例子、对比、结论或行动。
- Hook 在前 2~3 秒进入结果、冲突、问题或明确场景,没有默认空开场。
- 稿件长度按可朗读字符数核算,与目标时长偏差不超过 10%,并写明语速假设。
- 纯口播版与表达标注版分开,标注不会被误读成台词。
- 稿件已经通过事实追溯、朗读自然度、语义连贯性和观看推进检查;任一项不通过时先重写。
- CTA 只包含一个明确动作。
- 每个素材都有用途、优先级、获取方式和可执行的搜索描述。
- 每个 Motion Graphic 都有观看任务、具体形式、时间、背景模式、安全区域和依赖素材。
- 声音方案包含 BGM 方向和有明确触发点的 SFX,并保护人声清晰度。
- 逐镜头总表覆盖计划时长,且各类编号一致。
- 没有新增独立的数字人视觉设计章节。
- 没有 ChatCut 项目修改、MCP 调用、JSX、导出承诺或虚构的 asset ID。
- 最终面向用户的全部内容使用中文,除非用户明确要求其他语言。
路由边界
以下请求使用本 Skill:一批内容想法的短视频选题排序、教育短视频、个人品牌视频、产品解释、教程、公告,以及其他需要先准备素材再手动在 ChatCut 中组装的视频。
以下请求交给其他工作流:
- 竞品视频复刻、电商替换、九宫格分镜、Seedance、Gemini Omni、Google Flow 或 Veo:使用
$cs-auto-videl。
- ChatCut 项目创建、素材导入、时间线编辑、Motion Graphic 编写、字幕、音频放置、验证或导出:在蓝图确认后,使用对应的 ChatCut 编辑工作流。