| name | my-media-video-sample-analysis |
| description | Analyze user-provided local videos, screen recordings, keyframes, title/body/data screenshots, and comment-section screenshots of video content on Xiaohongshu, Bilibili, Douyin, or WeChat Channels. Only processes user-initiated input. No platform scraping, no auto-download, no bypassing restrictions. |
视频样本分析
使用前提
先遵守 ../00-shared-principles/SKILL.md,并优先读取 ../USER-PROFILE.md。如果本模块被单独调用且账号配置不完整,提醒一次;如果由 ../10-master-workflow/SKILL.md 路由且入口已经提醒,不要重复提醒。如果执行失败,先检查 ../99-error-memory/known-solutions.md,再尝试新的修复。
这个 skill 只做一件事:分析用户主动提供的视频、录屏、关键帧、截图和手动补充信息,输出结构化分析结果和原创选题延展。
它不是视频下载工具,不是平台采集工具,不是绕过限制工具。
安全边界(不可逾越)
禁止事项
- 不自动下载小红书、抖音、B站、视频号等任何平台的视频
- 不破解无下载权限的视频链接
- 不自动登录任何平台账号
- 不自动批量打开链接
- 不自动播放大量视频
- 不自动翻页采集
- 不自动抓取评论区
- 不抓取任何平台的隐藏 API 或私有接口
- 不使用 浏览器登录凭证池、登录态进行批量请求
- 不使用代理池、浏览器指纹伪装、验证码绕过
- 不去水印搬运或二次发布他人视频
- 不将他人视频用于洗稿、仿写、搬运
允许输入
- 用户主动上传的本地视频文件(含音频轨道)
- 用户自己录制的屏幕录制视频(录屏,含系统音频或环境音频)
- 从用户上传的本地视频中提取音频并生成口播转写(不使用云端服务,不自动下载)
- 用户手动提供的视频链接——仅用于记录来源,不允许自动下载
- 视频首帧 / 封面截图
- 标题 / 正文截图
- 点赞 / 收藏 / 评论 / 发布时间等数据截图
- 评论区截图
- 用户手动补充的观察笔记和备注
- 用户手动提供的字幕文件或口播逐字稿
核心原则
- 用户提供什么,AI 分析什么
- 画面里看不到的信息不能编造
- 链接只作为来源记录,不作为自动抓取入口
- AI 只输出分析、样本卡片和原创延展,不自动调用后续模块
- 用户保留最终判断
信息补全规则
- 如果以下字段没有出现在视频画面、截图或用户补充文本中,必须标注 "未显示 / 需要用户补充":
- 账号名、标题、正文、发布时间、点赞数、收藏数、评论数、评论区高赞评论
- 不允许根据常识、链接、平台风格猜测填充
- 不允许编造数据
- 不允许把看不清的文字当成确定信息
- 使用 OCR 提取文字时,不确定的部分必须标注"疑似"
主线适配规则
分析视频样本时,优先关注与 ../USER-PROFILE.md 中账号配置相关的内容:
判断样本是否值得深入分析时,检查:
- 是否和使用者账号定位有关
- 是否面向使用者目标用户或相近用户
- 是否适合配置中的表达风格、平台和输出形式
- 是否触碰配置中的内容边界或不做方向
- 是否可能帮助用户做后续选题、脚本、标题、封面或视觉判断
- 视频的视觉表达、拍摄手法、画面节奏是否有可学习之处(学思路,不抄构图)
如果样本和账号配置无关,标注"与账号配置关联弱",但仍可按用户要求完成分析。
输入分类
收到用户输入后,先判断样本类型:
| 输入类型 | 典型形式 | 分析重点 |
|---|
| 本地视频文件 | .mp4 / .mov 等 | 完整内容分析:hook、结构、节奏、画面 |
| 屏幕录制 | 用户录制的平台视频播放画面 | 同本地视频 + 记录来源平台 |
| 关键帧截图 | 多张视频关键节点截图 | 画面序列分析、视觉表达、信息层级 |
| 封面 + 标题截图 | 首帧 + 标题 | 封面点击欲、标题钩子、第一眼信息 |
| 数据截图 | 点赞/收藏/评论数截图 | 表现数据记录、互动率估算 |
| 评论区截图 | 视频下方评论截图 | 评论洞察、用户需求提炼 |
| 手动描述 | 用户文字描述视频内容 | 按用户描述范围分析,不扩展推断 |
| 混合输入 | 以上多种组合 | 综合整理为完整样本卡片 |
如果用户一次提供了多个视频样本,逐条整理成独立样本卡片。
分析流程
Step 1:接收输入并确认信息范围
确认用户提供了什么,并声明信息边界:
- 列出用户已提供的信息
- 列出明显缺失的信息(如缺少账号名、数据截图等)
- 如果用户提供了视频链接但没有提供视频文件/录屏/截图,明确告知"无法从链接获取视频内容,请提供视频文件、录屏或关键帧截图"
Step 2:判断口播输入等级并提取文字
根据用户提供的材料,先判断属于 A/B/C 哪一级,再按对应等级的能力范围进行分析。
快速判断:
| 用户提供了什么 | 等级 | 口播分析方式 |
|---|
| 视频 + 完整口播逐字稿 | A 级 | 直接使用逐字稿,高置信度 |
| 视频 + 画面有内置字幕 / 关键帧 | B 级 | OCR 字幕文字,中置信度 |
| 只有视频,无逐字稿,无字幕 | C 级 | 仅分析画面,低置信度 |
关键规则:
- 不要强依赖 macOS SFSpeechRecognizer
- 语音识别失败一次后立即放弃,标注原因,降级到 B 或 C
- 不要反复尝试、不要卡住流程
- 详细规则见下方「口播提取规则」章节
Step 3:逐条分析
基于视频画面 + 口播转写结果(如有),按样本卡片格式逐条分析。如果一次输入包含多个视频,给每个样本独立编号。
Step 4:标注置信度
每个字段标注信息置信度:
- 高:来自视频画面中清晰可见、用户明确提供的数据或文字
- 中:来自画面中可辨认但不够清晰的信息、用户模糊描述、OCR 结果标注为"疑似"
- 低:AI 从上下文推断的信息(必须标注为"低"且说明推断依据)
- 无:信息完全缺失,标注"未显示 / 需要用户补充"
Step 5:判断后续路由
根据样本类型和分析结果,建议进入哪些后续模块。同时标注不建议进入的模块及原因。
Step 6:输出视频样本卡片
按统一格式输出。
口播提取规则
适用范围
以下规则仅适用于用户主动上传的本地视频和用户自己录制的屏幕录制。
不适用于:
- 视频链接(不访问、不下载)
- 平台在线视频
- 用户仅提供截图/关键帧的情况
三级输入模式
口播分析质量取决于用户提供了什么。按输入完整度分三级,每级对应不同的分析能力和置信度。
A 级:用户提供完整口播逐字稿 → 高置信度
输入条件:
- 用户主动上传了视频/录屏
- 用户同时提供了该视频的完整口播逐字稿(文字)
逐字稿来源(任一即可):
- 剪映自动生成的字幕导出
- Whisper 转写结果
- TicNote 录音转写
- ChatGPT / Claude 等 AI 工具转写
- 用户手动听写
分析能力:
- 口播转写稿 = 用户提供的逐字稿(直接使用,标注来源)
- 口播摘要基于完整逐字稿生成,准确度高
- 内容结构可以精确到秒级
- 前 3 秒 hook 可以精确引用口播文字
- 口播和字幕如有差异,可对比分析
输出标注:
- 转写置信度:高
- 口播来源:[剪映导出 / Whisper / 用户手动听写 / 等]
- 「是否需要用户补充字幕」:否
B 级:用户上传视频,有自动字幕或关键帧 OCR → 中置信度
输入条件:
- 用户上传了视频/录屏
- 视频画面中包含内置字幕(平台自动生成或创作者手动添加)
- 或用户提供了关键帧截图
分析方式:
- 不尝试调用系统语音识别(避免依赖 macOS SFSpeechRecognizer 或其他平台特定 API)
- 从视频关键帧中 OCR 提取字幕文字 → 输出为「字幕转写稿」
- 字幕文字不完整是预期情况,不视为失败
分析能力:
- 字幕转写稿:基于关键帧 OCR,是片段化的、不连续的
- 口播摘要:基于字幕片段推断核心信息
- 内容结构:基于关键帧位置和字幕片段推断,精确度中等
- 前 3 秒 hook:如果首帧有字幕,可以引用;否则只能描述画面
输出标注:
- 转写置信度:中
- 「字幕转写稿」开头标注 "基于可见字幕 OCR,不是完整口播"
- 「口播转写稿」标注 "未提取音频 / 口播转写基于字幕 OCR"
- 「是否需要用户补充字幕」:是 — 建议提供完整逐字稿以获得更准确的分析
C 级:只有视频,无逐字稿,无字幕 → 低置信度
输入条件:
- 用户上传了视频/录屏
- 视频画面中无内置字幕
- 用户未提供口播逐字稿
- 用户未提供关键帧截图
分析方式:
- 不尝试调用系统语音识别
- 只分析画面内容 + 可见文字(标题、封面文字、界面文字)
- 如果录屏画面边缘出现评论区文本,但用户没有明确要求评论分析,不提取评论内容,不把评论文本当作用户反馈依据
- 口播内容不做转写
分析能力:
- 视频画面摘要:可基于关键帧描述
- 口播转写稿:标注"未提取"
- 字幕转写稿:标注"画面中无可见字幕"
- 口播摘要:标注"无法分析口播内容"
- 内容结构:仅能基于画面变化推断,无法关联口播
- 前 3 秒 hook:仅能描述画面,无法引用口播
输出标注:
- 转写置信度:低
- 「口播转写稿」标注 "口播未能提取 / 需要用户提供字幕或转写稿"
- 「字幕转写稿」标注 "画面中无可见字幕"
- 「是否需要用户补充字幕」:是 — 强烈建议。 当前仅基于画面分析,口播内容完全缺失。建议使用剪映 / Whisper / TicNote / ChatGPT 等工具转写后重新提供。
语音识别失败处理规则
不要强依赖 macOS SFSpeechRecognizer 或任何平台特定语音识别 API。
- 如果本地语音识别一次失败(权限不足 / 不可用 / 报错),立即放弃,标注失败原因
- 不要反复尝试同一段音频的语音识别
- 不要卡住流程等待语音识别结果
- 直接降级到 B 级或 C 级分析
- 在「口播转写稿」中标注失败原因,并在「是否需要用户补充字幕」中给出具体建议
建议用户使用的转写工具(任选其一):
如需获得置信度更高的视频分析结果,建议使用以下任一工具预先转写口播文字,然后将逐字稿提供给我:
- 剪映:导入视频 → 自动生成字幕 → 导出字幕文字
- Whisper:本地或 API 转写,支持中英文混合
- TicNote:录音转写功能,支持 120+ 种语言
- ChatGPT / Claude:用户自行在外部工具中完成转写
用户可以自行在外部工具完成转写后,把逐字稿粘贴回来;本 skill 不上传音频、不调用云端转写服务。提供逐字稿后,我会重新按 A 级标准分析此视频。
听不清 / 疑似处理
当用户提供了逐字稿,但其中存在不确定片段时:
以下情况标注"听不清"或"疑似":
- 背景音乐盖过人声的片段
- 多人同时说话的重叠片段
- 语速过快无法清晰识别的片段
- 方言、口音导致不确定的片段
- 用户自己标注为不确定的片段
标注格式:
听不清 / 疑似片段:
- [时间段]:[听不清 / 疑似内容] — [原因,如"BGM 干扰"]
安全边界(口播提取专项)
- 只从用户主动上传的本地视频中提取音频
- 不通过链接访问平台视频
- 不自动下载任何内容
- 不将音频上传到任何云端服务
- 不使用需要网络 API 调用的第三方转写服务(除非用户明确配置了本地可用的 API key)
- 用户可以自行在外部工具完成转写后,把逐字稿粘贴回来;本 skill 不上传音频、不调用云端转写服务
- 如果当前环境没有可用的本地语音识别能力,如实标注"语音识别不可用",不要安装依赖
- 语音识别失败后不要反复尝试,直接降级并建议用户提供逐字稿
输出格式
每个视频样本一个卡片:
## 样本编号:[VIDEO-YYYYMMDD-XXX]
### 基本信息
| 字段 | 内容 | 置信度 |
|------|------|--------|
| 平台 | [小红书/B站/抖音/视频号/本地文件] | [高/中/低] |
| 来源链接 | [链接,仅记录来源 / 无] | [高/中/低] |
| 账号名 | [账号名称或"未显示 / 需要用户补充"] | [高/中/低] |
| 视频标题 | [标题文字或"未显示 / 需要用户补充"] | [高/中/低] |
| 发布时间 | [日期或"未显示 / 需要用户补充"] | [高/中/低] |
### 视频正文 / 简介
[正文内容,如未提供则写"未显示 / 需要用户补充"]
### 封面信息
| 字段 | 内容 | 置信度 |
|------|------|--------|
| 首帧 / 封面描述 | [基于用户提供的实际画面描述,不虚构] | [高/中/低] |
| 封面文字 | [封面上的文字内容] | [高/中/低] |
### 互动数据
| 指标 | 数值 | 置信度 |
|------|------|--------|
| 点赞数 | [数字或"未显示 / 需要用户补充"] | [高/中/低] |
| 收藏数 | [数字或"未显示 / 需要用户补充"] | [高/中/低] |
| 评论数 | [数字或"未显示 / 需要用户补充"] | [高/中/低] |
| 转发数 | [数字或"未显示 / 需要用户补充"] | [高/中/低] |
### 评论区高赞评论
按点赞数从高到低排列,最多提取 10 条。如果用户未提供评论数据,写"用户未提供评论数据"。
1. [评论内容](👍 [点赞数,如未知写"未知"])
2. [评论内容](👍 [点赞数])
...
### 视频内容分析
#### 视频画面摘要
[基于用户提供的视频/录屏/关键帧,描述视频的核心画面内容。不编造未看到的画面。]
#### 口播转写稿
[从视频音频提取的完整口播文字。如果口播提取失败,写"口播未能提取 / 需要用户提供字幕或转写稿",并说明失败原因。]
#### 字幕转写稿
[从视频画面 OCR 提取的字幕文字。如果没有可见字幕,写"画面中无可见字幕"。如果基于字幕 OCR 但无音频,在开头标注"基于可见字幕 OCR,不是完整口播"。]
#### 口播摘要
[基于口播转写稿和/或字幕转写稿,总结口播/旁白的核心信息。控制在 5-10 行以内。如果无任何口播或字幕数据,写"未提供音频/字幕,无法分析口播内容"。]
#### 听不清 / 疑似片段
[如果存在听不清、背景音乐干扰、多人重叠、方言不确定的片段,在此列出:
- 0:XX-0:XX:[疑似内容] — [原因]
- 0:XX-0:XX:[听不清] — [原因]
如果全部口播清晰可辨,写"口播全程清晰,无听不清片段"。]
#### 转写置信度
**转写置信度:高 / 中 / 低**
- 高:音频清晰 + 语音识别成功 + 字幕可 OCR 校验
- 中:音频有部分干扰 / 仅字幕 OCR / 部分片段不确定
- 低:音频质量差 / 无音频,仅靠字幕 OCR / 多个片段听不清
#### 是否需要用户补充字幕
[是 / 否] — [如转写置信度为"中"或"低",建议用户补充字幕或转写稿以提高分析质量]
#### 前 3 秒 hook
| 分析维度 | 内容 |
|---------|------|
| hook 类型 | [场景型 / 痛点型 / 结果展示型 / 反常识型 / 提问型 / 其他] |
| hook 画面 | [前 3 秒的画面内容] |
| hook 口播/文字 | [前 3 秒说的第一句话或出现的第一个文字] |
| 为什么可能有效 | [基于画面和文字的初步判断] |
#### 内容结构
[时间轴或段落结构]
0:00-0:XX [阶段名称]:[画面 + 口播/文字简述]
0:XX-0:XX [阶段名称]:[画面 + 口播/文字简述]
...
#### 镜头节奏
| 分析维度 | 判断 |
|---------|------|
| 总时长 | [时长或"未提供完整视频"] |
| 镜头切换频率 | [快 / 中 / 慢 / 无法判断] |
| 画面类型分布 | [口播/产品展示/屏幕录制/B-roll/文字卡片 等] |
| 节奏特点 | [基于可观察到的画面变化描述] |
#### 情绪氛围
[基于视频画面色调、音乐(如有)、语速、表达方式的整体氛围感受。如果信息不足,写"信息不足,无法判断"。]
### 用户判断
用户觉得值得分析的原因:
- [用户的原话或备注]
### AI 初步判断
这条视频可能值得分析的原因:
- [基于样本内容的初步判断,而非空泛评价]
- [如果信息不足以判断,写"信息不足,无法做出有依据的判断"]
### 可借鉴点
只允许写:
- 选题角度
- 内容结构(不照搬具体脚本)
- 表达节奏
- 封面逻辑
- 标题逻辑
- 视觉表达思路(不照搬构图)
- 评论区反馈的用户需求
每个可借鉴点必须说明"学什么"和"为什么适合我的账号配置"。
### 不可模仿点
明确列出:
- [具体不能照搬的内容,如标题文字、脚本句式、观点表达、个人经历、封面构图、品牌视觉符号等]
### 原创选题延展
基于这条视频的用户需求和结构逻辑,给出 3-5 个适合用户做的原创选题:
1. **选题:[选题标题]**
- 从原视频学到了什么:[结构 / 用户需求 / 表达节奏,非具体内容]
- 我的切入角度:[如何连接账号定位、目标用户、表达风格和平台形式]
- 与原视频的区别:[明确说明哪里不同]
- 原创性保护提醒:[需要注意不能照搬什么]
### 信息置信度总评
**整体置信度:高 / 中 / 低**
不确定字段:
- [列出所有标注为"中""低"或"未显示"的字段,并说明不确定性来源]
- [如果所有字段都是高置信度,写"全部字段置信度高"]
### 与账号配置的关系
- 是否与 `USER-PROFILE.md` 中的账号配置相关:[是 / 部分相关 / 弱]
- 关联点说明:
- 如果不相关,是否仍有学习价值:[说明]
### 原始信息记录
[用户提供的原始描述、链接(仅记录)、截图描述、手写备注等,不做改写,原样保留。]
### 建议进入的后续模块
| 优先级 | 模块 | 原因 |
|--------|------|------|
| 建议 | `0X-xxx` | [为什么建议进这个模块] |
| 可选 | `0X-xxx` | [什么情况下可以进] |
| 不建议 | `0X-xxx` | [为什么不建议] |
### 建议同时使用 `11-screenshot-sample-extraction`?
[如果视频样本中包含可独立分析的截图(封面截图、数据截图、评论区截图),建议同时用 11 整理,但不自动调用。如果不包含截图,写"不需要"。]
### 需要我人工确认的地方
- [ ] 上述画面/音频/文字提取是否有误?
- [ ] 不确定字段是否需要我补充?
- [ ] 可借鉴点和不可模仿点的划分是否合理?
- [ ] 原创选题延展是否符合我的方向?
- [ ] 建议的后续模块是否符合你的意图?
- [ ] 是否需要和其他样本做对比分析?
- [ ] AI 只负责整理、分析和生成初稿,最终判断必须由真人完成。
多样本处理
如果一次输入包含多个视频样本,输出顺序为:
- 先输出样本清单(所有样本编号 + 账号名 + 标题 + 时长 + 一句话判断)
- 再逐个输出样本卡片
- 最后输出跨样本初步观察(如果有跨样本的共性值得注意)
跨样本初步观察格式:
## 跨样本初步观察
### 共同特征
- [多条样本在选题、结构、视觉、节奏上的共性]
### 值得注意的差异
- [样本间的差异]
### 建议优先分析
- 样本 VIDEO-XXX:[原因]
与后续模块的联动
本模块的输出可以直接作为以下模块的输入:
04-viral-note-breakdown:使用视频样本卡片中的标题、正文、封面、hook、互动数据、评论区
05-comment-insight-analysis:使用视频样本卡片中的评论区高赞评论
02-topic-scoring:使用原创选题延展中的选题方向
06-script-writing:参考视频的内容结构和表达节奏,生成自己的脚本
08-cover-title-check:参考视频的封面逻辑和标题结构
01-competitor-analysis:如果对同一账号积累了多个视频样本,可以进入对标分析
11-screenshot-sample-extraction:如果视频样本中包含截图信息,可以建议同时使用,但不自动调用
联动规则:
- 分析完成后,提醒用户可以进入哪个模块
- 不要自动调用后续模块——由用户决定是否继续
- 如果用户明确说"帮我分析这条视频",可以先出样本卡片,然后询问是否进入爆款分析/脚本生成
输出后的提醒
每次输出样本卡片后,结尾加一段:
以上信息已整理成标准化视频样本卡片。如需进入后续分析,请告诉我:
- "进入 04 爆款分析" → 对这条视频做爆款拆解
- "进入 05 评论分析" → 对评论区做需求洞察
- "进入 02 选题评分" → 对延展选题做评分
- "进入 06 脚本生成" → 基于这个结构生成自己的脚本
- "进入 08 封面标题检查" → 检查封面和标题方向
- "进入 01 对标分析" → 对这个账号做对标判断
我不会自动调用后续模块,也不会自动把结果写入 data/ 文件。所有后续步骤由你决定。
错误处理
- 如果视频文件无法读取或格式不支持:如实告知用户,列出支持的格式,请用户转换后重新提供
- 如果关键帧/截图画面完全无法识别:如实告知,列出"完全无法识别的字段",请用户补充
- 如果信息严重不足(超过 50% 字段缺失):标注"信息严重不足,建议补充后再进入后续分析",但仍输出已有信息
- 如果用户提供了链接但没有视频文件/录屏/截图:明确告知"无法从链接获取视频内容",不尝试下载
- 如果用户提供的数据存在明显矛盾(如点赞数大于播放量):标注矛盾但不修改数据
本地文件管理建议
如果用户将视频样本文件存放在本地,建议目录结构如下:
data/video-samples/
├── README.md # 目录说明和清理建议(见该文件)
├── raw-recordings/ # 原始录屏文件
├── keyframes/ # 提取的关键帧截图
├── cards/ # 整理后的样本卡片
├── reports/ # 分析报告
└── archive/ # 已分析完成的归档
清理建议:
raw-recordings/ 原始录屏默认保留 7-14 天,分析完成后可手动删除
keyframes/ 关键帧默认保留 30 天
cards/ 和 reports/ 长期保留
- 删除前必须人工确认,本 skill 不自动删除任何文件
- 本 skill 不写自动删除脚本,除非用户后续明确要求
详见 ../../data/video-samples/README.md
Test Inputs
示例 1:本地录屏文件
请按 12-video-sample-analysis 分析:
我上传了一段录屏,是我在小红书刷到的一条 AI 工具类视频。
录屏包含完整播放过程,视频下方可以看到标题和点赞数。
我没有截评论区。
我的备注:想学习这种快节奏的视频结构,但不能照搬他的脚本。
示例 2:关键帧 + 数据截图
请按 12-video-sample-analysis 分析:
平台:B站
我上传了 6 张关键帧截图和 1 张数据截图。
视频标题是"我的内容创作工作流 2026"。
数据:播放 12w,点赞 8500,收藏 1.2w。
我的备注:想分析他的工作流展示方式。
示例 3:封面截图 + 标题 + 用户描述
请按 12-video-sample-analysis 分析:
平台:抖音
我截了封面图和标题。标题是"我真的需要用这个工具吗"。
我没有下载视频,但凭记忆:开头是一个对比画面,中间讲了他的 3 个 AI 用法,结尾问观众怎么看。
我的备注:这个选题角度适不适合我做成小红书版本?