| name | video-learn |
| description | 从 AI 科普视频(3Blue1Brown / Deepia / Karpathy / 李沐 等)中蒸馏思想,不是复述字幕。把视频按章节 → 核心洞察 → sujianlin archetype 分类 → 与苏神语料对照 → 找补足 / 分歧 / **可升格 L7 锚点** 的候选(非苏神断言不进 L3)。触发条件:(1) 用户贴了一个视频 URL / transcript / 字幕文件;(2) 用户说'把这个视频的思想蒸馏出来'、'做成 video.ideas.md';(3) 用户问'Deepia 这集跟苏神 XX 怎么对上';(4) 用户已经按 daily-learn 的 connect 学到一个主题想看视频版。不触发:用户只要视频摘要(叫它看 transcript 就好)、或纯翻译字幕。 |
| license | MIT |
video-learn · AI 科普视频蒸馏引擎
目标:把好视频的思想以跟苏神语料同构的方式入库,使 sugpt / sujianlin / daily-learn 三个 skill 在回答问题时能跨文字与视频两种语料引用。
为什么需要这个 skill
视频跟苏神文章不同:
- 视频讲直觉很强,讲严格证明很弱
- 视频有时间成本(20 分钟)vs 文章(3 分钟能扫完)
- 视频的分歧对照是金矿:同一个概念,可视化讲法 + 数学讲法常常补位
如果直接粘 transcript 进 corpus,就变成了"更长版文章"——失去视频的独特价值。这个 skill 就是把视频独有的表达 + 跟苏神原文的对照结构化下来。
蒸馏产物结构(两份文件)
每个视频产出两份文件:
文件 1:corpus/videos/<channel>/<slug>.md — 原料
由 scripts/video_fetch.py 生成,包含:
- YAML front-matter(标题、频道、时长、观看量、发布日期、章节、URL、代码仓)
- 完整字幕(transcript)
- 章节时间轴
这份是原料,不做"蒸馏"。用户自己读也行,也可以喂给 AI 继续处理。
文件 2:corpus/videos/<channel>/<slug>.ideas.md — 蒸馏产物
这是本 skill 的核心产物。必须包含以下 5 个段落:
---
source_video: "<channel>/<slug>.md"
video_url: "<youtube url>"
related_corpus:
- "articles/XXXX.md" # 相关苏神文章
distill_version: "v1"
---
# <channel> 《<title>》思想蒸馏
## 一、章节到洞察的映射
(表格:时间 · 章节 · 核心洞察 · 对苏神 L3 / archetype 的贡献)
## 二、N 条必记洞察(按 sujianlin archetype 分类)
(每条带 [Archetype X] 标签 + 推导链 + 与苏神对应 L3 条目的关系)
## 三、视频 × 苏神对照表
(表格:观点 · 视频怎么讲 · 苏神怎么讲 · 分歧/补足)
## 四、给 daily-learn skill 的钩子问题候选
(3 条钩子,覆盖 easy/medium/hard)
## 五、结论:该视频的价值定位
(相对苏神原文的定位,推荐的学习顺序)
看 corpus/videos/deepia/vae.ideas.md 作为示范。
蒸馏方法论(对 AI 的规则)
规则 1:不是摘要,不是复述
❌ "这个视频讲了 VAE 的定义,ELBO 推导,和重参数化……"
✅ "ELBO = KL 正则下的 f-散度特例(Archetype D),这个视角在苏神 [6016] 也有——但 Deepia 没打通 GAN 家族"
蒸馏的价值在连接,不在罗列。
规则 2:每条洞察必须贴 archetype 标签
强制映射到 sujianlin v2.3 的 5 种 archetype 之一(L7 视频锚点与 L3 苏神观点分层,见该 skill):
- A 约束方程型(从"希望的性质"反推最简形式,如重参数化)
- B 现象分析型(解释"为什么 X 现象",如 VAE 为什么糊)
- C 综述脉络型(梳理发展路径)
- D 统一框架型(看似不同的方法其实是同一框架的特例)
- E 物理类比型(能量 / 动量 / 摩擦 / 平衡态映射)
如果一条洞察归不到任何 archetype——大概率它不是洞察,而是细节。丢掉。
规则 3:对照表必须两列都写,且要有明确分歧
对照表不是"视频和苏神都讲过 X",而是:
- 视频怎么讲(视角 1)
- 苏神怎么讲(视角 2)
- 分歧在哪 / 谁更深 / 哪个更适合入门
如果找不到分歧,说明你没读懂苏神。去 sugpt 搜相关文章再回来。
规则 4:标出"可升格为 sujianlin L7 的候选锚点"
如果视频讲了苏神没写过的观点,且该观点有价值:
- 明确标注 "新 L7 候选(非苏神)":XXX
- 给出"隐含前提"(与 L3 表同构,但不得混入 L3)
- 正式入库
sujianlin 时:在 SKILL.md 的 L7 表增行(V#)并 bump 版本;仅苏神原文证据才可进 L3
这就是视频语料的独立价值:它能补苏神的盲点,同时不污染 L3 归因。
规则 5:给 daily-learn 3 条钩子
每篇蒸馏末尾必须附 3 条钩子问题(easy / medium / hard),让话题能被 daily.py 当作新题目使用。
每条钩子:
- 触发一个需要思考的判断(不是事实回忆)
- 能顺着链回到苏神的 L3 或 archetype
- 最好涉及视频 ↔ 苏神的分歧点(这种题最有教学价值)
规则 6:不夸大视频价值
❌ "Deepia 的 VAE 讲得比苏神还好!"
✅ "Deepia 在建立直觉上比苏神强;苏神在证明严谨性和方法论上更深。两者是前置课/深化课关系。"
给每个视频一个定位(入门/进阶/互补),而不是简单打分。
蒸馏执行流程(AI 侧)
当用户触发本 skill 时:
Step 1. 定位视频
- 用户贴 URL → 引导跑 scripts/video_fetch.py --url <X>
- 用户贴 transcript 文件 → 引导跑 --from-file
- 用户只说"蒸馏 Deepia 那集 VAE" → 先检查 corpus/videos/ 有没有
Step 2. 读原料
- 读 corpus/videos/<channel>/<slug>.md 的完整 transcript
- 如果 transcript < 2000 字,告诉用户"内容太短,可能是字幕被截断;建议重抓"
Step 3. 找相关苏神语料
- 按视频标题的关键词跑 python3 scripts/search.py
- 至少找到 2-3 篇相关苏神文章
- 如果完全找不到 → 这个视频是"全新领域",蒸馏时标注"苏神未覆盖"
Step 4. 写 5 个段落
- 严格按上面的模板结构
- 对照表至少 5 行
- 洞察至少 3 条(≤7 条)
Step 5. 保存到 corpus/videos/<channel>/<slug>.ideas.md
- 文件名规范:同频道下和原料同 slug,带 .ideas 后缀
- 保存后建议跑 build_index.py 更新主索引
Step 6. 向用户汇报
- 列出产出的文件路径
- 列出新增的 **L7** 候选(若有);勿称"新 L3"除非有苏神 archive 证据
- 列出 3 条钩子问题
- 建议下一步:"现在可以 daily.py --id <视频 slug> 考考自己"
常见错误与纠正
错误 1:把 transcript 抄一遍
- 症状:蒸馏文件 > 5000 字,每段都长
- 纠正:蒸馏文件应该 < 2500 字。比视频自己短 5-10 倍
错误 2:没跟苏神对照
- 症状:只有"视频说了什么",没有"苏神怎么看这件事"
- 纠正:没对照就不算蒸馏,只算翻译。至少 5 行对照表
错误 3:过度解读
- 症状:一条洞察套 3 个 archetype 标签
- 纠正:一条洞察最多贴 2 个 archetype,通常 1 个
错误 4:钩子太软
- 症状:钩子是"这个视频讲了啥?"
- 纠正:钩子必须是需要判断、有争议、能引发思考的。参考苏神式反直觉:"L2 正则和 L 约束真的等价吗?"
错误 5:忽略分歧
- 症状:对照表里每行都写"一致 / 互补"
- 纠正:至少 1-2 行必须标记"分歧"或"谁更深"。没分歧的主题不值得蒸馏
与其他 skill 的分工
| Skill | 职责 | 联用场景 |
|---|
video-learn(本) | 把视频 → 蒸馏文件 | 新视频入库时 |
sugpt | 检索苏神语料 | 蒸馏 Step 3 找对照文章 |
sujianlin v2.3 | archetype + L7 锚点表 | 蒸馏 Step 4 贴标签;成熟洞察进 L7 V# |
daily-learn | 用蒸馏产物出题 | 蒸馏完成后用户学习 |
示例:用本 skill 做蒸馏的一次对话
用户:"把 https://www.youtube.com/watch?v=qJeaCHQ1k2w 这个视频的思想蒸馏出来"
AI(按本 skill 执行):
- 识别:Deepia 频道,VAE 主题
- 检查
corpus/videos/deepia/vae.md 存在 → 直接读 transcript
- 跑
search.py --topic VAE/流模型 → 找到 5253、5239、9119 三篇对照
- 按 5 段模板写
vae.ideas.md
- 汇报:
✓ 已产出 corpus/videos/deepia/vae.ideas.md
5 条洞察:
- [A] 从"采样要可微"反推重参数化
- [E] VAE = 有限温度的 AE
- [D] ELBO = f-散度家族的 KL 特例
- [B] VAE 生成糊的物理机制
- [A+E] 重参数化 = 随机性外生化(和 SGD 的朗之万 SDE 同源)
新 L7 候选:VAE 生成糊的根因是 MSE + 像素级比较(与 L3 #2 对照,非新增苏神断言)
daily-learn 钩子(3 条,难度递增):
- 普通 AE 不能生成新图,苏神和 Deepia 解释侧重不同,你猜哪两个?
- VAE 里的"变分"真的必要吗?苏神说不需要,Deepia 讲变分贝叶斯——两个都对,差在哪?
- VAE 重参数化、Muon 动量、SGD 朗之万 SDE 三者"外生化随机性"能串成一条原理吗?
推荐下一步:python3 scripts/daily.py --id vae-ideas(需要在 daily_hooks.json 里注册)
持续迭代建议
- 每蒸馏一批视频,将稳定共识写入
sujianlin/SKILL.md 的 L7 表(V#);仅有 kexue.fm 原文依据者才进 L3
- 蒸馏质量应该逐渐提升(你会越来越擅长找"真·分歧")
- 如果一个频道的视频质量低(找不到分歧、洞察都太浅),就别继续蒸馏
video-learn 不是"帮你看视频"。它是把视频的价值编织进苏神知识图谱的工具。没被编织进去的视频,就算看完了也是漂移的碎片。