workflow-bilibili-whisper-transcription
Bilibili/YouTube 视频批量下载 + Whisper 语音识别
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
Bilibili/YouTube 视频批量下载 + Whisper 语音识别
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
LLM Wiki vault 操作手册。 触发条件: - /ingest <path> — 当用户说「ingest」「把这篇文章加入 wiki」「编译到 wiki」「摄取」时触发 - /query <question> — 当用户说「搜索 wiki」「wiki 中有没有」「查一下 wiki」时触发 - /lint — 当用户说「检查 wiki」「wiki 健康度」「lint」「有没有断链」时触发 - /research <topic> — 当用户说「研究一下」「深度调研」「research」时触发
Use when the user wants to brainstorm an idea or design a feature/spec. Explores intent and requirements through dialogue, then writes a spec document to contexts/thought_review/ and STOPS. Does not auto-chain to implementation planning or any other skill.
结构稳定性分析器。不判断观点对错,只判断一件事:这个结构能不能活下去。 对任意观点、系统、模型、制度、人物言论进行五维结构稳定性分析, 输出存活概率和失效路径。当用户说「分析这个结构」「这个观点稳不稳」 「帮我拆一下」「结构分析」时触发。
AI 辅助开发中遇到“代码改不好”时的诊断思路与决策树
AI 产品设计、交互设计与系统架构中的关键原则与常见陷阱
AI 辅助编程与 Agent 系统设计的核心方法论和判断原则
| name | workflow-bilibili-whisper-transcription |
| description | Bilibili/YouTube 视频批量下载 + Whisper 语音识别 |
tmp/<task_name>/adhoc_jobs/videos_transcribe/transcripts/YYYYMMDD_platform_videoid_short_slug.md.srt、.vtt、.tsv、.json 等中间产物在 transcript 落盘后清理到废纸篓三阶段工作流:
| 决策点 | 选择 | 原因 |
|---|---|---|
| 下载并发 | 单线程 | 避免触发B站反爬机制 |
| 转录并发 | 多进程(4-8) | CPU密集,充分利用多核 |
| 模型选择 | 根据需求 | 见下表 |
| 输出格式 | 最终保留纯文本 transcript | 后续检索更稳定,中间产物可回收 |
| 模型 | 参数量 | 速度(CPU) | 准确度 | 推荐场景 |
|---|---|---|---|---|
| tiny | 39M | 1-2分钟/10分钟 | 较低 | 快速预览 |
| base | 74M | 2-5分钟/10分钟 | 中等 | 平衡选择 |
| small | 244M | 5-10分钟/10分钟 | 较高 | 日常使用 |
| medium | 769M | 10-20分钟/10分钟 | 高 | 高质量需求 |
| large-v3 | 1550M | 20-60分钟/10分钟 | 最高 | 最高质量要求 |
性能参考:12个视频(3.5小时)+ large-v3 + 7进程 ≈ 20分钟
Whisper 原始输出通常需要后处理:
| 问题 | 现象 | 解决方案 |
|---|---|---|
| 352错误 | 请求被B站拦截 | 添加User-Agent/Referer headers,增加延迟,或手动获取ID |
| 404错误 | 视频已删除或ID错误 | 验证ID有效性,跳过无效视频,记录失败ID |
| 内存不足 | 多进程转录时内存溢出 | 减少并行进程数(4-6个),使用较小模型,分批处理 |
| 下载不完整 | .m4a文件无法播放 | 检查文件大小,重新下载,添加完整性验证 |
| 转录太慢 | large-v3单个视频20-60分钟 | 选择合适模型大小,使用GPU加速,分块处理长视频 |
下载阶段: 单线程 + 2-3秒延迟 + User-Agent headers + 只下载音频 + 记录失败ID
转录阶段: 多进程(4-8) + 指定language参数 + 跳过已处理文件 + 根据硬件选择模型
落盘阶段: 在 tmp/ 完成下载和转录,整理出纯文本脚本后移入 adhoc_jobs/videos_transcribe/transcripts/
清理阶段: transcript 落盘后删除或回收音频、时间轴字幕和 sidecar 文件,只保留最终脚本
质量优化: 关键内容用large-v3,快速预览用base/small,必要时人工校对
错误处理: 实现重试机制,验证文件完整性,处理异常避免脚本中断