| name | video-transcript-article |
| version | 1.0.0 |
| description | 视频/音频一键抓字幕、语音转录与深度长文提炼 Skill。支持输入 YouTube、Bilibili、X 视频、抖音、播客或本地音视频文件, 优先秒级提取官方/AI 字幕;无字幕时自动通过 yt-dlp 抽取音轨并驱动 faster-whisper 极速生成带时间戳的精确字幕与文本; 随后调用 DeepSeek 遵循自媒体深度长文规范,去粗取精,将口语化转录稿深度重构成 1500~2500 字出版级高价值实战干货长文(含认知破局、底层逻辑、实操SOP、排坑指南与落地清单)。
|
| license | MIT |
| metadata | {"hermes":{"tags":["video","audio","transcript","whisper","subtitle","article","synthesis","longform"],"related_skills":["growth-author-persona","growth-writing-standards","x-post-writing"]}} |
视频/音频一键抓字幕与深度成文 Skill (video-transcript-article)
专门用于将全网任意视频(YouTube、Bilibili、X、抖音)、音频播客或本地媒体文件,全自动提取/转录为字幕,并深度重构为出版级 1500~2500 字实战长文。
🎯 核心工作流(4 阶全自动执行)
📹 传入音视频链接或本地文件
│
├─ 1. 【原生/AI字幕优先探测】
│ • 优先调用 yt-dlp 秒级提取官方中/英文字幕或自动字幕(SRT/VTT)
│ • 若字幕存在且字数充足,跳过音频下载,直接进入重构
│
├─ 2. 【无字幕智能降级:音频下载 + faster-whisper】
│ • 若无现成字幕,自动下载纯音频轨(mp3)或本地提取音频
│ • 驱动 faster-whisper (GPU/CPU) 执行高精度 VAD 切片与语音转文字
│ • 同步产出带时间戳的 .srt 字幕与全文 .txt
│
├─ 3. 【去口语化与认知重构(DeepSeek)】
│ • 剔除口播废话、语气词、流水账与口语化冗余
│ • 提炼核心认知破局点、商业/算法底层公式、实操参数与排坑盲区
│ • 🚫 【格式铁律】:严禁在正文中使用纯文本/ASCII/代码块画流程图或树状图;严禁使用 LaTeX / KaTeX 数学公式语法(如 `$$...$$` 或 `$\text{...}$`,X 文章与自媒体编辑器完全不兼容),逻辑流程与公式推导一律采用原生 Unicode 符号(如 `步骤1 ➔ 步骤2`、`痛点 × 武器 = 结果`)或 Markdown 结构化数字列表,对比一律采用原生表格
│
└─ 4. 【自动落盘与知识库归档】
• 默认直接落盘至人工工作台:inbox/articles/article-{nn}-{slug}.md(受保护永不被清理)
• 定稿后归档至 posts/{YYYY}/{MM}/{DD}/ 并自动刷新月度 INDEX.md
🛠️ CLI 命令与使用方法
node G:\x-expert\tools\video_transcript_to_article.mjs "https://www.youtube.com/watch?v=xxxx"
node G:\x-expert\tools\video_transcript_to_article.mjs "https://example.com/podcast.mp3" --title "一人公司商业闭环"
node G:\x-expert\tools\video_transcript_to_article.mjs "G:\downloads\raw_interview.mp4"
📑 深度长文产出标准结构
- # 深度大标题(直击痛点与核心论点)
- ## 💡 核心认知破局(原作者最反常识、最击中要害的底层结论)
- ## 🧩 底层机制与商业逻辑拆解(算清账本、拆解算法/转化漏斗闭环)
- ## 🛠️ 全流程实操 SOP 与关键参数(步骤化清单、软硬件或提示词配置)
- ## ⚠️ 避坑指南与隐性成本(不可忽略的合规、风控、算力或运营陷阱)
- ## 🎯 一人公司/自媒体落地行动指南(可直接抄作业照着执行的第 1/2/3 步)