ワンクリックで
douyin-extract-text
从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
Generate videos using Google Veo API (veo-3.1-fast-generate-preview). Supports three modes: (1) text-to-video — user provides a prompt, generate directly; (2) video-to-prompt — user uploads a reference video, analyze with Gemini VLM to generate structured Veo prompts, discuss and refine, then generate; (3) image-referenced generation — use a reference image to guide composition/style. Triggers when user asks to generate a video, create a video from a prompt, use Veo, analyze a video for prompt generation, or produce a short video clip. Uses Gemini API key and SOCKS5 proxy automatically.
语音口述驱动的文章创作流程。用户通过发送语音录音提供素材,AI 转录、整理、多轮迭代,最终输出结构化 Markdown 文章。支持截图标注 review(红色=删除,黄色=修改)和封面图生成。适合 OpenClaw 等对话式 Agent 使用。触发场景:用户发送语音录音要写文章、说"根据这段录音整理成文章"、"帮我把这几段语音整理一下",或发送截图要求按标注修改文章时使用。不适用于需要多 Agent 协作、素材调研、事实核查的长文创作(请用 writing-team skill)。
7 人 AI 写作团队编排。启动素材猎手、主笔、事实核查、风格审计、标题工匠协作完成长文创作。 触发场景:用户要求写自媒体长文、需要素材调研或事实核查、提到"用我的风格写"、"去 AI 味"、"多角度打磨"。 仅支持 Claude Code(依赖 Agent Teams 实验功能),不适用于 OpenClaw 等对话式 Agent。 不适用于语音录音整理(请用 voice-article skill)。
将 Markdown 文章规范化处理后发布到微信公众号草稿箱。依赖 wenyan-mcp(MCP 工具)和 gemini-image-gen skill(封面图生成)。触发场景:用户说"发布到微信"、"发到公众号"、"推送文章"、"发布这篇文章",或提供 markdown 文件要求发布到微信公众号时使用。
使用 Gemini 生成和编辑配图。支持手绘白板风、精致矢量图风、温馨卡通信息图等六种预设模板,项目可自定义模板覆盖默认值。当用户需要为文章、文档生成插图、配图、概念图,或基于已有图片进行编辑时使用。
将用户上传的图片背景去掉,输出透明背景的 PNG。适用于棋盘格/双色背景:先从边缘像素聚类得到两种背景色,再用 ImageMagick 的连通 floodfill 将背景变为透明。
| name | douyin-extract-text |
| description | 从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。 |
| allowed-tools | Read, Bash, Grep, Glob, Write |
从抖音视频中提取文案,通过 ASR + OCR 双模式结合,实现高质量文案输出。
在执行任何工作流步骤前,必须先运行以下检测,并将 skill 目录路径存入变量:
# 设置 SKILL_DIR(根据实际路径调整)
SKILL_DIR="$HOME/.openclaw/workspace/github-repos/kaiye/skills/douyin-extract-text"
# 检测 uv
which uv > /dev/null 2>&1 || { echo "❌ 需先安装 uv: curl -LsSf https://astral.sh/uv/install.sh | sh"; exit 1; }
# 检测 ffmpeg
which ffmpeg > /dev/null 2>&1 || { echo "❌ 需先安装 ffmpeg"; exit 1; }
ffmpeg 安装方式(按平台):
brew install ffmpegsudo apt install ffmpegsudo yum install ffmpegPython 依赖由
uv run自动管理,无需手动pip install。
无需配置! ASR 使用本地 Faster-Whisper 模型,完全离线工作。
首次运行时会自动下载(约 250MB):
必须首先执行,ASR 结果作为最终文案的主体(句子连贯)。
uv run $SKILL_DIR/scripts/video_asr.py "抖音分享链接" -o ./output
输出文件(均在 -o 指定的目录下):
{video_id}.mp4 — 下载的视频{video_id}.mp3 — 提取的音频(ASR 识别用){video_id}_asr.txt — 语音识别结果必须执行,OCR 结果用于订正 ASR 中的专业术语错误。
使用 --local 复用第一步已下载的视频,避免重复下载:
# 将 {video_id} 替换为实际的视频 ID
uv run $SKILL_DIR/scripts/video_ocr.py --local ./output/{video_id}.mp4 -o ./output
输出:{video_id}_ocr.txt
ASR 和 OCR 的输出文件名已区分(
_asr.txt/_ocr.txt),不会互相覆盖。
在执行整理前,先读取 $SKILL_DIR/CORRECTION.md 中的已知订正词表作为参考。
综合 ASR 和 OCR 结果,生成完整文案:
请综合语音识别(ASR)和 OCR 识别结果,生成完整的视频文案。
整理规则:
1. OCR 结果是硬字幕(视频文案主体),优先使用
2. ASR 结果可能包含 BGM 歌词、画外音等额外信息,酌情补充
3. 如果 OCR 为空或内容很少,以 ASR 为主
4. 使用订正词表修正专业术语错误
OCR 识别结果(硬字幕):
[读取 ./output/*_ocr.txt 内容]
语音识别结果(ASR,含 BGM/画外音):
[读取 ./output/*_asr.txt 内容]
订正词表:
[读取 $SKILL_DIR/CORRECTION.md 内容]
常见订正词表见 CORRECTION.md。
将订正后的文案保存为 Markdown 文件,输出到用户当前工作目录:
文件命名规则:
{视频标题}.md/\:*?"<>|)Markdown 格式要求:
# {视频标题}
{订正后的完整文案,按内容分段}
---
来源:抖音视频
视频ID:{video_id}
原始链接:{抖音分享链接中的 URL}
在输出最终文案后,列出本次订正的所有词汇:
本次订正列表:
| 原文(ASR) | 订正后 |
|-------------|--------|
| cloud code | Claude Code |
| 麦塔 | Meta |
| ... | ... |
是否将这些订正词更新到 CORRECTION.md?(y/n)
如果用户确认,将新的订正词追加到 CORRECTION.md 对应的分类中。
注意:
| 模式 | 优点 | 缺点 |
|---|---|---|
| ASR | 句子连贯完整 | 专业术语易错(cloud → Claude) |
| OCR | 专业术语准确 | 可能包含无关文字,句子不连贯 |
结合使用:ASR 提供连贯的句子结构,OCR 提供准确的术语拼写。
| 参数 | 说明 |
|---|---|
--local | 处理本地视频文件 |
-o, --output | 指定输出目录(默认 ./output) |
--force-local | 强制本地下载处理 |
--info-only | 仅获取视频信息 |
-s, --segment-duration | 视频切分时长(秒),默认 300 |
| 参数 | 说明 |
|---|---|
--local | 处理本地视频文件 |
-o, --output | 指定输出目录(默认 ./output) |
--info-only | 仅获取视频信息 |
--subtitle-area | 自定义字幕区域(默认 0.7,0.95,0.05,0.95) |
# 必须安装 ffmpeg
# macOS:
brew install ffmpeg
# Ubuntu/Debian:
sudo apt install ffmpeg
# uv — Python 依赖由 uv 自动管理,无需手动 pip install
# 安装 uv: curl -LsSf https://astral.sh/uv/install.sh | sh