بنقرة واحدة
douyin-extract-text
从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
Generate videos using Google Veo API (veo-3.1-fast-generate-preview). Supports three modes: (1) text-to-video — user provides a prompt, generate directly; (2) video-to-prompt — user uploads a reference video, analyze with Gemini VLM to generate structured Veo prompts, discuss and refine, then generate; (3) image-referenced generation — use a reference image to guide composition/style. Triggers when user asks to generate a video, create a video from a prompt, use Veo, analyze a video for prompt generation, or produce a short video clip. Uses Gemini API key and SOCKS5 proxy automatically.
语音口述驱动的文章创作流程。用户通过发送语音录音提供素材,AI 转录、整理、多轮迭代,最终输出结构化 Markdown 文章。支持截图标注 review(红色=删除,黄色=修改)和封面图生成。适合 OpenClaw 等对话式 Agent 使用。触发场景:用户发送语音录音要写文章、说"根据这段录音整理成文章"、"帮我把这几段语音整理一下",或发送截图要求按标注修改文章时使用。不适用于需要多 Agent 协作、素材调研、事实核查的长文创作(请用 writing-team skill)。
7 人 AI 写作团队编排。启动素材猎手、主笔、事实核查、风格审计、标题工匠协作完成长文创作。 触发场景:用户要求写自媒体长文、需要素材调研或事实核查、提到"用我的风格写"、"去 AI 味"、"多角度打磨"。 仅支持 Claude Code(依赖 Agent Teams 实验功能),不适用于 OpenClaw 等对话式 Agent。 不适用于语音录音整理(请用 voice-article skill)。
将 Markdown 文章规范化处理后发布到微信公众号草稿箱。依赖 wenyan-mcp(MCP 工具)和 gemini-image-gen skill(封面图生成)。触发场景:用户说"发布到微信"、"发到公众号"、"推送文章"、"发布这篇文章",或提供 markdown 文件要求发布到微信公众号时使用。
使用 Gemini 生成和编辑配图。支持手绘白板风、精致矢量图风、温馨卡通信息图等六种预设模板,项目可自定义模板覆盖默认值。当用户需要为文章、文档生成插图、配图、概念图,或基于已有图片进行编辑时使用。
将用户上传的图片背景去掉,输出透明背景的 PNG。适用于棋盘格/双色背景:先从边缘像素聚类得到两种背景色,再用 ImageMagick 的连通 floodfill 将背景变为透明。
| name | douyin-extract-text |
| description | 从抖音视频中提取文案。支持 OCR(硬字幕识别)和 ASR(语音识别)两种模式,并自动进行专业术语订正。当用户需要提取抖音视频文案、字幕、或处理抖音链接时使用。 |
| allowed-tools | Read, Bash, Grep, Glob, Write |
从抖音视频中提取文案,通过 ASR + OCR 双模式结合,实现高质量文案输出。
在执行任何工作流步骤前,必须先运行以下检测,并将 skill 目录路径存入变量:
# 设置 SKILL_DIR(根据实际路径调整)
SKILL_DIR="$HOME/.openclaw/workspace/github-repos/kaiye/skills/douyin-extract-text"
# 检测 uv
which uv > /dev/null 2>&1 || { echo "❌ 需先安装 uv: curl -LsSf https://astral.sh/uv/install.sh | sh"; exit 1; }
# 检测 ffmpeg
which ffmpeg > /dev/null 2>&1 || { echo "❌ 需先安装 ffmpeg"; exit 1; }
ffmpeg 安装方式(按平台):
brew install ffmpegsudo apt install ffmpegsudo yum install ffmpegPython 依赖由
uv run自动管理,无需手动pip install。
无需配置! ASR 使用本地 Faster-Whisper 模型,完全离线工作。
首次运行时会自动下载(约 250MB):
必须首先执行,ASR 结果作为最终文案的主体(句子连贯)。
uv run $SKILL_DIR/scripts/video_asr.py "抖音分享链接" -o ./output
输出文件(均在 -o 指定的目录下):
{video_id}.mp4 — 下载的视频{video_id}.mp3 — 提取的音频(ASR 识别用){video_id}_asr.txt — 语音识别结果必须执行,OCR 结果用于订正 ASR 中的专业术语错误。
使用 --local 复用第一步已下载的视频,避免重复下载:
# 将 {video_id} 替换为实际的视频 ID
uv run $SKILL_DIR/scripts/video_ocr.py --local ./output/{video_id}.mp4 -o ./output
输出:{video_id}_ocr.txt
ASR 和 OCR 的输出文件名已区分(
_asr.txt/_ocr.txt),不会互相覆盖。
在执行整理前,先读取 $SKILL_DIR/CORRECTION.md 中的已知订正词表作为参考。
综合 ASR 和 OCR 结果,生成完整文案:
请综合语音识别(ASR)和 OCR 识别结果,生成完整的视频文案。
整理规则:
1. OCR 结果是硬字幕(视频文案主体),优先使用
2. ASR 结果可能包含 BGM 歌词、画外音等额外信息,酌情补充
3. 如果 OCR 为空或内容很少,以 ASR 为主
4. 使用订正词表修正专业术语错误
OCR 识别结果(硬字幕):
[读取 ./output/*_ocr.txt 内容]
语音识别结果(ASR,含 BGM/画外音):
[读取 ./output/*_asr.txt 内容]
订正词表:
[读取 $SKILL_DIR/CORRECTION.md 内容]
常见订正词表见 CORRECTION.md。
将订正后的文案保存为 Markdown 文件,输出到用户当前工作目录:
文件命名规则:
{视频标题}.md/\:*?"<>|)Markdown 格式要求:
# {视频标题}
{订正后的完整文案,按内容分段}
---
来源:抖音视频
视频ID:{video_id}
原始链接:{抖音分享链接中的 URL}
在输出最终文案后,列出本次订正的所有词汇:
本次订正列表:
| 原文(ASR) | 订正后 |
|-------------|--------|
| cloud code | Claude Code |
| 麦塔 | Meta |
| ... | ... |
是否将这些订正词更新到 CORRECTION.md?(y/n)
如果用户确认,将新的订正词追加到 CORRECTION.md 对应的分类中。
注意:
| 模式 | 优点 | 缺点 |
|---|---|---|
| ASR | 句子连贯完整 | 专业术语易错(cloud → Claude) |
| OCR | 专业术语准确 | 可能包含无关文字,句子不连贯 |
结合使用:ASR 提供连贯的句子结构,OCR 提供准确的术语拼写。
| 参数 | 说明 |
|---|---|
--local | 处理本地视频文件 |
-o, --output | 指定输出目录(默认 ./output) |
--force-local | 强制本地下载处理 |
--info-only | 仅获取视频信息 |
-s, --segment-duration | 视频切分时长(秒),默认 300 |
| 参数 | 说明 |
|---|---|
--local | 处理本地视频文件 |
-o, --output | 指定输出目录(默认 ./output) |
--info-only | 仅获取视频信息 |
--subtitle-area | 自定义字幕区域(默认 0.7,0.95,0.05,0.95) |
# 必须安装 ffmpeg
# macOS:
brew install ffmpeg
# Ubuntu/Debian:
sudo apt install ffmpeg
# uv — Python 依赖由 uv 自动管理,无需手动 pip install
# 安装 uv: curl -LsSf https://astral.sh/uv/install.sh | sh