بنقرة واحدة
volcengine-asr
火山引擎(豆包)语音识别服务。支持音频/视频文件转文字,输出带时间戳的字幕格式(SRT/VTT/TXT)。中文识别效果优秀,支持标点和数字规范化。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
火山引擎(豆包)语音识别服务。支持音频/视频文件转文字,输出带时间戳的字幕格式(SRT/VTT/TXT)。中文识别效果优秀,支持标点和数字规范化。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
火山引擎语音识别 - 将音频/视频转文字,支持长音频分段识别。
Use when publishing an Obsidian plugin to the community plugin store, creating GitHub Releases for Obsidian plugins, or submitting PRs to obsidianmd/obsidian-releases
一键部署静态网站到 Vercel 和 Cloudflare Pages。支持 HTML/React/Vue 等任意静态项目。
将 Expo/React Native 项目通过 EAS Build 构建 iOS 包并提交到 TestFlight。支持从零配置 EAS、构建、提交全流程。
综合画图工具 - AI 生图 (Nanobanana/Gemini) + 图片后处理(拼接/抠图/圆形裁剪/合成)。支持中英文自然语言画图。
统一搜索与抓取能力层 - 整合所有外部信息获取接口(搜索、抓取、下载)
| name | volcengine-asr |
| description | 火山引擎(豆包)语音识别服务。支持音频/视频文件转文字,输出带时间戳的字幕格式(SRT/VTT/TXT)。中文识别效果优秀,支持标点和数字规范化。 |
| allowed-tools | Bash(python:*), Bash(ffmpeg*), Read, Write, Glob |
| model | sonnet |
通过火山引擎(豆包大模型)将音频/视频文件转换为文字,支持输出 SRT/VTT 字幕或纯文本。
需要在火山引擎控制台创建应用并获取凭证:
APP ID 和 Access Tokenvolc.bigasr.sauc.durationcd /Users/liuyishou/.claude/skills/volcengine-asr/scripts
# 转录音频文件
python volcengine_asr.py --input audio.mp3 --output result.txt
# 输出 SRT 字幕
python volcengine_asr.py --input video.mp4 --output subtitles.srt --format srt
# 输出 VTT 字幕
python volcengine_asr.py --input audio.wav --output subtitles.vtt --format vtt
# 自动提取音频并转录
python volcengine_asr.py --input video.mp4 --output transcript.txt
# 生成字幕文件
python volcengine_asr.py --input video.mp4 --output video.srt --format srt
| 参数 | 说明 | 默认值 |
|---|---|---|
--input, -i | 输入音频/视频文件(必填) | - |
--output, -o | 输出文件路径 | 自动生成 |
--format, -f | 输出格式:txt/srt/vtt/json | txt |
--language, -l | 识别语言 | zh-CN |
--no-punc | 不添加标点符号 | False |
--no-itn | 不做数字规范化 | False |
视频文件会自动提取音频轨道进行转录。
大家好,欢迎来到今天的分享。
我们今天要讨论的主题是人工智能。
1
00:00:00,000 --> 00:00:02,500
大家好,欢迎来到今天的分享。
2
00:00:02,500 --> 00:00:05,000
我们今天要讨论的主题是人工智能。
WEBVTT
00:00:00.000 --> 00:00:02.500
大家好,欢迎来到今天的分享。
00:00:02.500 --> 00:00:05.000
我们今天要讨论的主题是人工智能。
确认音频/视频文件存在且格式正确。
--format txt--format srt 或 --format vtt--format jsoncd /Users/liuyishou/.claude/skills/volcengine-asr/scripts
python volcengine_asr.py --input /path/to/file --output /path/to/output --format srt
# 先转录生成字幕
python volcengine_asr.py --input video.mp4 --output video.srt --format srt
# 再生成章节导航(使用 video-chapter-nav skill)
# 先转录音频获取文本
python volcengine_asr.py --input narration.mp3 --output script.txt
# 再用文本生成漫画视频
在 .env 文件中配置凭证:
VOLC_ASR_APPID=your_app_id
VOLC_ASR_TOKEN=your_access_token
VOLC_ASR_RESOURCE_ID=volc.bigasr.sauc.duration
或者使用命令行参数:
python volcengine_asr.py --input audio.mp3 --app-id xxx --token xxx
pip install websockets aiofiles
还需要 ffmpeg 用于音频格式转换:
brew install ffmpeg # macOS
openspeech.bytedance.comALL_PROXY="" HTTP_PROXY="" HTTPS_PROXY="" NO_PROXY="*" python volcengine_asr.py ...
| 错误 | 原因 | 解决方案 |
|---|---|---|
| Missing credentials | 未配置凭证 | 检查 .env 或命令行参数 |
| Connection failed | 网络问题 | 检查网络连接 |
| Invalid audio format | 音频格式不支持 | 确保安装了 ffmpeg |