소스 정보
- 저장소
- Leoyishou/personal-ai-company
- 최근 소스 활동
- 2026년 3월 31일 03:57
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 28
- 포크
- 9
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/Leoyishou/personal-ai-company --skill volcengine-asr명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
火山引擎语音识别 - 将音频/视频转文字,支持长音频分段识别。
Use when publishing an Obsidian plugin to the community plugin store, creating GitHub Releases for Obsidian plugins, or submitting PRs to obsidianmd/obsidian-releases
一键部署静态网站到 Vercel 和 Cloudflare Pages。支持 HTML/React/Vue 等任意静态项目。
SOC 직업 분류 기준
SKILL.md 표시 중
| name | volcengine-asr |
| description | 火山引擎(豆包)语音识别服务。支持音频/视频文件转文字,输出带时间戳的字幕格式(SRT/VTT/TXT)。中文识别效果优秀,支持标点和数字规范化。 |
| allowed-tools | Bash(python:*), Bash(ffmpeg*), Read, Write, Glob |
| model | sonnet |
通过火山引擎(豆包大模型)将音频/视频文件转换为文字,支持输出 SRT/VTT 字幕或纯文本。
需要在火山引擎控制台创建应用并获取凭证:
APP ID 和 Access Tokenvolc.bigasr.sauc.durationcd /Users/liuyishou/.claude/skills/volcengine-asr/scripts
# 转录音频文件
python volcengine_asr.py --input audio.mp3 --output result.txt
# 输出 SRT 字幕
python volcengine_asr.py --input video.mp4 --output subtitles.srt --format srt
# 输出 VTT 字幕
python volcengine_asr.py --input audio.wav --output subtitles.vtt --format vtt
# 自动提取音频并转录
python volcengine_asr.py --input video.mp4 --output transcript.txt
# 生成字幕文件
python volcengine_asr.py --input video.mp4 --output video.srt --format srt
| 参数 | 说明 | 默认值 |
|---|---|---|
--input, -i | 输入音频/视频文件(必填) | - |
--output, -o | 输出文件路径 | 自动生成 |
--format, -f | 输出格式:txt/srt/vtt/json | txt |
--language, -l | 识别语言 | zh-CN |
--no-punc | 不添加标点符号 | False |
--no-itn | 不做数字规范化 | False |
视频文件会自动提取音频轨道进行转录。
大家好,欢迎来到今天的分享。
我们今天要讨论的主题是人工智能。
1
00:00:00,000 --> 00:00:02,500
大家好,欢迎来到今天的分享。
2
00:00:02,500 --> 00:00:05,000
我们今天要讨论的主题是人工智能。
WEBVTT
00:00:00.000 --> 00:00:02.500
大家好,欢迎来到今天的分享。
00:00:02.500 --> 00:00:05.000
我们今天要讨论的主题是人工智能。
确认音频/视频文件存在且格式正确。
--format txt--format srt 或 --format vtt--format jsoncd /Users/liuyishou/.claude/skills/volcengine-asr/scripts
python volcengine_asr.py --input /path/to/file --output /path/to/output --format srt
# 先转录生成字幕
python volcengine_asr.py --input video.mp4 --output video.srt --format srt
# 再生成章节导航(使用 video-chapter-nav skill)
# 先转录音频获取文本
python volcengine_asr.py --input narration.mp3 --output script.txt
# 再用文本生成漫画视频
在 .env 文件中配置凭证:
VOLC_ASR_APPID=your_app_id
VOLC_ASR_TOKEN=your_access_token
VOLC_ASR_RESOURCE_ID=volc.bigasr.sauc.duration
或者使用命令行参数:
python volcengine_asr.py --input audio.mp3 --app-id xxx --token xxx
pip install websockets aiofiles
还需要 ffmpeg 用于音频格式转换:
brew install ffmpeg # macOS
openspeech.bytedance.comALL_PROXY="" HTTP_PROXY="" HTTPS_PROXY="" NO_PROXY="*" python volcengine_asr.py ...
| 错误 | 原因 | 解决方案 |
|---|---|---|
| Missing credentials | 未配置凭证 | 检查 .env 或命令行参数 |
| Connection failed | 网络问题 | 检查网络连接 |
| Invalid audio format | 音频格式不支持 | 确保安装了 ffmpeg |