asr
语音转文字:使用火山引擎 BigModel ASR,含极速版(约 2 小时/100MB 内同步)与标准版(约 5 小时内异步)等模式。 支持飞书语音消息、本地音频与音频 URL。收到语音消息或常见音频附件(ogg/mp3/wav 等)需转写时使用;需按文档配置 MODEL_SPEECH_API_KEY 等。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
语音转文字:使用火山引擎 BigModel ASR,含极速版(约 2 小时/100MB 内同步)与标准版(约 5 小时内异步)等模式。 支持飞书语音消息、本地音频与音频 URL。收到语音消息或常见音频附件(ogg/mp3/wav 等)需转写时使用;需按文档配置 MODEL_SPEECH_API_KEY 等。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
根据视频内容生成与画面匹配的解说旁白,使用 Ark TTS 合成有吸引力的配音并替换原音轨
根据视频情绪/风格从音乐库中自动匹配合适的 BGM 并混音,支持 ducking
基于豆包大模型 ASR(LAS-ASR-PRO)的高精度语音转写:支持视频自动抽取音轨、降噪预处理、超大文件与超长时长、 TOS 内网路径(tos://)输入;输出带时间戳的分句 JSON,可选说话人分离、情感/性别/语速、敏感词过滤等扩展分析。 异步 submit/poll。适用于台词精转、会议纪要、多语言音视频(支持多格式与自动语种检测)。需 LAS 侧鉴权与算子配置。
从视频或纯音频中提取音轨,并按固定时长切分;支持 wav/mp3/flac 等格式转换,输入输出可对接 TOS。 需 LAS_API_KEY。适用于批量抽音频、等长分段、给 ASR/剪辑流水线备料。
按自然语言描述从长视频中抽取片段:高光、指定场景、参考图找人/找物、长视频语义分段与带时间戳的摘要。 支持参考图锁定目标,结果多为 TOS 上的剪辑 URL。需 LAS_API_KEY 与算子区域配置。适合云端粗剪、素材初筛与自动化拆条。
OpenClaw 系统诊断和性能分析工具。分析 agent 推理耗时、Token 用量、工具调用统计、 Run 时间线、Gateway 重启历史。支持多种模式:批量分析(默认)、实时跟踪(-f)、 摘要统计(-s)、高级诊断(--advanced)。支持多 Agent 过滤。 使用场景:当用户询问 OpenClaw 运行状态、性能瓶颈、推理延迟、Token 消耗、 工具执行统计、错误排查、agent 活动分析时触发。 触发词:诊断、diagnostics、性能分析、推理耗时、token统计、运行状态、 agent分析、工具调用统计、Run详情、Gateway重启。 指令触发:/diag — 直接执行诊断,支持参数透传。
| name | 语音转文字(豆包 ASR) |
| description | 语音转文字:使用火山引擎 BigModel ASR,含极速版(约 2 小时/100MB 内同步)与标准版(约 5 小时内异步)等模式。 支持飞书语音消息、本地音频与音频 URL。收到语音消息或常见音频附件(ogg/mp3/wav 等)需转写时使用;需按文档配置 MODEL_SPEECH_API_KEY 等。 |
| trigger | 语音转文字、ASR、语音识别、飞书语音、音频转写 |
| license | Complete terms in LICENSE |
| metadata | {"openclaw":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]},"clawdbot":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]},"moltbot":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]}} |
基于火山引擎 BigModel ASR 将语音转为文字。准确率和多语言能力远优于本地 whisper,且速度更快。
message_type: audio),需要自动识别语音内容inspect_audio.pyasr_flash.py(极速版)或 asr_standard.py(标准版)ensure_ffmpeg.py --execute当你收到语音消息或音频文件附件时:
whisper 命令或 openai-whisper skillpython3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute,只有失败后才向用户求助cd 到本技能目录:skills/byted-voice-to-text。| 条件 | 脚本 |
|---|---|
| 时长 ≤ 2h 且 大小 ≤ 100MB | asr_flash.py --file "<FILE>" (极速版,同步快速返回) |
| 2h < 时长 ≤ 5h | asr_standard.py --file "<FILE>" (标准版,异步 submit+poll) |
| 时长 > 5h | 不支持,先切片后逐片走极速版 |
| 无法获取时长 且 大小 ≤ 100MB | asr_flash.py --file "<FILE>" (极速版兜底) |
| 无法获取时长 且 大小 > 100MB | asr_standard.py --file "<FILE>" (标准版兜底) |
asr_standard.py --url "<URL>"命中 URL、大文件、切片取舍时,再读 routing_strategy.md。
鉴权采用新版控制台方案,详见:快速入门(新版控制台)。
| 环境变量 | 用途 | 必需 |
|---|---|---|
MODEL_SPEECH_API_KEY | API Key(新版控制台方案) | 是 |
MODEL_SPEECH_APP_ID | App ID(旧版鉴权时配合使用) | 否 |
MODEL_SPEECH_ASR_API_BASE | 极速版端点(有默认值) | 否 |
MODEL_SPEECH_ASR_RESOURCE_ID | 极速版资源 ID(默认 volc.bigasr.auc_turbo) | 否 |
MODEL_SPEECH_ASR_STANDARD_SUBMIT_URL | 标准版提交端点(有默认值) | 否 |
MODEL_SPEECH_ASR_STANDARD_QUERY_URL | 标准版查询端点(有默认值) | 否 |
MODEL_SPEECH_ASR_STANDARD_RESOURCE_ID | 标准版资源 ID(默认 volc.bigasr.auc) | 否 |
FEISHU_TENANT_TOKEN | 飞书 tenant_access_token(仅 --file-key 模式) | 否 |
| 脚本 | 用途 | 对应模式 |
|---|---|---|
scripts/inspect_audio.py | 音频元信息探测(时长、采样率、声道等) | 预检 |
scripts/ensure_ffmpeg.py | 自动检测并安装 ffmpeg/ffprobe | 预检 |
scripts/asr_flash.py | 极速版识别(≤2h/100MB,同步) | Express/Flash |
scripts/asr_standard.py | 标准版识别(≤5h,异步 submit+poll) | Standard |
# 预检:探测音频元信息
python3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"
# 缺 ffmpeg 时自动安装
python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute
# 极速版(短音频,≤2h/100MB)
python3 <SKILL_DIR>/scripts/asr_flash.py --file "<AUDIO_FILE>"
# 标准版(长音频或 URL)
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<AUDIO_URL>"
python3 <SKILL_DIR>/scripts/asr_standard.py --file "<LONG_AUDIO_FILE>"
# 标准版:仅提交不轮询
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<URL>" --no-poll
# 标准版:查询已有任务
python3 <SKILL_DIR>/scripts/asr_standard.py --query-task-id <ID> --query-logid <LOGID>
| 参数 | 必填 | 说明 |
|---|---|---|
--file | 三选一 | 本地音频文件路径 |
--url | 三选一 | 音频文件的 URL 地址 |
--file-key | 三选一 | 飞书语音消息的 file_key |
--feishu-token | 否 | 飞书 tenant_access_token |
--appid | 否 | App ID |
--token | 否 | API Key |
--language | 否 | 语言代码 |
| 参数 | 必填 | 说明 |
|---|---|---|
--url | 二选一 | 音频文件的 URL 地址 |
--file | 二选一 | 本地音频文件路径 |
--appid | 否 | App ID |
--token | 否 | API Key |
--language | 否 | 语言代码 |
--no-poll | 否 | 仅提交任务,不轮询结果 |
--poll-interval | 否 | 轮询间隔秒数(默认 3) |
--poll-max-time | 否 | 最大轮询时间秒数(默认 10800) |
--query-task-id | 否 | 查询已有任务 ID |
--query-logid | 否 | 查询时传入的 X-Tt-Logid |
收到 audio 消息 → 音频文件已下载到 /root/.openclaw/media/inbound/ → 执行 asr_flash.py --file → 返回文字 → 当作用户消息处理
常用命令:
# 飞书语音文件(最常用,文件已被飞书插件自动下载)
python scripts/asr_flash.py --file "/root/.openclaw/media/inbound/xxxxx.ogg"
PermissionError: MODEL_SPEECH_API_KEY ... → 提示用户配置 API KeyASR 请求失败 → 检查 API 凭据及账号音频时长超过 5 小时 → 提示用户切分文件音频文件不存在/为空 → 检查文件路径