一键导入
byted-voice-to-text
语音转文字(ASR)。使用火山引擎 BigModel ASR 识别语音,包含极速版(≤2h/100MB 同步快速返回)和标准版(≤5h 异步识别)两种模式。支持飞书语音消息、本地音频文件及音频 URL。当收到语音消息或音频附件(.ogg/.mp3/.wav)时使用本技能。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
语音转文字(ASR)。使用火山引擎 BigModel ASR 识别语音,包含极速版(≤2h/100MB 同步快速返回)和标准版(≤5h 异步识别)两种模式。支持飞书语音消息、本地音频文件及音频 URL。当收到语音消息或音频附件(.ogg/.mp3/.wav)时使用本技能。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
火山引擎函数服务:当用户想把本地前端、Node.js、Python、静态站点或 API 服务部署上线,基于模板创建 serverless 应用,把已有项目接入 veFaaS,查看线上访问地址,配置生产环境变量、构建命令、启动命令或端口,发布、回滚、调用和调试线上函数,查看日志、实例状态或资源配置,拉取/推送云端函数代码,创建和管理沙箱实例,排查部署失败、鉴权失败、框架检测错误、网关缺失等问题,需要直接调用 veFaaS OpenAPI 完成高级操作,或初期上手 veFaaS、想了解 veFaaS 概念/能力/选型/计费、在终端查阅官方文档、接入 veFaaS SDK 或 OpenAPI 进行代码开发时使用。
Manage Volcengine's AI-native BaaS platform (Supabase edition / 火山引擎 AI 原生 BaaS 平台 Supabase 版) — a Volcengine-operated distribution that differs from official Supabase. Covers workspaces, branches, SQL queries, schema changes, Auth, Realtime, Edge Functions, Storage, frontend static-site hosting, and TypeScript type generation through the byted-supabase-cli command-line tool (installed via `npm i -g @byted-supabase/cli`; this is NOT the official `supabase` CLI). Run byted-supabase-cli subcommands to get real-time results. Use this skill when the user needs to create, inspect, or manage Volcengine Supabase resources (workspaces, databases, branches, Auth, Realtime, Edge Functions, Storage, frontend deployment, API keys, or type generation). Do NOT use it for general database discussions, non-Supabase services, or pure client-side coding unrelated to Supabase backend management.
Use this skill only for Volcengine Redis cloud resource operations, including querying, inspecting, creating, or managing Volcengine Redis instances and related cloud resources. Trigger it when the user mentions Volcengine Redis, Volcengine Redis instances, Volcengine Redis inventory/detail lookup, Volcengine Redis operational metadata, or Volcengine Redis MCP/OpenAPI access.
使用火山引擎 MongoDB Skill,帮助用户完成 MongoDB 相关的实例管理、备份恢复、参数等运维任务,可直接调用 uv run ./scripts/call_mongodb.py 脚本获取实时结果。当需要访问管理在火山引擎 MongoDB 实例详细信息时,此 Skill 可以提供方便的接口。
漫剧制作总导演。接受用户故事创意,依次完成剧本创作、角色设计、分镜图生成、分镜视频生成、视频合成全流程,产物保存到 COMIC_DRAMA_OUTPUT_DIR(默认 ./output),最终交付完整漫剧视频和 TOS 链接。
ByteHouse AI 查询技能,提供自然语言转 SQL(Text2SQL)、SQL 执行、库表结构查询、多模态向量化和向量检索等能力,覆盖 ByteHouse 云数仓的日常查询、SQL 生成与执行场景。当用户提到 "ByteHouse"、"查表"、"查数据"、"Text2SQL"、"自然语言查询"、"列出数据库"、"列出表"、"执行 SQL"、"生成 SQL"、"多模态检索" 等诉求,或者需要基于 ByteHouse 完成上述任务时,应使用本 Skill。
| name | byted-voice-to-text |
| description | 语音转文字(ASR)。使用火山引擎 BigModel ASR 识别语音,包含极速版(≤2h/100MB 同步快速返回)和标准版(≤5h 异步识别)两种模式。支持飞书语音消息、本地音频文件及音频 URL。当收到语音消息或音频附件(.ogg/.mp3/.wav)时使用本技能。 |
| license | Complete terms in LICENSE |
| metadata | {"openclaw":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]},"clawdbot":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]},"moltbot":{"emoji":"🎙️","requires":{"env":["MODEL_SPEECH_API_KEY"]},"os":["darwin","linux"]}} |
基于火山引擎 BigModel ASR 将语音转为文字。准确率和多语言能力远优于本地 whisper,且速度更快。
message_type: audio),需要自动识别语音内容inspect_audio.pyasr_flash.py(极速版)或 asr_standard.py(标准版)ensure_ffmpeg.py --execute当你收到语音消息或音频文件附件时:
whisper 命令或 openai-whisper skillpython3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute,只有失败后才向用户求助cd 到本技能目录:skills/byted-voice-to-text。| 条件 | 脚本 |
|---|---|
| 时长 ≤ 2h 且 大小 ≤ 100MB | asr_flash.py --file "<FILE>" (极速版,同步快速返回) |
| 2h < 时长 ≤ 5h | asr_standard.py --file "<FILE>" (标准版,异步 submit+poll) |
| 时长 > 5h | 不支持,先切片后逐片走极速版 |
| 无法获取时长 且 大小 ≤ 100MB | asr_flash.py --file "<FILE>" (极速版兜底) |
| 无法获取时长 且 大小 > 100MB | asr_standard.py --file "<FILE>" (标准版兜底) |
asr_standard.py --url "<URL>"命中 URL、大文件、切片取舍时,再读 routing_strategy.md。
鉴权采用新版控制台方案,详见:快速入门(新版控制台)。
| 环境变量 | 用途 | 必需 |
|---|---|---|
MODEL_SPEECH_API_KEY | API Key(新版控制台方案) | 是 |
MODEL_SPEECH_APP_ID | App ID(旧版鉴权时配合使用) | 否 |
MODEL_SPEECH_ASR_API_BASE | 极速版端点(有默认值) | 否 |
MODEL_SPEECH_ASR_RESOURCE_ID | 极速版资源 ID(默认 volc.bigasr.auc_turbo) | 否 |
MODEL_SPEECH_ASR_STANDARD_SUBMIT_URL | 标准版提交端点(有默认值) | 否 |
MODEL_SPEECH_ASR_STANDARD_QUERY_URL | 标准版查询端点(有默认值) | 否 |
MODEL_SPEECH_ASR_STANDARD_RESOURCE_ID | 标准版资源 ID(默认 volc.bigasr.auc) | 否 |
FEISHU_TENANT_TOKEN | 飞书 tenant_access_token(仅 --file-key 模式) | 否 |
| 脚本 | 用途 | 对应模式 |
|---|---|---|
scripts/inspect_audio.py | 音频元信息探测(时长、采样率、声道等) | 预检 |
scripts/ensure_ffmpeg.py | 自动检测并安装 ffmpeg/ffprobe | 预检 |
scripts/asr_flash.py | 极速版识别(≤2h/100MB,同步) | Express/Flash |
scripts/asr_standard.py | 标准版识别(≤5h,异步 submit+poll) | Standard |
# 预检:探测音频元信息
python3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"
# 缺 ffmpeg 时自动安装
python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute
# 极速版(短音频,≤2h/100MB)
python3 <SKILL_DIR>/scripts/asr_flash.py --file "<AUDIO_FILE>"
# 标准版(长音频或 URL)
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<AUDIO_URL>"
python3 <SKILL_DIR>/scripts/asr_standard.py --file "<LONG_AUDIO_FILE>"
# 标准版:仅提交不轮询
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<URL>" --no-poll
# 标准版:查询已有任务
python3 <SKILL_DIR>/scripts/asr_standard.py --query-task-id <ID> --query-logid <LOGID>
| 参数 | 必填 | 说明 |
|---|---|---|
--file | 三选一 | 本地音频文件路径 |
--url | 三选一 | 音频文件的 URL 地址 |
--file-key | 三选一 | 飞书语音消息的 file_key |
--feishu-token | 否 | 飞书 tenant_access_token |
--appid | 否 | App ID |
--token | 否 | API Key |
--language | 否 | 语言代码 |
| 参数 | 必填 | 说明 |
|---|---|---|
--url | 二选一 | 音频文件的 URL 地址 |
--file | 二选一 | 本地音频文件路径 |
--appid | 否 | App ID |
--token | 否 | API Key |
--language | 否 | 语言代码 |
--no-poll | 否 | 仅提交任务,不轮询结果 |
--poll-interval | 否 | 轮询间隔秒数(默认 3) |
--poll-max-time | 否 | 最大轮询时间秒数(默认 10800) |
--query-task-id | 否 | 查询已有任务 ID |
--query-logid | 否 | 查询时传入的 X-Tt-Logid |
收到 audio 消息 → 音频文件已下载到 /root/.openclaw/media/inbound/ → 执行 asr_flash.py --file → 返回文字 → 当作用户消息处理
常用命令:
# 飞书语音文件(最常用,文件已被飞书插件自动下载)
python scripts/asr_flash.py --file "/root/.openclaw/media/inbound/xxxxx.ogg"
PermissionError: MODEL_SPEECH_API_KEY ... → 提示用户配置 API KeyASR 请求失败 → 检查 API 凭据及账号音频时长超过 5 小时 → 提示用户切分文件音频文件不存在/为空 → 检查文件路径