tts
将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
| name | 豆包语音合成(TTS) |
| version | 1.0.0 |
| author | volcengine-speech-team |
| description | 将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。 |
| trigger | TTS、文字转语音、语音合成、朗读、配音、豆包语音 |
| license | Complete terms in LICENSE |
| homepage | https://www.volcengine.com/docs/6561/1257543 |
基于火山引擎豆包语音合成(HTTP Chunked/SSE 单向流式-V3)将文本转为语音并保存为音频文件。
当用户有以下需求时,优先使用本 skill:
优先检查是否已配置以下凭证:
MODEL_SPEECH_API_KEY如果缺少凭证,打开 references/setup-guide.md 查看开通、申请和配置方式,并给予用户开通建议
| 参数 | 简写 | 必填 | 说明 |
|---|---|---|---|
--text | -t | 是 | 要合成的文本内容 |
--output | -o | 否 | 输出音频文件路径(默认自动生成) |
--speaker | -s | 否 | 发音人,默认 zh_female_vv_uranus_bigtts,音色列表 |
--format | 否 | 音频格式:mp3(默认)、pcm、ogg_opus | |
--sample-rate | 否 | 采样率,如 16000、24000(默认 24000) | |
--speech-rate | 否 | 语速 [-50, 100],100 代表 2.0 倍速,-50 代表 0.5 倍速,默认 0 | |
--pitch-rate | 否 | 音调 [-12, 12],默认 0 | |
--loudness-rate | 否 | 音量 [-50, 100],100 代表 2.0 倍音量,-50 代表 0.5 倍音量,默认 0 | |
--bit-rate | 否 | 比特率,对 mp3 和 ogg_opus 格式生效(如 64000、128000),默认 64000 | |
--filter-markdown | 否 | 过滤 markdown 语法(如 **你好** 读为"你好"),默认关闭 | |
--enable-latex | 否 | 启用 LaTeX 公式播报(使用 latex_parser v2,自动开启 markdown 过滤),默认关闭 |
脚本输出 JSON,包含:
status: "success" 或 "error"local_path: 本地音频文件路径format: 音频格式error: 失败时的错误信息请将 local_path 或可访问的音频 URL 返回给用户,便于播放或下载。
PermissionError: MODEL_SPEECH_API_KEY ... 需在环境变量中配置:提示用户在 API Key 管理 获取并配置 MODEL_SPEECH_API_KEY,写入 workspace 下的环境变量文件后重试。references/setup-guide.mdreferences/docs-index.md按需打开以下文件,不必默认全部加载:
references/setup-guide.md:服务开通、凭证申请、环境变量配置references/docs-index.md:API 文档索引、参数说明、音色列表、错误码速查# 基本用法
python scripts/text_to_speech.py -t "欢迎使用火山引擎语音合成服务。"
# 指定发音人与输出格式
python scripts/text_to_speech.py -t "这是一段测试语音。" -s zh_female_vv_uranus_bigtts -o output.mp3 --format mp3
# 指定语速与采样率
python scripts/text_to_speech.py -t "语速和音调可调。" --speech-rate 10 --sample-rate 16000
根据视频内容生成与画面匹配的解说旁白,使用 Ark TTS 合成有吸引力的配音并替换原音轨
根据视频情绪/风格从音乐库中自动匹配合适的 BGM 并混音,支持 ducking
基于豆包大模型 ASR(LAS-ASR-PRO)的高精度语音转写:支持视频自动抽取音轨、降噪预处理、超大文件与超长时长、 TOS 内网路径(tos://)输入;输出带时间戳的分句 JSON,可选说话人分离、情感/性别/语速、敏感词过滤等扩展分析。 异步 submit/poll。适用于台词精转、会议纪要、多语言音视频(支持多格式与自动语种检测)。需 LAS 侧鉴权与算子配置。
从视频或纯音频中提取音轨,并按固定时长切分;支持 wav/mp3/flac 等格式转换,输入输出可对接 TOS。 需 LAS_API_KEY。适用于批量抽音频、等长分段、给 ASR/剪辑流水线备料。
按自然语言描述从长视频中抽取片段:高光、指定场景、参考图找人/找物、长视频语义分段与带时间戳的摘要。 支持参考图锁定目标,结果多为 TOS 上的剪辑 URL。需 LAS_API_KEY 与算子区域配置。适合云端粗剪、素材初筛与自动化拆条。
OpenClaw 系统诊断和性能分析工具。分析 agent 推理耗时、Token 用量、工具调用统计、 Run 时间线、Gateway 重启历史。支持多种模式:批量分析(默认)、实时跟踪(-f)、 摘要统计(-s)、高级诊断(--advanced)。支持多 Agent 过滤。 使用场景:当用户询问 OpenClaw 运行状态、性能瓶颈、推理延迟、Token 消耗、 工具执行统计、错误排查、agent 活动分析时触发。 触发词:诊断、diagnostics、性能分析、推理耗时、token统计、运行状态、 agent分析、工具调用统计、Run详情、Gateway重启。 指令触发:/diag — 直接执行诊断,支持参数透传。