tts
将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
根据视频内容生成与画面匹配的解说旁白,使用 Ark TTS 合成有吸引力的配音并替换原音轨
根据视频情绪/风格从音乐库中自动匹配合适的 BGM 并混音,支持 ducking
基于豆包大模型 ASR(LAS-ASR-PRO)的高精度语音转写:支持视频自动抽取音轨、降噪预处理、超大文件与超长时长、 TOS 内网路径(tos://)输入;输出带时间戳的分句 JSON,可选说话人分离、情感/性别/语速、敏感词过滤等扩展分析。 异步 submit/poll。适用于台词精转、会议纪要、多语言音视频(支持多格式与自动语种检测)。需 LAS 侧鉴权与算子配置。
从视频或纯音频中提取音轨,并按固定时长切分;支持 wav/mp3/flac 等格式转换,输入输出可对接 TOS。 需 LAS_API_KEY。适用于批量抽音频、等长分段、给 ASR/剪辑流水线备料。
按自然语言描述从长视频中抽取片段:高光、指定场景、参考图找人/找物、长视频语义分段与带时间戳的摘要。 支持参考图锁定目标,结果多为 TOS 上的剪辑 URL。需 LAS_API_KEY 与算子区域配置。适合云端粗剪、素材初筛与自动化拆条。
OpenClaw 系统诊断和性能分析工具。分析 agent 推理耗时、Token 用量、工具调用统计、 Run 时间线、Gateway 重启历史。支持多种模式:批量分析(默认)、实时跟踪(-f)、 摘要统计(-s)、高级诊断(--advanced)。支持多 Agent 过滤。 使用场景:当用户询问 OpenClaw 运行状态、性能瓶颈、推理延迟、Token 消耗、 工具执行统计、错误排查、agent 活动分析时触发。 触发词:诊断、diagnostics、性能分析、推理耗时、token统计、运行状态、 agent分析、工具调用统计、Run详情、Gateway重启。 指令触发:/diag — 直接执行诊断,支持参数透传。
| name | 豆包语音合成(TTS) |
| version | 1.0.0 |
| author | volcengine-speech-team |
| description | 将文本合成为可播放语音:基于火山引擎豆包语音合成(HTTP 流式等),支持多音色、语速/音调/音量调节, 以及 Markdown 过滤与 LaTeX 公式播报。适用于配音、旁白、播报、有声片段。用户提到「文字转语音」「TTS」「朗读」「配音」时使用。 |
| trigger | TTS、文字转语音、语音合成、朗读、配音、豆包语音 |
| license | Complete terms in LICENSE |
| homepage | https://www.volcengine.com/docs/6561/1257543 |
基于火山引擎豆包语音合成(HTTP Chunked/SSE 单向流式-V3)将文本转为语音并保存为音频文件。
当用户有以下需求时,优先使用本 skill:
优先检查是否已配置以下凭证:
MODEL_SPEECH_API_KEY如果缺少凭证,打开 references/setup-guide.md 查看开通、申请和配置方式,并给予用户开通建议
| 参数 | 简写 | 必填 | 说明 |
|---|---|---|---|
--text | -t | 是 | 要合成的文本内容 |
--output | -o | 否 | 输出音频文件路径(默认自动生成) |
--speaker | -s | 否 | 发音人,默认 zh_female_vv_uranus_bigtts,音色列表 |
--format | 否 | 音频格式:mp3(默认)、pcm、ogg_opus | |
--sample-rate | 否 | 采样率,如 16000、24000(默认 24000) | |
--speech-rate | 否 | 语速 [-50, 100],100 代表 2.0 倍速,-50 代表 0.5 倍速,默认 0 | |
--pitch-rate | 否 | 音调 [-12, 12],默认 0 | |
--loudness-rate | 否 | 音量 [-50, 100],100 代表 2.0 倍音量,-50 代表 0.5 倍音量,默认 0 | |
--bit-rate | 否 | 比特率,对 mp3 和 ogg_opus 格式生效(如 64000、128000),默认 64000 | |
--filter-markdown | 否 | 过滤 markdown 语法(如 **你好** 读为"你好"),默认关闭 | |
--enable-latex | 否 | 启用 LaTeX 公式播报(使用 latex_parser v2,自动开启 markdown 过滤),默认关闭 |
脚本输出 JSON,包含:
status: "success" 或 "error"local_path: 本地音频文件路径format: 音频格式error: 失败时的错误信息请将 local_path 或可访问的音频 URL 返回给用户,便于播放或下载。
PermissionError: MODEL_SPEECH_API_KEY ... 需在环境变量中配置:提示用户在 API Key 管理 获取并配置 MODEL_SPEECH_API_KEY,写入 workspace 下的环境变量文件后重试。references/setup-guide.mdreferences/docs-index.md按需打开以下文件,不必默认全部加载:
references/setup-guide.md:服务开通、凭证申请、环境变量配置references/docs-index.md:API 文档索引、参数说明、音色列表、错误码速查# 基本用法
python scripts/text_to_speech.py -t "欢迎使用火山引擎语音合成服务。"
# 指定发音人与输出格式
python scripts/text_to_speech.py -t "这是一段测试语音。" -s zh_female_vv_uranus_bigtts -o output.mp3 --format mp3
# 指定语速与采样率
python scripts/text_to_speech.py -t "语速和音调可调。" --speech-rate 10 --sample-rate 16000