一键导入
qwen-api-tts-worker
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
通过阿里云百炼 / DashScope 的 Qwen TTS API 生成语音,并让一个常驻 worker 按请求在多个角色与会话之间安全切换。支持 Qwen 声音设计、个人非商业用途的声音复刻、已有 voice_id 和 OumuQ 全局串行播放。
当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。
当用户希望 Codex 聊天回复既保持选定角色风格、又通过 TTS 播放时使用。覆盖所有可见 Codex 输出、从 voice-references 选择角色人格/风格、先提交语音再显示文本、语音语言和屏幕语言不同的情况、支持时的情绪提示、工作区归属的缓存/输出,以及 UTF-8 中文路径。
从中文 Wiki、网页、本地资料、角色设定或参考音频中提取角色人格、语言风格和 TTS 参数,创建或更新 OumuQ 的 voice-references 角色条目。角色 TTS 或声音克隆任务应先把可用参考音频提取到本机私有目录,再按用户选择使用本地或千问克隆;skill、代码和脱敏模板可以发布,但真实 TTS 参考音频不得放到 GitHub 或公网地址。用户要求创建、添加、注册、提取或还原角色,制作中文角色提示词、语音角色、音色克隆配置或对话模式角色时使用。
当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。
当 Agent 回复需要在屏幕和语音里都完整保持角色时使用。先把语音提交给 OumuQ 兼容的常驻 TTS worker,等待 queued 成功后再显示可见文本,并在屏幕语言和语音语言不同时保留角色语气。
| name | qwen-api-tts-worker |
| description | 当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。 |
这个公开模板用于暴露 OumuQ worker contract 的云端 TTS worker:
GET /health
GET /status
GET /status/<job_id>
POST /speak
按 provider/engine 运行一个共享的长生命周期 worker,并让每次请求独立选择角色:
Agent -> http://127.0.0.1:8767/speak -> worker -> cloud TTS provider
POST /speak 应该快速返回一个 queued job object。生成和播放继续在 worker 内进行。
POST /speak 都携带 character_id。--character-id 只提供 legacy 默认值。play=false 并只负责生成。qwen-tts-api Skill 安装。密钥使用环境变量:
$env:DASHSCOPE_API_KEY = "..."
完成报告必须区分三层:服务商为阿里云百炼,API 为 DashScope,Qwen-TTS-API 是本地 OumuQ worker 名;真实模型单独写出。
默认使用不提交参考音频的 Qwen 声音设计:
{
"id": "cloud_designed_voice",
"tts_engine": "Qwen-TTS-API",
"api_voice_creation_method": "voice_design",
"api_enrollment_model": "qwen-voice-design",
"api_target_model": "qwen3-tts-vd-2026-01-26",
"api_voice_prompt": "<original-voice-description>",
"api_voice_preview_text": "<original-preview-text>",
"api_voice_design_language": "zh",
"send_instructions_by_default": false
}
只有用户明确确认拥有云端声音克隆权利时,才使用:
qwen-voice-enrollment 与完全匹配的 qwen3-tts-vc-*。voice-enrollment 需要 provider 可访问 URL,完成报告必须写真实 cosyvoice-* 模型。声音设计/复刻完成后,真实 api_voice_id 只保存在本机私有注册表。每个 job 必须快照角色、模型、语言和创建方式;不能借用其他会话的音色。
不要发布 API key、voice ID、Data URL、签名 URL、服务器地址、个人路径或参考音频。最终可见报告只显示 voice 是否已配置。
Qwen3-TTS-VC/VD 不支持 provider-side instruction control;不要向它们发送 CosyVoice 的音量、语速、音调或 instructions 字段。只有目标模型明确支持并已验证时才发送。Agent 文本在提交前仍然应该遵循角色风格。
完成后用中文报告服务商、DashScope API、OumuQ 引擎、实际模型、声音设计/复刻方式、角色 ID、语言、WAV 验证状态,以及“OumuQ 进程内 FIFO + 主机级播放互斥、不叠音”。使用 play=false 时只能报告策略已验证,不能声称实际扬声器播放已测试。