بنقرة واحدة
qwen-api-tts-worker
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
通过阿里云百炼 / DashScope 的 Qwen TTS API 生成语音,并让一个常驻 worker 按请求在多个角色与会话之间安全切换。支持 Qwen 声音设计、个人非商业用途的声音复刻、已有 voice_id 和 OumuQ 全局串行播放。
当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。
当用户希望 Codex 聊天回复既保持选定角色风格、又通过 TTS 播放时使用。覆盖所有可见 Codex 输出、从 voice-references 选择角色人格/风格、先提交语音再显示文本、语音语言和屏幕语言不同的情况、支持时的情绪提示、工作区归属的缓存/输出,以及 UTF-8 中文路径。
从中文 Wiki、网页、本地资料、角色设定或参考音频中提取角色人格、语言风格和 TTS 参数,创建或更新 OumuQ 的 voice-references 角色条目。角色 TTS 或声音克隆任务应先把可用参考音频提取到本机私有目录,再按用户选择使用本地或千问克隆;skill、代码和脱敏模板可以发布,但真实 TTS 参考音频不得放到 GitHub 或公网地址。用户要求创建、添加、注册、提取或还原角色,制作中文角色提示词、语音角色、音色克隆配置或对话模式角色时使用。
当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。
当 Agent 回复需要在屏幕和语音里都完整保持角色时使用。先把语音提交给 OumuQ 兼容的常驻 TTS worker,等待 queued 成功后再显示可见文本,并在屏幕语言和语音语言不同时保留角色语气。
| name | qwen-api-tts-worker |
| description | 当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。 |
这个公开模板用于暴露 OumuQ worker contract 的云端 TTS worker:
GET /health
GET /status
GET /status/<job_id>
POST /speak
按 provider/engine 运行一个共享的长生命周期 worker,并让每次请求独立选择角色:
Agent -> http://127.0.0.1:8767/speak -> worker -> cloud TTS provider
POST /speak 应该快速返回一个 queued job object。生成和播放继续在 worker 内进行。
POST /speak 都携带 character_id。--character-id 只提供 legacy 默认值。play=false 并只负责生成。qwen-tts-api Skill 安装。密钥使用环境变量:
$env:DASHSCOPE_API_KEY = "..."
完成报告必须区分三层:服务商为阿里云百炼,API 为 DashScope,Qwen-TTS-API 是本地 OumuQ worker 名;真实模型单独写出。
默认使用不提交参考音频的 Qwen 声音设计:
{
"id": "cloud_designed_voice",
"tts_engine": "Qwen-TTS-API",
"api_voice_creation_method": "voice_design",
"api_enrollment_model": "qwen-voice-design",
"api_target_model": "qwen3-tts-vd-2026-01-26",
"api_voice_prompt": "<original-voice-description>",
"api_voice_preview_text": "<original-preview-text>",
"api_voice_design_language": "zh",
"send_instructions_by_default": false
}
只有用户明确确认拥有云端声音克隆权利时,才使用:
qwen-voice-enrollment 与完全匹配的 qwen3-tts-vc-*。voice-enrollment 需要 provider 可访问 URL,完成报告必须写真实 cosyvoice-* 模型。声音设计/复刻完成后,真实 api_voice_id 只保存在本机私有注册表。每个 job 必须快照角色、模型、语言和创建方式;不能借用其他会话的音色。
不要发布 API key、voice ID、Data URL、签名 URL、服务器地址、个人路径或参考音频。最终可见报告只显示 voice 是否已配置。
Qwen3-TTS-VC/VD 不支持 provider-side instruction control;不要向它们发送 CosyVoice 的音量、语速、音调或 instructions 字段。只有目标模型明确支持并已验证时才发送。Agent 文本在提交前仍然应该遵循角色风格。
完成后用中文报告服务商、DashScope API、OumuQ 引擎、实际模型、声音设计/复刻方式、角色 ID、语言、WAV 验证状态,以及“OumuQ 进程内 FIFO + 主机级播放互斥、不叠音”。使用 play=false 时只能报告策略已验证,不能声称实际扬声器播放已测试。