بنقرة واحدة
tts-router-workflow
当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
通过阿里云百炼 / DashScope 的 Qwen TTS API 生成语音,并让一个常驻 worker 按请求在多个角色与会话之间安全切换。支持 Qwen 声音设计、个人非商业用途的声音复刻、已有 voice_id 和 OumuQ 全局串行播放。
当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。
当用户希望 Codex 聊天回复既保持选定角色风格、又通过 TTS 播放时使用。覆盖所有可见 Codex 输出、从 voice-references 选择角色人格/风格、先提交语音再显示文本、语音语言和屏幕语言不同的情况、支持时的情绪提示、工作区归属的缓存/输出,以及 UTF-8 中文路径。
从中文 Wiki、网页、本地资料、角色设定或参考音频中提取角色人格、语言风格和 TTS 参数,创建或更新 OumuQ 的 voice-references 角色条目。角色 TTS 或声音克隆任务应先把可用参考音频提取到本机私有目录,再按用户选择使用本地或千问克隆;skill、代码和脱敏模板可以发布,但真实 TTS 参考音频不得放到 GitHub 或公网地址。用户要求创建、添加、注册、提取或还原角色,制作中文角色提示词、语音角色、音色克隆配置或对话模式角色时使用。
当 Agent 回复需要在屏幕和语音里都完整保持角色时使用。先把语音提交给 OumuQ 兼容的常驻 TTS worker,等待 queued 成功后再显示可见文本,并在屏幕语言和语音语言不同时保留角色语气。
استنادا إلى تصنيف SOC المهني
| name | tts-router-workflow |
| description | 当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。 |
当前本机只允许本地 ONNX-VITS、Qwen3-TTS 与 IndexTTS2。所有云端/API worker 路线已归档,不得选择或启动。
把 voice-references/reference-index.json 作为唯一路由来源。
OumuQ 正在运行时,优先通过 OumuQ 路由,通常是 http://127.0.0.1:8780。直接 worker 调用只作为调试 fallback,或在路由层不可用时使用。
id、name 或显示字段查找请求的角色。speech_language 作为音频语言,使用 visible_language 作为屏幕文本语言。tts_engine 选择 worker URL。character_id 传给 OumuQ 或 worker,而不是在每个请求里嵌入已解析的 provider 细节。voice-references 外面。与 character-dialogue-workflow 一起使用时,需要路由两段文本:发送给 TTS 的语音语言文本,以及 queued 后显示的可见语言文本。两段文本都必须保持同一个角色口吻和意图。先把语音文本提交给 OumuQ POST /api/speak,等 OumuQ/worker 接受任务后再显示可见文本。
建议 engine key:
ONNX-VITS:本地固定多说话人极速 worker,默认 http://127.0.0.1:8764;角色用 onnx_vits_speaker 绑定固定声线,不读取参考音频。Qwen3-TTS:本地多语言 worker。IndexTTS2:本地中文/克隆 worker。session_id,并在每次参数推理、路由解析和语音请求中发送 session_id + character_id。worker_url 是共享引擎地址。不能因为另一个会话选择不同角色而重启它。status.character_id 只能视为 legacy 启动默认值或诊断字段。play=false,生成可以并行,最终 WAV 按路由提交序号进入同一个 FIFO。GET /api/playback/status 检查;任何两条 OumuQ 语音都不得叠加。character_id 时才能共享;否则给 legacy 角色分配独立端口。云端 API 角色可以包含:
api_voice_idapi_clone_audio_urlapi_target_model(规范字段)api_clone_target_model(仅旧数据兼容)api_clone_language_hintapi_voice_instructionssend_instructions_by_default公开仓库中这些值应该是占位符。真实值应保存在本地副本、部署 secret store 或私有配置中。
有用的本地 endpoint:
GET /api/config:确认 OumuQ 路由层配置。GET /api/characters:列出已解析的注册角色。GET /api/tts-model-capabilities:暴露 canonical 字段和特定模型支持/降级规则。POST /api/infer-parameters:不生成音频,只推断高层请求参数。POST /api/speak:向选中的 worker 提交一句发言。GET /api/worker/status:通过 OumuQ 检查 worker 状态。GET /api/playback/status:检查单进程 FIFO 与主机级播放互斥;禁止叠音,但不宣称多个 OumuQ 进程共享 FIFO 顺序。AI client 如果知道 canonical intent 字段,应发送这些字段:
session_idcharacter_id、speaker、speaker_id、model、worker_urltext、language、visible_language、speech_languageemotion_mode、emotion_alpha、emotion_tags、emotion_vector、emotion_text、instructions、send_instructionsvolume、speech_rate、pitch_rate、speedprompt_audio、prompt_audios、ref_text、reference_audio_urlmatch_patterns、character_folder不支持但无害的字段应由 OumuQ/workers 降级或忽略,不应变成致命错误。对于云端 CosyVoice 克隆声线,emotion_vector 是高层意图,可能映射为 instructions、speech_rate、pitch_rate 和 volume。
如果图像生成工作流使用同一个角色,只读取公开安全的 visual 字段,例如:
visual_profile.idvisual_profile.prompt_profilevisual_profile.safety_note不要把声线来源转换成视觉身份。声线来源、真实说话人身份、私有参考文件和云端 URL 都不是图像提示词素材。