ワンクリックで
qwen-voice-language-training
当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
当需要运行或记录一个 OumuQ 兼容的阿里云百炼 / DashScope 云端 TTS worker 时使用。支持真正的 Qwen 声音设计、经授权的声音复刻、动态多角色和全局串行播放。
通过阿里云百炼 / DashScope 的 Qwen TTS API 生成语音,并让一个常驻 worker 按请求在多个角色与会话之间安全切换。支持 Qwen 声音设计、个人非商业用途的声音复刻、已有 voice_id 和 OumuQ 全局串行播放。
当用户希望 Codex 聊天回复既保持选定角色风格、又通过 TTS 播放时使用。覆盖所有可见 Codex 输出、从 voice-references 选择角色人格/风格、先提交语音再显示文本、语音语言和屏幕语言不同的情况、支持时的情绪提示、工作区归属的缓存/输出,以及 UTF-8 中文路径。
从中文 Wiki、网页、本地资料、角色设定或参考音频中提取角色人格、语言风格和 TTS 参数,创建或更新 OumuQ 的 voice-references 角色条目。角色 TTS 或声音克隆任务应先把可用参考音频提取到本机私有目录,再按用户选择使用本地或千问克隆;skill、代码和脱敏模板可以发布,但真实 TTS 参考音频不得放到 GitHub 或公网地址。用户要求创建、添加、注册、提取或还原角色,制作中文角色提示词、语音角色、音色克隆配置或对话模式角色时使用。
当 Agent 需要从 voice-references 中选择 OumuQ 兼容的本地 TTS worker、语言、角色、固定声线、参考音频或播放行为时使用。
当 Agent 回复需要在屏幕和语音里都完整保持角色时使用。先把语音提交给 OumuQ 兼容的常驻 TTS worker,等待 queued 成功后再显示可见文本,并在屏幕语言和语音语言不同时保留角色语气。
| name | qwen-voice-language-training |
| description | 当需要规划 Qwen/DashScope 克隆声线注册、语言提示,或处理跨语言语音时使用,例如日语参考音频说中文。尤其适用于用户还没有明确想要的语音语言和口音取舍时。 |
当参考音频语言、屏幕回复语言和期望语音语言可能不同时,在注册或使用 Qwen/DashScope 克隆声线前使用这个 skill。
先分清三个值:
reference_audio_language:克隆参考音频里实际说的语言。speech_language:TTS 输出应该说的语言。visible_language:作为文本/字幕展示给用户的语言。如果用户没有清楚选择 speech_language,并且目标语言不同于参考音频语言,克隆或合成前要先问。问题保持简短:
参考音频是日语。你希望生成语音也说日语,还是保留音色但改说中文?后者可能更容易有跨语种口音。
如果询问不现实,且没有确认目标语言,默认使用参考音频语言。日语参考音频默认生成日语语音;需要时可以使用中文屏幕文本/字幕。
对于 Qwen/DashScope 克隆声线,在两个阶段都传入语言提示:
language_hints: ["ja"]。language_hints: ["ja"],中文语音用 language_hints: ["zh"]。不要假设本地元数据里的 speech_language: "Japanese" 就足够。worker 应该在调用 provider 前,把它映射成 provider language hint,例如 ja、zh、en。
当用户希望角色用参考音频的同一种语言说话时,使用这个方案。
推荐配置:
{
"tts_engine": "Qwen-TTS-API",
"speech_language": "Japanese",
"visible_language": "Chinese",
"api_clone_language_hint": "ja",
"api_target_model": "cosyvoice-v3-plus"
}
运行时规则:
/speak。language_hints: ["ja"]。这是只有日语参考音频时最安全的默认方案。
当参考音频是一种语言,但用户希望另一种语音语言时使用,例如日语参考音频说中文。
继续前,用直白方式说明取舍:
推荐选项:
对于日语参考音频说中文,不要静默切换成中文语音。除非用户已经明确要求,否则先问。
worker 应保存足够元数据来排查语言问题:
{
"reference_audio_language": "Japanese",
"speech_language": "Japanese",
"visible_language": "Chinese",
"api_clone_language_hint": "ja",
"synthesis_language_hint": "ja"
}
每个生成任务都应把解析后的 synthesis hint 持久化到 job.json 和 chunk metadata。这样可以清楚判断坏口音来自克隆注册、合成语言路由,还是源材料本身。
公开 OumuQ skills 和 docs 可以描述语言策略和占位符字段,但不能发布: