بنقرة واحدة
speech-generation
文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
通用下载编排器。下载公开可访问、开源授权或用户本人授权的数字资源;提供 inspect_download_url、download_direct_file、download_video、list_downloads 四个工具。
本地双层知识库检索与问答。用户要求从知识库、资料目录或本地文档中查信息、总结、核对来源时使用。先按 data_structure.md 分层导航,再渐进检索候选文件;遇到 PDF/Excel 时先读取本 Skill 的 references 处理指南。
双模式记忆管理:保存、读取、搜索、删除、审阅和清理用户记忆。被动模式只处理临时层;主动审阅读取临时+永久并将有价值内容晋升到永久层。用户要求记住、忘记、搜索记忆、审阅记忆、清理记忆时使用。
VOTX Agent run_command tool usage guide for safe local command execution.
创建或更新 VOTX Agent Skill 的指导技能。用于设计 SKILL.md、工具型或指令型 Skill、scripts/references/assets 资源、触发描述、渐进式披露结构,以及验证现有 Skill 是否适配框架。
将复杂用户请求自动分解为可执行步骤计划,可视化进度,支持暂停/继续/中止。受用户 config.json 中 task_plan.accept_task 控制。
| name | speech_generation |
| description | 文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。 |
| version | 1.3 |
| category | multimodal |
| enabled | true |
| tags | ["multimodal","audio","tts"] |
将文字转换为自然语音文件并保存到本地。支持多种语音风格和音频格式。
plugins/speech_generation/
client.audio.speech.create()(OpenAI tts-1 / tts-1-hd)speech_generation_model(config.json 专用配置)> "tts-1"(默认)
配置后优先使用专用模型(如 "hexgrad/kokoro-82m");不配则使用 tts-1 走原生端点。
| 工具名 | 描述 |
|---|---|
speech_generate | 将文字转换为语音文件并保存到本地 |
| 参数 | 类型 | 必需 | 默认值 | 说明 |
|---|---|---|---|---|
text | string | 是 | — | 要转换的文字(最大 4096 字符) |
voice | string | 否 | "alloy" | 语音风格/音色 ID。不同厂商音色完全不同,请根据当前 provider 配置的 TTS 模型选择对应音色 |
format | string | 否 | "mp3" | 输出音频格式。常见值:mp3/opus/aac/flac/wav/pcm。具体取决于厂商支持 |
speed | float | 否 | 1.0 | 语速倍率,通常 0.25-4.0,具体取决于厂商 |
output_dir | string | 否 | users/<user>/download/ | 输出目录 |
| 厂商 | 音色 ID 示例 |
|---|---|
| OpenAI | alloy / echo / fable / onyx / nova / shimmer |
| StepFun | ruanmengnvsheng / tianmeinvsheng / qingnianluoli / 等 |
| 其他厂商 | 请查阅厂商文档获取音色 ID 列表 |
.txt 供排查ERROR: 前缀的错误信息speech_generation_model 后通过 chat 降级调用(如 hexgrad/kokoro-82m)capabilities_override: ["speech_generation"] 显式开启users/<user>/download/.txt,检查模型是否实际支持语音输出mp3,部分厂商仅支持少数格式voice 参数可能无效,会自动映射到默认音色speed 参数的可用范围因厂商而异,超范围可能被静默截断或报错