一键导入
speech-generation
文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
通用下载编排器。下载公开可访问、开源授权或用户本人授权的数字资源;提供 inspect_download_url、download_direct_file、download_video、list_downloads 四个工具。
本地双层知识库检索与问答。用户要求从知识库、资料目录或本地文档中查信息、总结、核对来源时使用。先按 data_structure.md 分层导航,再渐进检索候选文件;遇到 PDF/Excel 时先读取本 Skill 的 references 处理指南。
双模式记忆管理:保存、读取、搜索、删除、审阅和清理用户记忆。被动模式只处理临时层;主动审阅读取临时+永久并将有价值内容晋升到永久层。用户要求记住、忘记、搜索记忆、审阅记忆、清理记忆时使用。
VOTX Agent run_command tool usage guide for safe local command execution.
创建或更新 VOTX Agent Skill 的指导技能。用于设计 SKILL.md、工具型或指令型 Skill、scripts/references/assets 资源、触发描述、渐进式披露结构,以及验证现有 Skill 是否适配框架。
将复杂用户请求自动分解为可执行步骤计划,可视化进度,支持暂停/继续/中止。受用户 config.json 中 task_plan.accept_task 控制。
| name | speech_generation |
| description | 文生语音工具,将文字转换为语音文件。原生 TTS 端点优先,失败自动降级为 chat completions(适配 MiMo/kokoro 等非标准 TTS 模型)。支持多种语音风格和音频格式。 |
| version | 1.3 |
| category | multimodal |
| enabled | true |
| tags | ["multimodal","audio","tts"] |
将文字转换为自然语音文件并保存到本地。支持多种语音风格和音频格式。
plugins/speech_generation/
client.audio.speech.create()(OpenAI tts-1 / tts-1-hd)speech_generation_model(config.json 专用配置)> "tts-1"(默认)
配置后优先使用专用模型(如 "hexgrad/kokoro-82m");不配则使用 tts-1 走原生端点。
| 工具名 | 描述 |
|---|---|
speech_generate | 将文字转换为语音文件并保存到本地 |
| 参数 | 类型 | 必需 | 默认值 | 说明 |
|---|---|---|---|---|
text | string | 是 | — | 要转换的文字(最大 4096 字符) |
voice | string | 否 | "alloy" | 语音风格/音色 ID。不同厂商音色完全不同,请根据当前 provider 配置的 TTS 模型选择对应音色 |
format | string | 否 | "mp3" | 输出音频格式。常见值:mp3/opus/aac/flac/wav/pcm。具体取决于厂商支持 |
speed | float | 否 | 1.0 | 语速倍率,通常 0.25-4.0,具体取决于厂商 |
output_dir | string | 否 | users/<user>/download/ | 输出目录 |
| 厂商 | 音色 ID 示例 |
|---|---|
| OpenAI | alloy / echo / fable / onyx / nova / shimmer |
| StepFun | ruanmengnvsheng / tianmeinvsheng / qingnianluoli / 等 |
| 其他厂商 | 请查阅厂商文档获取音色 ID 列表 |
.txt 供排查ERROR: 前缀的错误信息speech_generation_model 后通过 chat 降级调用(如 hexgrad/kokoro-82m)capabilities_override: ["speech_generation"] 显式开启users/<user>/download/.txt,检查模型是否实际支持语音输出mp3,部分厂商仅支持少数格式voice 参数可能无效,会自动映射到默认音色speed 参数的可用范围因厂商而异,超范围可能被静默截断或报错