一键导入
audio-universal
语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
通用下载编排器。下载公开可访问、开源授权或用户本人授权的数字资源;提供 inspect_download_url、download_direct_file、download_video、list_downloads 四个工具。
本地双层知识库检索与问答。用户要求从知识库、资料目录或本地文档中查信息、总结、核对来源时使用。先按 data_structure.md 分层导航,再渐进检索候选文件;遇到 PDF/Excel 时先读取本 Skill 的 references 处理指南。
双模式记忆管理:保存、读取、搜索、删除、审阅和清理用户记忆。被动模式只处理临时层;主动审阅读取临时+永久并将有价值内容晋升到永久层。用户要求记住、忘记、搜索记忆、审阅记忆、清理记忆时使用。
VOTX Agent run_command tool usage guide for safe local command execution.
创建或更新 VOTX Agent Skill 的指导技能。用于设计 SKILL.md、工具型或指令型 Skill、scripts/references/assets 资源、触发描述、渐进式披露结构,以及验证现有 Skill 是否适配框架。
将复杂用户请求自动分解为可执行步骤计划,可视化进度,支持暂停/继续/中止。受用户 config.json 中 task_plan.accept_task 控制。
| name | audio_universal |
| description | 语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。 |
| version | 1.2 |
| category | multimodal |
| enabled | true |
| tags | ["multimodal","audio","transcription"] |
将音频文件转录为带可选时间戳的文本。支持多种语言和引导词。
plugins/audio_universal/
client.audio.transcriptions.create()(whisper-1 等标准模型)audio_transcription_model(config.json 专用配置)> "whisper-1"(默认)
配置后优先使用专用模型;不配则使用 whisper-1 走原生端点。
| 工具名 | 描述 |
|---|---|
audio_transcribe | 将音频文件转录为文本,支持语言指定、引导词和时间戳 |
| 参数 | 类型 | 必需 | 默认值 | 说明 |
|---|---|---|---|---|
audio | string | 是 | — | 音频文件路径(本地文件) |
language | string | 否 | 自动检测 | 语言代码(如 zh、en、ja)。由智能体自行传入合适的语言代码,留空自动检测 |
prompt | string | 否 | — | 引导词,帮助适应特定风格或上下文词汇 |
timestamp_granularity | string (enum) | 否 | "segment" | none=纯文本、segment=段落级时间戳、word=单词级时间戳 |
timestamp_granularity)ERROR: 前缀的错误信息capabilities_override: ["audio_transcription"]audio_transcription_model 后通过 chat 降级调用capabilities_override: ["audio_transcription"] 显式开启language 参数可提升转录准确率,留空则自动检测prompt 引导词对专有名词、人名、技术术语的识别效果显著prompt 引导词,包含关键术语的正确写法users/<user>/history/file/audio_transcription_model 已设置timestamp_granularity 选择 word 时输出可能非常庞大,仅在实际需要词级时间戳时使用input_audio 多模态格式发送音频,部分非标准模型可能不兼容