ワンクリックで
audio-universal
语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
通用下载编排器。下载公开可访问、开源授权或用户本人授权的数字资源;提供 inspect_download_url、download_direct_file、download_video、list_downloads 四个工具。
本地双层知识库检索与问答。用户要求从知识库、资料目录或本地文档中查信息、总结、核对来源时使用。先按 data_structure.md 分层导航,再渐进检索候选文件;遇到 PDF/Excel 时先读取本 Skill 的 references 处理指南。
双模式记忆管理:保存、读取、搜索、删除、审阅和清理用户记忆。被动模式只处理临时层;主动审阅读取临时+永久并将有价值内容晋升到永久层。用户要求记住、忘记、搜索记忆、审阅记忆、清理记忆时使用。
VOTX Agent run_command tool usage guide for safe local command execution.
创建或更新 VOTX Agent Skill 的指导技能。用于设计 SKILL.md、工具型或指令型 Skill、scripts/references/assets 资源、触发描述、渐进式披露结构,以及验证现有 Skill 是否适配框架。
将复杂用户请求自动分解为可执行步骤计划,可视化进度,支持暂停/继续/中止。受用户 config.json 中 task_plan.accept_task 控制。
| name | audio_universal |
| description | 语音转文字工具,将音频文件转录为文本。原生 transcription 端点优先,失败自动降级为 chat completions(适配非标准语音识别模型)。支持多语言和时间戳。 |
| version | 1.2 |
| category | multimodal |
| enabled | true |
| tags | ["multimodal","audio","transcription"] |
将音频文件转录为带可选时间戳的文本。支持多种语言和引导词。
plugins/audio_universal/
client.audio.transcriptions.create()(whisper-1 等标准模型)audio_transcription_model(config.json 专用配置)> "whisper-1"(默认)
配置后优先使用专用模型;不配则使用 whisper-1 走原生端点。
| 工具名 | 描述 |
|---|---|
audio_transcribe | 将音频文件转录为文本,支持语言指定、引导词和时间戳 |
| 参数 | 类型 | 必需 | 默认值 | 说明 |
|---|---|---|---|---|
audio | string | 是 | — | 音频文件路径(本地文件) |
language | string | 否 | 自动检测 | 语言代码(如 zh、en、ja)。由智能体自行传入合适的语言代码,留空自动检测 |
prompt | string | 否 | — | 引导词,帮助适应特定风格或上下文词汇 |
timestamp_granularity | string (enum) | 否 | "segment" | none=纯文本、segment=段落级时间戳、word=单词级时间戳 |
timestamp_granularity)ERROR: 前缀的错误信息capabilities_override: ["audio_transcription"]audio_transcription_model 后通过 chat 降级调用capabilities_override: ["audio_transcription"] 显式开启language 参数可提升转录准确率,留空则自动检测prompt 引导词对专有名词、人名、技术术语的识别效果显著prompt 引导词,包含关键术语的正确写法users/<user>/history/file/audio_transcription_model 已设置timestamp_granularity 选择 word 时输出可能非常庞大,仅在实际需要词级时间戳时使用input_audio 多模态格式发送音频,部分非标准模型可能不兼容