用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/qq5855144/GitHubM --skill short-speech-recognition命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | short-speech-recognition |
| description | 将60秒以内的语音文件(wav/m4a)识别为文字,适用于语音输入、语音指令、语音搜索等短语音交互场景。 |
| license | MIT |
短语音识别标准版 API:将60秒以内的语音精准识别为文字,支持 wav(不压缩 PCM 编码)和 m4a(压缩格式)两种格式。
| 属性 | 值 |
|---|---|
| Endpoint | https://app-bo4w33bsdqm9-api-Aa2PZnjEw5NL-gateway.appmiaoda.com/server_api |
| Method | POST |
| Content-Type | application/json |
| Plugin ID | 4ce92d6c-eb93-4c59-be9c-7f265903e2c8 |
| API ID | api-Aa2PZnjEw5NL |
| 认证模式 | platform_managed(密钥由平台注入) |
Auth Header 为 X-Gateway-Authorization: Bearer ${INTEGRATIONS_API_KEY}(注意不是标准的 Authorization)。
核心约束:
speech 字段传输audio/webm,需转换为 audio/wav 后再 base64 编码x-m4a 格式m4a 格式,无需转换平台说明:
| 平台 | 录音格式 | 转换要求 |
|---|---|---|
| Web | audio/webm(MediaRecorder 默认) | 需转换为 audio/wav,采样率 16000 |
| MiniProgram | audio/x-m4a(原生录音) | 无需转换,直接 base64 编码 |
| App | audio/m4a(expo-audio) | 无需转换,录音时指定 16000Hz 单声道 |
响应示例:
{
"corpus_no": "6433214037620997779",
"err_no": 0,
"err_msg": "success.",
"sn": "371191073711497849365",
"result": ["北京科技馆"]
}
详细参数表和响应字段说明见 references/server-api.md。
通过平台注入的 INTEGRATIONS_API_KEY 直接调用上游 API,适用于 Agent 在生成阶段处理语音数据。
详见 references/server-api.md → 生成期代码 章节。
应用内通过 Supabase Edge Function 调用,Edge Function 负责注入密钥,前端不直接接触 INTEGRATIONS_API_KEY。
各平台的前端实现差异:
| 差异点 | Web | MiniProgram | App |
|---|---|---|---|
| 录音格式 | audio/webm → 需转为 wav | audio/x-m4a → 直接用 | audio/m4a → 直接 base64 |
| 采样率设置 | 录音时指定 16000 | 录音时指定 16000 | 录音时指定 16000 |
| 调用方式 | supabase.functions.invoke | supabase.functions.invoke | supabase.functions.invoke |
详见 references/server-api.md → Edge Function 代码 和 前端调用代码 章节。
高级图片生成与编辑,支持文生图、图生图、多图合成,异步任务轮询。需要 AI 生成图片、对图片做内容编辑或风格转换时优先使用该工具。
基于 SOC 职业分类