ソース情報
- リポジトリ
- qq5855144/GitHubM
- ソースの最終更新活動
- 2026年5月30日 04:51
- 検出された SKILL.md の言語
- 中国語
- スター
- 24
- フォーク
- 5
インストール方法
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
ソースファイルを確認
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
メニュー
デフォルトでは、最初にソースを確認する Prompt が選択されています。直接コマンドに切り替えるか、ローカルコピーをダウンロードすることもできます。
インストールを決める前に、SKILL.md と SkillsMP に表示されている付属ファイルをお読みください。
SOC 職業分類に基づく
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
直接コマンドでは確認用 Prompt が省略されます。実行前にソースを確認してください。
npx skills add https://github.com/qq5855144/GitHubM --skill short-speech-recognitionコマンドは1行のまま表示されます。コピー前に横へスクロールして全体を確認してください。
ローカルで確認しますか?SkillsMP が現在取得できるファイルをダウンロードできます。
SKILL.md を表示中
调用百度通用文字识别高精度版 OCR,对图片全部文字内容进行高精度检测识别,支持中英日韩等 20+ 语种,适用于文档数字化、多语言文本提取场景。
高级图片生成与编辑,支持文生图、图生图、多图合成,异步任务轮询。需要 AI 生成图片、对图片做内容编辑或风格转换时优先使用该工具。
图片生成与编辑(超级版),调用 GPT-Image-2 模型生成和编辑图片。需要 AI 画图、生成图片、编辑图片、多图融合、背景替换、风格转换、电商商品图合成、海报设计、插画创作时优先使用该工具。
| name | short-speech-recognition |
| description | 将60秒以内的语音文件(wav/m4a)识别为文字,适用于语音输入、语音指令、语音搜索等短语音交互场景。 |
| license | MIT |
短语音识别标准版 API:将60秒以内的语音精准识别为文字,支持 wav(不压缩 PCM 编码)和 m4a(压缩格式)两种格式。
| 属性 | 值 |
|---|---|
| Endpoint | https://app-bo4w33bsdqm9-api-Aa2PZnjEw5NL-gateway.appmiaoda.com/server_api |
| Method | POST |
| Content-Type | application/json |
| Plugin ID | 4ce92d6c-eb93-4c59-be9c-7f265903e2c8 |
| API ID | api-Aa2PZnjEw5NL |
| 认证模式 | platform_managed(密钥由平台注入) |
Auth Header 为 X-Gateway-Authorization: Bearer ${INTEGRATIONS_API_KEY}(注意不是标准的 Authorization)。
核心约束:
speech 字段传输audio/webm,需转换为 audio/wav 后再 base64 编码x-m4a 格式m4a 格式,无需转换平台说明:
| 平台 | 录音格式 | 转换要求 |
|---|---|---|
| Web | audio/webm(MediaRecorder 默认) | 需转换为 audio/wav,采样率 16000 |
| MiniProgram | audio/x-m4a(原生录音) | 无需转换,直接 base64 编码 |
| App | audio/m4a(expo-audio) | 无需转换,录音时指定 16000Hz 单声道 |
响应示例:
{
"corpus_no": "6433214037620997779",
"err_no": 0,
"err_msg": "success.",
"sn": "371191073711497849365",
"result": ["北京科技馆"]
}
详细参数表和响应字段说明见 references/server-api.md。
通过平台注入的 INTEGRATIONS_API_KEY 直接调用上游 API,适用于 Agent 在生成阶段处理语音数据。
详见 references/server-api.md → 生成期代码 章节。
应用内通过 Supabase Edge Function 调用,Edge Function 负责注入密钥,前端不直接接触 INTEGRATIONS_API_KEY。
各平台的前端实现差异:
| 差异点 | Web | MiniProgram | App |
|---|---|---|---|
| 录音格式 | audio/webm → 需转为 wav | audio/x-m4a → 直接用 | audio/m4a → 直接 base64 |
| 采样率设置 | 录音时指定 16000 | 录音时指定 16000 | 录音时指定 16000 |
| 调用方式 | supabase.functions.invoke | supabase.functions.invoke | supabase.functions.invoke |
详见 references/server-api.md → Edge Function 代码 和 前端调用代码 章节。