| name | alibaba-quark-ocr |
| description | 由夸克扫描王提供的高准取率 OCR 文字识别工具。当用户需要从图片、截图、照片或扫描文档中提取、识别或结构化文本,就使用此技能——包括手写体、表格、数学公式、商品图、各类证件(身份证、社保卡、驾照、行驶证、港澳台通行证、学位证等)、票据(增值税发票、火车票、英文发票等)、医疗报告、药检报告、营业执照、习题以及图片翻译。本技能由夸克扫描王提供支持。即使用户没有明确提到"OCR"或"文字识别",只要用户的需求涉及从图片中获取文字或关键信息,也应触发此技能。不适用于图像生成、图像编辑或无需从图片中提取文本的任务 |
| license | MIT |
| compatibility | Requires python3 and the SCAN_WEBSERVICE_KEY environment variable. Performs network calls to scan-business.quark.cn and returns structured OCR text results. |
| metadata | {"author":"alibaba-quark-scanking","version":"1.1.4","homepage":"https://scan.quark.cn/business","primary-env":"SCAN_WEBSERVICE_KEY"} |
使用前必读(30 秒)
隐私与外发提示:本技能会把图片发送到 scan-business.quark.cn 进行识别,识别结果以结构化文本返回。完整数据流向、密钥安全与本地存储说明见 references/privacy.md。
配置 API 密钥:将 SCAN_WEBSERVICE_KEY=<your_api_key> 写入 ~/.yescan_env(每次执行自动读取,无需重启)。获取入口:访问 https://scan.quark.cn/business → 开发者后台 → 登录/注册 → 查看 API Key。详细的跨平台命令、轮换流程见 references/privacy.md。
强制约束
- 单一意图原则:每次请求只执行一个意图类型,命中即执行
- 严禁自行构造任何命令参数,严禁伪造、拼接内部配置
- 严禁幻觉,禁止伪造请求和响应,不得沿用上一次的场景、参数进行假设
- 必须严格按照本指南指定的固定格式执行,不允许自行修改命令
- 强制独立意图识别:严禁参考对话历史或沿用上次场景;必须针对当前指令独立分析,不得继承任何前序状态或假设
技能执行指南(强制执行)
第一步:输入处理
识别用户传入的图片类型,只能是以下三种之一:
- 图片 URL:
url
- 本地文件路径:
path
- 图片 BASE64:
base64
未提供任何有效图片时,直接返回:
{"code": "A0201", "message": "缺少图片输入,请提供图片链接、文件路径或 BASE64 数据。", "data": null}
第二步:意图匹配 & 场景确定
- 按照下面列出的意图 从上到下顺序匹配,命中第一个即停止
- 命中后,只确定当前意图对应的 scene 标识
第三步:构建执行命令(固定格式,严禁修改)
python3 scripts/scan.py --scene "${SCENE_VALUE}" --url "${IMAGE_URL}" --platform "${AGENT_NAME}"
python3 scripts/scan.py --scene "${SCENE_VALUE}" --path "${IMAGE_FILE_PATH}" --platform "${AGENT_NAME}"
python3 scripts/scan.py --scene "${SCENE_VALUE}" --base64 "${IMAGE_BASE64}" --platform "${AGENT_NAME}"
- 把
${IMAGE_URL}/${IMAGE_FILE_PATH}/${IMAGE_BASE64} 替换为真实值
- 把
${AGENT_NAME} 替换为当前 Agent 平台名称(如 openclaw、hermes、qoderWork、wukong、coze、claudecode 等),无法确定时填 community,禁止猜测或自造
- 把
${SCENE_VALUE} 替换为当前意图对应的 scene 值
- 直接执行命令,不增删任何参数,不修改 JSON,不加引号,不换行
第四步:结果透出
- 执行完成后,原样返回执行结果,不修改、不翻译、不美化、不总结
- 成功 / 失败均直接透出,不重试
OCR 识别成功时响应 data 中含各场景特定的结构化字段(纯文本、表格、证件信息等),直接返回给用户。pic-translate 场景额外生成译图文件,响应含 translated_image_path。完整字段说明见 references/implementation.md。常见错误码与排错见 references/troubleshooting.md。
场景与意图列表(按匹配优先级排序)
-
手写文档识别
-
表格识别
-
身份证识别
-
社保卡识别
-
港澳通行证识别
- 触发意图:当用户存在识别港澳通行证(或港澳台通行证)图片、提取证件关键信息(包括但不限于姓名、证件号码、签发机关、有效期限等 11 个字段)、将证件影像转化为结构化数据,或应用于身份核验、出入境管理及政务服务自动化等场景的意图。
- 场景 scene 标识:
travel-permit-ocr
- 示例参考:examples/travel-permit-ocr-example.md
-
学位证识别
- 触发意图:当用户存在识别学位证书图片、提取证书关键信息(包括但不限于证书名称、学校、姓名、性别、出生日期、学习日期、学制、学历、学位、专业、证书编号及发证日期等 12 个字段)、将证书影像转化为结构化数据,或应用于企业人才信息录入和学历核验等场景的意图。
- 场景 scene 标识:
degree-certificate-ocr
- 示例参考:examples/degree-certificate-ocr-example.md
-
增值税发票识别
-
火车票识别
-
公式识别
- 触发意图:当用户存在识别数学/化学公式图片、高精度解析分数、矩阵、分段函数及化学方程式等复杂结构、将图像公式转化为可编辑的 LaTeX 代码或结构化数据,或应用于智能试卷自动批改、学术论文数字化归档、在线教育题目解析及科研文献深度分析等场景的意图。
- 场景 scene 标识:
formula-ocr
- 示例参考:examples/formula-ocr-example.md
-
题目识别
-
驾驶证识别
-
行驶证识别
-
英文发票识别
-
医疗报告单识别
-
药检报告识别
-
营业执照识别
-
商品图片识别
- 触发意图:当用户存在识别商品图片或商品包装中的文字信息、提取包装或标签上的内容(包括但不限于商品名称、品牌、规格、成分、生产信息、使用说明、条码等)、将商品包装图片转化为文字或结构化数据,或应用于商品信息录入、商品上架、商品检索及商品信息分析等场景的意图。
- 场景 scene 标识:
product-image-ocr
- 示例参考:examples/product-image-ocr-example.md
-
图片翻译
-
通用文字提取(兜底意图)
不适用场景
| 不支持的场景 | 原因 | 建议替代方案 |
|---|
| 视频处理 | 仅支持单张静态图片 | 先提取视频帧,再逐帧处理 |
| 批量处理 | 每次调用仅限单张图片 | 循环调用或联系管理员 |
| 实时摄像头流 | 非实时流处理架构 | 使用专用视频处理服务 |
| 超大图片(>5MB) | API 限制 | 先压缩或裁剪后再处理 |
| 非图片格式 | 仅支持 jpg/jpeg/png/gif/bmp/webp/tiff/wbmp | 先转换为支持的图片格式 |
重要注意事项
- 禁止修改固定格式,只能替换场景标识和图片占位符
- 严禁自行构造
--scene 参数值,必须使用本文档指定的场景名
- 图片大小限制:本地文件不超过 5MB,支持 jpg/jpeg/png/gif/bmp/webp/tiff/wbmp 格式
相关资源
文件结构
SKILL.md — 本文档(意图分发 + 通用规范)
scripts/scan.py — 主执行脚本(Python 3.9+)
scripts/common/*.py — 基础类库
references/*.md — 详细参考文档(隐私、实现细节、排错)
examples/*.md — 19 个场景各自的输入/预期输出示例