| name | tencentcloud-ocr-extractdocagent |
| description | 腾讯云实时文档抽取Agent(ExtractDocAgent)接口调用技能。当用户需要从图片或PDF中按自定义字段名称进行结构化信息抽取时,应使用此技能。支持自定义字段名称、字段类型(KV对或表格字段)和字段提示词,实现灵活的文档信息提取。适用于合同、发票、报告等各类文档的结构化数据抽取场景。 |
| version | 1.0.3 |
| display_name | 腾讯云实时文档抽取Agent |
| display_name_en | Tencent Cloud Extract Doc Agent |
| description_zh | 调用腾讯云实时文档抽取Agent接口,支持从图片/PDF中按自定义字段名称进行结构化信息抽取。支持KV对和表格字段两种抽取类型,可通过字段提示词提升准确性。适用于合同、发票、报告等文档的自动信息提取。 |
| description_en | Tencent Cloud ExtractDocAgent API for structured information extraction from images/PDFs. Supports custom field names with KV-pair and table field extraction types. Ideal for contracts, invoices, and reports. |
| visibility | public |
腾讯云实时文档抽取Agent (ExtractDocAgent)
用途
调用腾讯云OCR实时文档抽取Agent接口,支持从图片/PDF中按用户自定义的字段名称进行结构化信息抽取。模型参数更小,速度更快,适用于对实时性要求高(30秒以内)且输入输出Token在2000以内的场景。
核心能力:
- 自定义字段抽取:支持用户自定义需要抽取的字段名称
- KV对抽取:支持键值对形式的信息抽取(KeyType=0)
- 表格字段抽取:支持表格形式的信息抽取(KeyType=1)
- 字段提示词:支持为每个字段提供描述/提示词,提升抽取准确性
- PDF支持:支持PDF文件的单页文档抽取
- 多格式输入:支持PNG、JPG、JPEG、BMP、PDF格式
官方文档:https://cloud.tencent.com/document/api/866/126442
使用时机
当用户提出以下需求时触发此技能:
- 需要从文档图片/PDF中抽取指定字段的结构化信息
- 需要从合同、发票、报告等文档中提取特定内容
- 需要按自定义字段名进行文档信息提取
- 涉及文档结构化抽取的任何场景
- 需要同时抽取KV对和表格形式的信息
环境要求
- Python 3.6+
- 依赖:
tencentcloud-sdk-python(通过 pip install tencentcloud-sdk-python 安装)
- 环境变量:
TENCENTCLOUD_SECRET_ID:腾讯云API密钥ID
TENCENTCLOUD_SECRET_KEY:腾讯云API密钥Key
使用方式
运行 scripts/main.py 脚本完成文档结构化信息抽取。
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|
| ImageBase64 | str | 否(二选一) | 图片/PDF的Base64值,编码后不超过10M,分辨率建议600*800以上,支持PNG/JPG/JPEG/BMP/PDF,像素需介于20-10000px |
| ImageUrl | str | 否(二选一) | 图片/PDF的URL地址,都提供时只使用ImageUrl |
| ItemNames | list of ItemNames | 是 | 自定义抽取字段列表,至少提供一个 |
| PdfPageNumber | int | 否 | PDF页码,仅支持单页识别 |
ItemNames 结构:
| 字段 | 类型 | 必填 | 说明 |
|---|
| KeyName | str | 是 | 要提取的字段名称,不能为空 |
| KeyType | int | 否 | 默认0;0=KV对,1=表格字段 |
| KeyPrompt | str | 否 | 字段描述/提示词,用于提升抄取准确性 |
|