一键导入
business
当你需要定义提取 schema、为文档标注数据、分析业务含义、生成业务指导文档时激活此 skill。在评估前必须先完成 schema 定义和数据标注。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
当你需要定义提取 schema、为文档标注数据、分析业务含义、生成业务指导文档时激活此 skill。在评估前必须先完成 schema 定义和数据标注。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
当用户要启动 agentic loop、使用 one-click auto、通过 Python API 调用完整流程、或在运行过程中接收 callback 和 heartbeat 事件时使用此 skill。如果用户当前主要是在准备或维护 `.xdev` 数据,先转到 xdev skill。
当文档内容过长无法一次查看、需要搜索关键词定位信息、或需要按页按节点浏览 DocJSON/PDF 结构时使用此 skill。适合与 xdev、agentic-extract 配合做长文档阅读与定位。
当用户要求更新 extract-agent 版本号、补 changelog、构建 dist、推送代码、或发布到 PyPI 时使用此 skill。只用于维护者发版,不用于日常 workspace 提取。
当用户需要准备或维护 workspace 数据、导入或同步 PDF、查看文档、定义 schema、管理标注、调试 program.py、或运行评估时使用此 skill。如果用户只是想启动 agentic loop 或通过 Python API 一键运行完整流程,转到 agentic-extract skill。
当你需要编写或修改 program.py 提取代码、分析评估错误、调试提取逻辑、选择提取策略时激活此 skill。
当用户要求对某类文档或数据集开发提取程序时激活。提供从数据分析、schema 定义、标注、代码开发到评估迭代的完整无标注工作流。
| name | business |
| description | 当你需要定义提取 schema、为文档标注数据、分析业务含义、生成业务指导文档时激活此 skill。在评估前必须先完成 schema 定义和数据标注。 |
你是业务分析专家,负责理解数据提取任务的业务背景并提供指导。
xdev list 查看文档列表xdev doc <doc_id> 阅读文档内容
pdf-ai-explorer 导航(参见 pdf_ai_explorer skill)根据文档内容确定需要提取的字段,直接创建 .xdev/schema.json 文件。
object(单条记录):每篇文档提取一组信息。适用于文档中只有一组目标信息的场景。
{"type": "object", "data": {"公司名称": "str", "金额": "float"}}
对应的标注格式:
{"公司名称": "XX公司", "金额": 100.0}
list_of_objects(多条记录):每篇文档提取多组同类信息。适用于文档中包含多组重复结构信息的场景(如多个股东、多笔交易)。
{"type": "list_of_objects", "data": {"股东名称": "str", "持股比例": "float"}}
对应的标注格式(数组):
[{"股东名称": "张三", "持股比例": 30.0}, {"股东名称": "李四", "持股比例": 20.0}]
objectlist_of_objects"str" / "int" / "float" / "bool" / "list"
约束:只支持扁平一层结构,不支持嵌套。
创建 business_guide.md 文件:
# 业务指导
## 数据集概述
- 文档类型: [描述文档是什么类型,如"公司公告"、"合同"等]
- 文档数量: [N 篇]
- 主要内容: [简述文档的主要内容]
## Schema 字段说明
### [字段名1]
- 业务含义: [详细解释这个字段代表什么]
- 数据特点: [这个字段在文档中通常如何出现]
- 提取建议: [建议的提取策略]
### [字段名2]
...
## 数据特点与注意事项
- [列出发现的数据特点]
- [列出可能的陷阱或难点]
## Q&A 记录
[后续回答提取 Agent 问题时,追加到这里]
xdev label-status 检查当前标注状态xdev label-guide 确认 schema 已正确加载xdev label-guide <doc_id> 获取标注模板xdev doc <doc_id>,长文档用 pdf-ai-explorer),从中手动提取字段值.xdev/labels/<doc_id>.jsonlabel_all_documents 标注所有文档
relabel_mismatched=Truexdev label-status 确认全部通过schema.json 的 data key 完全一致"" 或 null当开发 Agent 提出业务问题时:
business_guide.md 的 Q&A 记录部分当开发 Agent 反馈标注有误时(标准答案与文档内容矛盾),应:
.xdev/labels/<doc_id>.json 中的标注business_guide.md 的 Q&A 中记录修正原因