| name | announcement-layout-parsing |
| description | 用于公告结构拆分的公告版式解析原子 skill,适用于通用行业文档解析场景。 |
公告版式解析 Skill
数据来源
本 Skill 支持多种公告文档输入格式,核心数据来源包括:
1. 公告文档类型
- PDF格式:上市公司公告PDF文档
- Word格式:公告Word文档
- HTML格式:交易所网站公告页面
- 图片格式:扫描版公告图片
2. 公告内容类型
- 定期报告:年报、半年报、季报
- 临时公告:重大事项公告、权益变动公告
- 监管公告:监管问询、行政处罚公告
- 交易公告:停复牌公告、交易异常波动公告
3. 文档特征
- 语言类型:中文、英文
- 版式类型:标准版式、复杂版式、扫描版式
- 文档大小:小文档(<5MB)、大文档(>5MB)
4. 数据格式要求
- 文件路径:本地文件路径或网络文件URL
- 文件编码:UTF-8、GBK、GB2312等
- 文件权限:需要读取权限
说明:本 Skill 不包含文档采集功能,需要用户提供公告文档文件。建议文档格式规范,以便进行准确的版式解析。
功能
本 Skill 提供全面的公告版式解析能力,涵盖多种解析功能:
1. 公告结构识别
- 公告标题识别:识别公告标题和公告类型
- 公告编号识别:识别公告编号和发布机构
- 公告日期识别:识别公告发布日期和生效日期
- 公告主体识别:识别公告正文主体内容
2. 章节结构解析
- 章节层级识别:识别公告的章节层级结构
- 章节标题提取:提取各级章节标题
- 章节内容提取:提取各章节的具体内容
- 章节定位:记录章节在文档中的位置
3. 表格识别
- 财务表格识别:识别财务报表相关表格
- 数据表格识别:识别数据统计表格
- 表格结构解析:解析表格的行列结构
- 表格内容提取:提取表格的具体数据
4. 关键信息提取
- 公司信息提取:提取公司名称、股票代码等信息
- 关键日期提取:提取重要日期和时间节点
- 金额信息提取:提取涉及金额和数值信息
- 关联方信息提取:提取关联方和交易对手信息
5. 版式还原
- 版式结构还原:尽可能还原公告的原始版式
- 格式信息保留:保留字体、字号等格式信息
- 布局信息记录:记录页面布局和元素位置
6. 高级处理功能
- OCR识别:对扫描版公告进行OCR识别
- 多语言识别:识别公告中的多语言内容
- 结构化输出:输出结构化的公告内容
使用示例
输出示例
{
"document_info": {
"filename": "announcement.pdf",
"file_size": 512000,
"page_count": 10,
"language": "zh-CN",
"announcement_type": "重大事项公告"
},
"header": {
"title": "关于重大资产重组的公告",
"announcement_number": "2024-001",
"company_name": "示例股份有限公司",
"stock_code": "000001",
"publish_date": "2024-03-15",
"publish_org": "上海证券交易所"
},
"structure": {
"sections"
注意事项与限制
1. 文档格式要求
- 支持标准公告格式文档
- 复杂版式可能影响解析准确性
- 扫描版公告需要OCR功能支持
2. 解析准确性
- 标准版式公告解析准确率较高
- 非标准版式可能影响结构识别
- OCR识别准确率受图片质量影响
3. 性能考虑
- 大文档处理可能需要较长时间
- 内存占用与文档大小成正比
- 建议对超大文档进行分页处理
4. 版式差异
- 不同交易所公告版式可能不同
- 需要适配不同版式的解析规则
- 新版式可能需要更新解析规则
5. 使用限制
- 本 Skill 不包含文档编辑功能
- 解析结果需要人工复核
- 受保护文档可能无法解析
参考资料
- 见 references/ 目录中的相关文档,包括:
- 公告版式解析方法手册
- 公告结构识别算法说明
- OCR识别使用指南
- 性能优化指南
License
- 本 skill 代码部分采用 MIT License,详见
LICENSE 文件
- 依赖与运行环境以
requirements.txt 为准
- 文档内容采用 CC BY 4.0 许可