一键导入
data-profiling
【数据轮廓速览】当用户刚上传数据、问"数据有多少行"、"有哪些字段"、"数据长什么样"时使用。描述数据结构(行列数、字段类型、缺失率、分布特征、数据质量),不计算建模指标。无需目标变量。与 feature-analysis 的区别:只做"描述"不做"分析",不计算IV/PSI/相关性等建模指标。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
【数据轮廓速览】当用户刚上传数据、问"数据有多少行"、"有哪些字段"、"数据长什么样"时使用。描述数据结构(行列数、字段类型、缺失率、分布特征、数据质量),不计算建模指标。无需目标变量。与 feature-analysis 的区别:只做"描述"不做"分析",不计算IV/PSI/相关性等建模指标。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
理赔核赔全案复审与决策专家。整合全案复审、流程合规检查能力。核查材料齐全性、立案合理性、医审核定准确性、理算计算正确性及作业规范性,综合输出核赔决策(准赔/减赔/拒赔/挂起)。当核赔专员需要对已完成医审和理算的案件进行终审决策、发现疑点需复核时触发。适用于核赔岗全案审核、赔付决策、案件质检场景。触发词:全案复审、怎么判、审核结论汇总。
理赔理算校验与调度专家。对进入理算环节的案件进行准入审查和数据完整性校验,确认理算前置条件满足后,通过MCP调用理算引擎完成实际金额计算,输出标准化理算书。当案件完成医审和责任认定后进入理算环节、需要计算应赔金额、生成理算书时触发。适用于理赔理算前置校验、理算参数校验、理算书生成场景。触发词:赔多少、理算、赔付金额。
"理赔报案受理与案件登记专家。整合报案信息结构化提取、保单状态核验、重复报案检测能力,提取出险时间、事故经过、伤亡情况、保单信息等关键要素,生成标准化报案记录并分配案件编号。当客户拨打报案电话、提交报案申请或上传报案材料时触发。适用于理赔受理岗报案登记、报案信息结构化录入、案件初始档案建立场景。触发词:"报案登记"、"案件登记"、"报案受理"、"录入案件"。 触发词:理赔报案、案件录入、重复报案。"
"保险理赔材料智能分析工具。整合材料分类、OCR提取、完整性检查、单证审核、一致性校验、发票交叉验证、病程时间线梳理能力。采用前置解析+按需复用架构,基于多模态大模型对理赔图片文档进行全链路分析,输出标准化目录结构、病程摘要和审计报告。当用户需要对理赔材料、保险单证、医疗票据进行分类整理,或提及理赔材料分类、保险文档归档、医疗发票识别、材料审核、病程时间线时使用。触发词:"理赔材料分类"、"材料完整性检查"、"材料一致性校验"、"理赔交叉验证"、"材料全量审核"、"病程时间线"。 触发词:理赔材料、材料齐不齐、病程时间线。"
对理赔案件进行多维度欺诈风险检测,综合分析材料一致性、行为模式、历史记录等信息,计算欺诈风险评分,识别虚假理赔、骗保欺诈等可疑信号。当需要评估理赔案件欺诈风险、识别可疑骗保行为、对高风险案件进行预警时触发。适用于理赔欺诈筛查、可疑案件调查决策、反欺诈合规管理场景。触发词:欺诈风险、骗保嫌疑、欺诈评分。
理赔结案通知与客户沟通专家。生成标准化的理赔通知书(赔付/拒赔/补件),并配套口头沟通话术与情绪安抚指导,确保书面函件合规、口头沟通专业。当需要出具理赔结果通知、生成拒赔说明书、通知客户补充材料、告知赔付金额,或需要与客户进行拒赔解释、情绪安抚时触发。适用于理赔结案通知生成、拒赔函件起草、补件通知书制作、客户沟通话术辅助场景。触发词:结案通知、通知客户、理赔通知书。
| name | data-profiling |
| category | 数据探索 |
| description | 【数据轮廓速览】当用户刚上传数据、问"数据有多少行"、"有哪些字段"、"数据长什么样"时使用。描述数据结构(行列数、字段类型、缺失率、分布特征、数据质量),不计算建模指标。无需目标变量。与 feature-analysis 的区别:只做"描述"不做"分析",不计算IV/PSI/相关性等建模指标。 |
| next_steps | [{"skill":"feature-analysis","text":"全量特征分析,推荐建模方案","prompt":"全面分析所有特征,推荐建模方案"}] |
基于 scripts/profiler.py 主脚本,对数据集进行轮廓扫描,生成数据概况报告。
| 参数 | 必选 | 默认值 | 说明 |
|---|---|---|---|
--data_path | ✅ | - | 数据文件路径(parquet/csv) |
--output | data_profiling_report.md | 报告输出路径 | |
--output_dir | ./outputs/<ts> | 产物输出目录 | |
--output_name | data_profiling_report | 报告基名(不含扩展名) | |
--config | - | JSON 配置文件路径 |
python scripts/profiler.py \
--data_path ./examples/toy.parquet \
--output_dir ./outputs/profile_run
执行结束后:
<output_dir>/ 下生成:
report.md — 数据概况报告result.json — 结构化产物清单(见 PROTOCOL.md)result.json 绝对路径,Agent 读这个文件即可{
"skill": "data-profiling",
"status": "success",
"files": [
{"path": ".../report.md", "role": "report"}
],
"metrics": {"n_rows": 10000, "n_cols": 28, "n_missing_cols": 5},
"summary": "中等规模数据集(10,000行),28 个字段,数值型为主,发现 2 个高缺失字段"
}
| 章节 | 内容 |
|---|---|
| 1. 数据概览 | 文件名、格式、大小、行列数、字段类型分布饼图 |
| 2. 字段详情清单 | 每个字段的类型、缺失率、唯一值数、示例值 |
| 3. 数值特征分析 | 描述性统计(均值/标准差/分位数/偏度/峰度)+ histogram 分布图 |
| 4. 类别特征分析 | 唯一值数、Top 值占比、集中度 + bar chart |
| 5. 缺失值分析 | 缺失率排名表格 + 柱状图 |
| 6. 数据质量 | 重复行、空列、常量列、高缺失列 |
| 7. 样本预览 | 前 5 行数据展示 |
当数值/类别特征数量超过 20 个时,统计表格和图表只展示前 20 个,避免报告过长。
| Skill | 用途区别 |
|---|---|
| data-profiling | 快速了解数据轮廓,不做深度分析 |
| feature-analysis | 深度特征分析(IV、PSI、相关性等),需要目标变量 |
| xgb-modeling | 建模全流程,需要目标变量 |
建议流程:
data-profiling 了解数据基本情况feature-analysis 或 xgb-modeling