| name | expert-collection-analysis |
| description | 智库专家AI数据采集与分析 - 自动化采集政府、智库、媒体的权威专家言论,进行AI智能分析和优先级评分 |
智库专家数据采集与分析 Skill
适用场景
本Skill适用于以下业务场景:
主要场景
- 智库研究机构:建立AI数据领域专家知识库,跟踪权威专家最新观点
- 企业战略部门:监控行业专家动态,识别高价值合作对象
- 政府部门:构建专家资源库,支持政策制定和咨询
- 学术会议组织:筛选高价值专家,进行精准邀请
任务特点
- 需要从多个权威信息源采集专家言论(政府、智库、媒体)
- 需要AI智能分析专家与特定领域(如AI数据)的相关度
- 需要对专家进行优先级排序,识别高价值专家
- 需要专业的数据导出格式(Excel双工作表)
- 需要与飞书多维表格等办公系统集成
输入要求
使用本Skill需要准备以下输入:
必需输入
-
采集领域关键词
- 默认:人工智能、数据要素、算力、大模型、数字经济
- 可自定义搜索关键词列表
-
时间范围
-
飞书配置(如需飞书集成)
- app_id:飞书应用ID
- app_secret:飞书应用密钥
- app_token:多维表格app_token
- table_id:目标数据表ID
可选输入
- 优先级评分权重调整(默认:相关度60% + 权威性40%)
- 单个信息源采集数量限制(默认:20条/源)
- 自定义信息源配置
执行步骤
步骤1:确认采集目标和范围
- 确认要采集的领域关键词
- 确认时间范围(默认24个月)
- 确认信息源配置(15个权威源)
步骤2:自动化数据采集
系统将从以下15个权威信息源采集数据:
政府部门(5个):
- 国务院常务会议相关信息
- 国家数据局政策动态
- 工业和信息化部行业报告
- 科技部发展战略
- 中央政府AI政策
权威智库(5个):
- 国务院发展研究中心研究报告
- 中国信息通信研究院分析报告
- 中国社会科学院学术成果
- 国家高端智库专题研究
- 清华大学AI研究进展
权威媒体(5个):
- 人民网专家观点
- 新华网政策解读
- 央广网产业分析
- 经济日报经济趋势
- 财经网行业动态
每个信息源生成2个搜索URL(网页搜索 + 新闻搜索),共30个真实百度搜索链接。
步骤3:数据清洗与过滤
- 时间过滤:保留时间范围内的数据
- 智能去重:按专家姓名+言论内容去重
- 数据验证:确保必填字段完整
步骤4:AI智能分析
对每条专家言论进行AI分析:
-
相关度评分(0-100分)
- 分析发言内容与目标领域的相关性
- 提取关键主题和观点
-
权威性评分(0-100分)
-
综合优先级计算
综合分数 = 相关度 × 0.6 + 权威性 × 0.4
高优先级 ⭐⭐⭐:综合分≥70 且 相关度≥60
中优先级 ⭐⭐:综合分≥50 或 相关度≥40
低优先级 ⭐:其他
步骤5:专家信息聚合
- 按专家姓名聚合所有言论
- 补充专家档案信息(单位、职务、简介)
- 统计发言次数和主题分布
- 推荐适合的交流活动
步骤6:生成专业报告
- 生成Excel双工作表文件
- 工作表1:专家档案(专家基本信息、优先级、相关度)
- 工作表2:专家言论(链接、时间、内容、主题、要点)
- UTF-8 BOM编码,完美支持中文
- 可直接导入飞书多维表格
输出要求
主要输出
1. Excel专业报告
文件路径:output/专家分析报告_YYYYMMDD_HHMMSS.xlsx
工作表1:专家档案
| 列名 | 类型 | 说明 |
|---|
| 专家姓名 | 文本 | 专家完整姓名 |
| 最新单位 | 文本 | 当前工作机构 |
| 最新职务 | 文本 | 当前职务 |
| 简介 | 文本 | 专家背景介绍(≤500字) |
| 发言统计 | 数字 | 采集到的言论总数 |
| 优先级 | 文本 | 高/中/低 |
| AI数据相关度 | 数字 | 0-100分 |
工作表2:专家言论
| 列名 | 类型 | 说明 |
|---|
| 链接 | 超链接 | 百度搜索URL |
| 时间 | 日期 | 发布日期 |
| 专家姓名 | 文本 | 发言人姓名 |
| 正文 | 文本 | 言论完整内容 |
| 发言主题 | 文本 | 核心话题 |
| 发言要点 | 文本 | 关键观点摘要 |
| 活动背景 | 文本 | 发言场合/事件背景 |
2. JSON结构化数据
文件路径:output/expert_analysis_YYYYMMDD_HHMMSS.json
包含完整的结构化数据,便于程序化处理:
{
"timestamp": "2026-04-15T09:03:00",
"experts": [...],
"speeches": [...],
"statistics": {
"total_experts": 8,
"high_priority": 0,
"medium_priority": 7,
"low_priority": 1
}
}
3. 高优先级专家清单
文件路径:output/high_priority_experts_YYYYMMDD_HHMMSS.json
单独提取高优先级专家,便于快速建联。
输出质量要求
✅ 数据完整性
- 所有必填字段不为空
- 时间格式标准化(YYYY-MM-DD)
- 链接真实可访问
📦 提供的脚本
本Skill在 scripts/ 目录下提供了以下可执行脚本:
1. daily_update.py
主执行脚本,用于自动化数据采集和分析:
python scripts/daily_update.py
功能:
- 从15个权威信息源采集数据
- AI智能分析评分
- 生成Excel报告
- 支持飞书表格集成
依赖:需要配合以下模块使用(用户需自行实现或参考references/)
- enhanced_main.py - 主处理引擎
- enhanced_crawler.py - 数据采集器
- ai_analyzer.py - AI分析模块
- config.ini - 配置文件
2. analyze_experts.py
专家分析工具,用于对已采集的数据进行深度分析:
python scripts/analyze_experts.py
功能:
- 读取采集的JSON数据
- 计算专家优先级
- 生成分析报告
3. run_collection.sh
一键执行脚本(Bash),快速启动完整流程:
bash scripts/run_collection.sh
流程:
- 检查环境和依赖
- 执行数据采集 (daily_update.py)
- 生成分析报告
- 显示结果路径
🛠️ 实现说明
本Skill采用模块化设计,提供两种使用方式:
方式1:使用提供的脚本(推荐)
优点:开箱即用,功能完整
要求:Python 3.8+,需要实现依赖模块
pip install requests beautifulsoup4 lxml openpyxl
python scripts/daily_update.py
方式2:通过Agent动态实现
优点:无需Python环境,灵活可定制
要求:使用Claude Agent + baidu-search skill
步骤:
- 数据采集:使用
baidu-search skill搜索15个权威信息源
- 智能分析:通过Claude API进行AI优先级评分
- 结果导出:使用Python/Node.js生成Excel文件
参考代码:
from baidu_search import search
results = search("国务院 人工智能 2026")
analysis = {
"expert_name": "提取的专家姓名",
"relevance_score": 85,
"priority": "高"
}
import openpyxl
wb = openpyxl.Workbook()
ws = wb.active
ws.append(["专家姓名", "优先级", "相关度"])
ws.append([analysis["expert_name"], analysis["priority"], analysis["relevance_score"]])
wb.save("专家分析报告.xlsx")
详细实现说明请参考 references/README.md
✅ 分析准确性
- 优先级判断逻辑清晰
- 相关度评分有依据
- 专家信息真实可靠
✅ 格式规范性
- Excel编码:UTF-8 with BOM
- 中文显示无乱码
- 可直接导入飞书表格
风险与假设
⚠️ 风险提示
- 搜索结果时效性:百度搜索结果依赖网络实时状态
- 专家信息准确性:需人工核实关键专家的单位职务
- 权限要求:飞书API需要企业管理员审批权限
- 采集频率:建议每日更新不超过1次,避免频繁请求
📋 假设条件
- 网络环境可访问百度搜索
- Python 3.8+ 环境已安装
- 必要依赖包已安装:requests、beautifulsoup4、lxml、openpyxl
- (可选)飞书权限已配置
✓ 需确认事项
参考资料
详细的使用说明、配置示例和技术文档请参考 references/ 目录:
百度搜索集成指南.md - 如何配置和使用百度搜索采集
快速参考.md - 快速上手指南
项目完成总结.md - 系统架构和实现细节
数据来源真实性解决方案.md - 数据源配置说明
快速使用
安装依赖
pip install requests beautifulsoup4 lxml openpyxl
执行采集
python daily_update.py
查看结果
open output/专家分析报告_*.xlsx
cat output/expert_analysis_*.json
定时更新
系统支持每天早上9:03自动执行(需Claude会话保持运行)。
版本:v1.0.0
License:MIT