一键导入
datasets-search
搜索和爬取网络上数据集相关信息,包括开源数据集、企业数据集发布、高质量数据集参评等。提取数据集名称、内容介绍、所属企业名称(简称自动扩展为全称),标记高质量数据集,生成结构化报告。用于:1) 搜索最新的数据集资源,2) 追踪企业数据集动态,3) 发现开源数据集链接,4) 每周生成数据集增量报告。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
搜索和爬取网络上数据集相关信息,包括开源数据集、企业数据集发布、高质量数据集参评等。提取数据集名称、内容介绍、所属企业名称(简称自动扩展为全称),标记高质量数据集,生成结构化报告。用于:1) 搜索最新的数据集资源,2) 追踪企业数据集动态,3) 发现开源数据集链接,4) 每周生成数据集增量报告。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
| name | datasets-search |
| description | 搜索和爬取网络上数据集相关信息,包括开源数据集、企业数据集发布、高质量数据集参评等。提取数据集名称、内容介绍、所属企业名称(简称自动扩展为全称),标记高质量数据集,生成结构化报告。用于:1) 搜索最新的数据集资源,2) 追踪企业数据集动态,3) 发现开源数据集链接,4) 每周生成数据集增量报告。 |
爬取网络上关于数据集发布、开源、认证的新闻,自动提取关键信息并生成结构化报告。
用户请求爬取数据集新闻
│
▼
运行爬虫脚本 → 抓取多个数据源
│
▼
解析提取信息 → 数据集名称/企业/描述/链接
│
▼
企业名称扩展 → 简称→全称映射
│
▼
质量标记识别 → 标记高质量数据集
│
▼
生成增量报告 → 对比历史输出新增内容
│
▼
返回结构化列表 → Markdown格式报告
python3 scripts/dataset_crawler.py --days 7 --output report.md
python3 scripts/dataset_crawler.py --incremental --state-file ~/.dataset_crawler_state.json
python3 scripts/dataset_crawler.py --sources jiqizhixin,infoq,oschina
生成的报告为Markdown格式,包含以下字段:
## 数据集新闻报告 (2024-01-15)
### 本周新增数据集 (5条)
| 数据集名称 | 企业名称 | 数据集描述 | 高质量标记 | 相关链接 |
|-----------|---------|-----------|-----------|---------|
| 百度文心大模型数据集 | 北京百度网讯科技有限公司 | 用于训练文心大模型的中文数据集,包含... | ⭐ | [链接](https://...) |
| AliQA开源问答数据集 | 阿里巴巴集团控股有限公司 | 面向电商领域的问答数据集,包含100万... | - | [GitHub](https://...) |
爬虫默认支持以下数据源,可在references/data_sources.md中查看详情和添加新源:
| 数据源 | 类型 | 可用性 | 说明 |
|---|---|---|---|
| GitHub | 开源平台 | ⭐⭐⭐⭐⭐ | API 稳定,成功率高 |
| Gitee | 国内开源 | ⭐⭐⭐⭐ | API 可用,部分已知数据集 |
| ModelScope | 阿里云平台 | ⭐⭐⭐⭐ | API 可用,高质量数据集 |
| 智源研究院 | AI研究院 | ⭐⭐⭐⭐ | 已知数据集列表 |
| 数据堂/标贝/拓尔思/海天瑞声 | 数据服务商 | ⭐⭐⭐⭐ | 已知数据集列表 |
| 数据源 | 类型 | 可用性 | 说明 |
|---|---|---|---|
| 机器之心 | AI媒体 | ⭐⭐ | 有反爬措施,可能失败 |
| InfoQ | 技术平台 | ⭐⭐ | 有反爬措施,可能失败 |
| 开源中国 | 开源社区 | ⭐⭐ | 有反爬措施,可能失败 |
| 站长之家 | 技术媒体 | ⭐⭐ | 有反爬措施,可能失败 |
⚠️ 重要提示: 机器之心、InfoQ、开源中国等站点均有反爬措施,User-Agent 轮换和随机延迟不足以保证稳定可用。建议:
- 多次运行脚本以获取更多数据
- 或使用 web-access skill 作为降级方案检索这些站点
企业简称到全称的映射表存储在references/company_mappings.md中。如需扩展映射关系,请编辑该文件。
常见映射示例:
pip install requests beautifulsoup4 lxml feedparser
HTTP_PROXY/HTTPS_PROXY)通过数据集名称+企业名称的组合进行去重,状态文件保存在~/.dataset_crawler_state.json
建议每周日执行一次,获取本周增量信息:
# 添加到crontab (Mac/Linux)
0 9 * * 0 cd /path/to/skill && python3 scripts/dataset_crawler.py --incremental --output weekly_report.md
当内置爬虫无法获取某些数据源时,推荐以下替代方案:
# 使用 web-access skill 检索特定网站
/web-access https://www.jiqizhixin.com/search?query=数据集
# 设置代理环境变量
export HTTP_PROXY=http://your-proxy:port
export HTTPS_PROXY=http://your-proxy:port
python3 scripts/dataset_crawler.py --days 7
脚本内置了部分已知的高质量数据集列表(来自智源研究院、数据堂、标贝科技等),即使网络爬取失败,仍可返回这些基础数据。
售前工程师AI助手。当用户需要做客户背调、准备拜访材料、制作方案PPT、生成Ghost Deck、准备演讲要点、处理客户异议、评估商机成熟度、写会后跟进计划时,即使没有明确说"售前",也应使用本skill。面向政府、行业头部企业、技术型企业三类客户,覆盖"客户画像→需求分析→Ghost Deck→方案生成→专家自审→演讲要点→异议处理→商机评分→跟进计划"完整售前链路。
用于搜集百度飞桨与文心大模型相关运营资讯、竞品动态、厦门本地 AI 政策活动,并输出潜在客户清单与周度运营汇总的业务技能。当用户提到运营周报、竞品动态、厦门 AI 政策、潜客挖掘、飞桨/文心最新消息、客户线索表、活动情报汇总时都应使用本 Skill。
This skill should be used when the user wants to monitor, search, or analyze social media and web content about ERNIE-Image across Chinese platforms including Zhihu, Xiaohongshu, WeChat Official Accounts, and Baidu Search.
短剧剧本生成Agent。当用户需要创作短剧剧本时使用,支持从选题到成稿的完整创作流程。包含人物设定维护、情节结构规划、剧本格式输出、质量检查等功能。
对即将会面的政府单位、企事业单位等机构进行高可靠背景和业务调研。采用 Pipeline + Reviewer + Generator 结构,强制输出候选来源、原子事实、链接审计、事实准入、组织分析和终审结果,用于尽量确保关键事实均有可核查来源链接,便于进一步深入了解和复核,适用于需要可核查来源和质量门禁的单位调研。
重要会谈谈参生成助手 - 面向高层会谈,基于会谈对象、合作背景、双方诉求与我方能力,自动生成部门领导可直接参考的会谈背景、合作主线、谈话要点、建议提问、后续推进建议及风险提示