一键导入
research-collector
使用多策略进行高效资料收集:Fork Subagent 隔离收集、两阶段粗筛+精读、格式约束优化 token 消耗、本地缓存复用。触发词:收集资料、研究资料、搜集信息、资料整理、research、gather information、collect资料。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
使用多策略进行高效资料收集:Fork Subagent 隔离收集、两阶段粗筛+精读、格式约束优化 token 消耗、本地缓存复用。触发词:收集资料、研究资料、搜集信息、资料整理、research、gather information、collect资料。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
多篇既有学习笔记的批量更新编排。用于用户想一次更新一个目录、文件列表、Obsidian vault 子目录或多篇旧笔记,例如“批量更新这些笔记”“多篇笔记过时了”“把一组笔记更新到新版本”“refresh multiple notes”。先生成更新清单和批量计划,经用户确认后逐篇调用 note-updater 局部 patch,避免全文重写和批量误覆盖。
旧笔记批量导入、盘点和规范化。用于用户已经有一堆 Markdown/Obsidian/零散学习笔记,想接入本项目工作区、按项目 Obsidian 规范补 frontmatter、标签、双链、Callout、MOC,并保留原始文件时使用。触发词:旧笔记导入、已有笔记、一堆笔记、批量整理、迁移到这个项目、按项目规范、import existing notes、normalize notes。
学习笔记需求澄清与引导。分析用户学习需求,引导明确学习目标和方向,调用 workflow-orchestrator 生成项目结构。触发词:想学、帮我整理、研究一下、了解一下、不知道从哪开始、research planning、explore topic。
业务工作流实例化器。由 planner 技能调用,接收 workflow_id、topic、project_slug 等参数,按 .claude/workflows/{workflow-id}/state-template.md 生成 workspace/workflow-runs/{run-id}.workflow.md。不直接面向用户;通用状态格式和状态流转由 workflow-todo-state 负责。
Create or retrofit reusable named workflow state machines for multi-step agent projects. Use when a project needs recoverable workflow state files, multiple workflow definitions, phase gates, restart-safe agent workflows, explicit skipped/blocked states, workflow routing rules, or reusable workflow templates across repositories.
自我学习阶段。回顾本次学习会话,记录学习心得和错误到 .claude/rules/learnings/,当文件超阈值时自动压缩去重,更新 RULES.md,促进系统持续改进。
| name | research-collector |
| description | 使用多策略进行高效资料收集:Fork Subagent 隔离收集、两阶段粗筛+精读、格式约束优化 token 消耗、本地缓存复用。触发词:收集资料、研究资料、搜集信息、资料整理、research、gather information、collect资料。 |
使用多种策略进行高效资料收集,优化 token 消耗并支持本地缓存复用。
当用户提出以下类型的请求时,调用此技能:
原理: 主 Agent 派发多个 fork subagent 并行搜索不同关键词/信源,每个 subagent 只返回结构化摘要,避免原始网页全文污染主上下文。
实现:
主 Agent
├── Fork Subagent 1: 搜索 "关键词 A + 来源1"
├── Fork Subagent 2: 搜索 "关键词 B + 来源2"
├── Fork Subagent 3: 搜索 "关键词 C + 来源3"
└── ...
↓
每个 Subagent 返回:结构化摘要(<150 字)
↓
主 Agent 聚合:提炼后的结果
优势:
第一阶段: 批量粗筛
第二阶段: 定向精读
WebFetch 定向深读给 subagent 的 prompt 中严格限定输出格式,避免冗余:
## 返回格式(严格遵守)
每条资料格式:
- **标题**: [文章标题]
- **URL**: [链接]
- **摘要**: [核心观点,不超过 150 字]
- **相关性评分**: [1-5,5 为高度相关]
- **关键数据**: [如有,列出 1-3 个关键数据点]
- **来源类型**: [官方文档/技术博客/学术论文/社区讨论/新闻报道]
禁止返回:
- ❌ 完整段落
- ❌ 页面导航信息
- ❌ 广告内容
- ❌ Cookie 提示
- ❌ 无关的侧边栏内容
缓存目录: ${WORKSPACE_PATH:-./workspace}/${PROJECT_SLUG}/(项目专属文件夹)
文件命名: 02_deep_research.md(固定命名,供下游组件读取)
缓存结构:
# {主题} - 资料收集
收集时间: YYYY-MM-DD HH:MM
搜索关键词: [关键词列表]
## 第一阶段: 粗筛结果
| # | 标题 | URL | 相关性 | 摘要 |
|---|------|-----|--------|------|
| 1 | ... | ... | 5/5 | ... |
## 第二阶段: 精读笔记
### 资料 1: {标题}
- **URL**: ...
- **核心观点**: ...
- **关键数据**: ...
- **我的笔记**: ...
## 综合分析
[总结关键发现、趋势、共识与分歧]
启动时必须确定项目文件夹并检查 todo.md:
WORKSPACE_PATH="${WORKSPACE_PATH:-./workspace}"
# 方式 1: 从意图文件读取项目标识
PROJECT_SLUG=$(grep "项目标识" "${WORKSPACE_PATH}"/*/00_intent.md 2>/dev/null | head -1 | sed 's/.*://')
# 方式 2: 如果有多个项目,提示用户选择
if [ -z "$PROJECT_SLUG" ]; then
echo "找到以下项目:"
ls -d "${WORKSPACE_PATH}"/*/ 2>/dev/null | xargs -I {} basename {}
echo "请指定项目名称"
exit 1
fi
PROJECT_DIR="${WORKSPACE_PATH}/${PROJECT_SLUG}"
# 读取 todo.md
cat ${PROJECT_DIR}/todo.md 2>/dev/null || echo "不存在"
状态检查:
/research-planner 创建意图文件/research-planner"更新 todo.md 状态:
# 将当前阶段标记为进行中(根据实际执行的阶段选择 [P1] 或 [P2])
# 阶段 1(探测式收集):
.claude/scripts/todo-state.sh "${PROJECT_DIR}/todo.md" start P1
# 阶段 2(深度收集):
.claude/scripts/todo-state.sh "${PROJECT_DIR}/todo.md" start P2
完成后更新状态:
# 将当前阶段标记为完成(根据实际执行的阶段选择 [P1] 或 [P2])
# 阶段 1 完成:
.claude/scripts/todo-state.sh "${PROJECT_DIR}/todo.md" complete P1
# 阶段 2 完成:
.claude/scripts/todo-state.sh "${PROJECT_DIR}/todo.md" complete P2
Phase 1: 粗筛 (并行)
使用 Agent 工具创建多个 subagent,每个负责不同搜索维度:
Subagent 1: 搜索 "{关键词1} site:官方文档"
Subagent 2: 搜索 "{关键词2} 最佳实践"
Subagent 3: 搜索 "{关键词3} 教程 入门"
Subagent 4: 搜索 "{关键词4} 常见问题 问题排查"
每个 subagent 的 prompt 模板:
你是一个资料收集助手。只返回关于指定主题的结构化资料摘要。
返回格式(严格遵守,每条不超过 150 字):
1. **标题**: ...
**URL**: ...
**摘要**: [核心观点,150 字内]
**相关性评分**: [1-5]
**关键数据**: [1-3 个]
**来源类型**: [官方文档/博客/论文/社区/新闻]
禁止返回: 完整段落、导航、广告、Cookie 提示。
请搜索并返回 3-5 条最相关的资料。
参数:
- 主题: {主题}
- 搜索关键词: {关键词}
- 信源限制: {信源类型}
Phase 2: 精读 (按需)
从粗筛结果中筛选评分 ≥4 的资料:
使用 WebFetch 深度阅读:
- URL: {选中的 URL}
- Prompt: "提取文章的核心观点、关键数据、主要结论。忽略广告、导航、侧边栏。"
将结果写入本地文件:
${WORKSPACE_PATH:-./workspace}/${PROJECT_SLUG}/02_deep_research.md
注意: 使用固定文件名 02_deep_research.md,方便下游组件(outline-generator、chapter-writer)直接读取。
更新 todo.md 状态:
# 将当前阶段标记为完成,推进到下一阶段
.claude/scripts/todo-state.sh "${PROJECT_DIR}/todo.md" complete P2
## 📚 资料收集完成
### 第一阶段: 粗筛结果 (共发现 12 条)
| # | 标题 | 评分 | 来源 |
|---|------|------|------|
| 1 | React 18 新特性详解 | 5/5 | 官方文档 |
| 2 | React 并发模式最佳实践 | 4/5 | 技术博客 |
| 3 | React 18 迁移指南 | 4/5 | 官方博客 |
| ... | ... | ... | ... |
### 第二阶段: 精读笔记
#### 1. React 18 新特性详解 (官方文档)
- **核心观点**: React 18 引入并发渲染、自动批处理、Suspense 改进
- **关键数据**:
- 性能提升 2-3 倍 (复杂应用)
- 自动批处理减少 60% 渲染次数
- **我的笔记**: [根据精读内容生成]
### 综合分析
[总结关键发现、最佳实践、常见问题]
---
✅ 资料已缓存到: ${WORKSPACE_PATH:-./workspace}/${PROJECT_SLUG}/02_deep_research.md
# 第一轮: 宏观了解
/research-collector "React 状态管理"
# 第二轮: 针对特定工具深入
/research-collector "Zustand vs Jotai vs Redux Toolkit 对比"
# 第三轮: 实战案例
/research-collector "React 状态管理 项目实战 最佳实践"
同时从多个维度收集:
# 检查是否已有相关缓存
ls research_notes/*react*
# 读取已有缓存
cat research_notes/react-2025-01-15.md
# 基于缓存补充收集
/research-collector "React 性能优化" (补充之前未覆盖的方面)