researcher
信息检索 skill。接收问题列表,通过浏览器自动搜索并抓取高质量网页内容,存入 raw/ 文件夹。含两层质量筛选(抓取前过滤低质来源,抓取后评分)。通常由 autodidact skill 调用,也可单独使用。依赖 agent-browser CLI。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
信息检索 skill。接收问题列表,通过浏览器自动搜索并抓取高质量网页内容,存入 raw/ 文件夹。含两层质量筛选(抓取前过滤低质来源,抓取后评分)。通常由 autodidact skill 调用,也可单独使用。依赖 agent-browser CLI。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
自动课题研究器。给定一个研究课题,自动循环执行"提问→检索→整理→评估",持续更新知识库直到研究目标达成。适用于行业调研、技术研究、概念理解、创业方案构建等场景。触发方式:用户说"帮我研究 X"、"调研一下 X"、"我想深入了解 X"、"/autodidact X"。
课题研究提问引擎。综合知识审计报告、用户插入问题、既定框架,生成每轮最有价值的问题列表,驱动后续检索。是整个研究循环的核心引擎——问题的质量决定研究的深度。通常由 autodidact skill 调用,也可单独使用。
个人知识库管理工具。支持三个命令:/wiki compile(将 raw/ 素材增量编译为结构化 wiki)、/wiki check(知识审计:有问题列表时做完整审计,无问题列表时做纯结构审计)、/wiki check <questions_file>(基于 wiki 回答问题并做结构审计,合并输出为单份 check 报告)。
基于 SOC 职业分类
| name | researcher |
| description | 信息检索 skill。接收问题列表,通过浏览器自动搜索并抓取高质量网页内容,存入 raw/ 文件夹。含两层质量筛选(抓取前过滤低质来源,抓取后评分)。通常由 autodidact skill 调用,也可单独使用。依赖 agent-browser CLI。 |
接收问题列表,通过浏览器检索互联网,将高质量信息抓取为 Markdown 存入 raw/。
执行前先确认 agent-browser 可用:
agent-browser --version
若不可用,直接静默降级到 WebSearch + WebFetch 工具组合,行为保持一致,不提示用户安装,不中断流程。 在最终输出摘要中记录"agent-browser 不可用,已使用 WebSearch 降级"即可。
从调用上下文读取:
outputs/rounds/round_<N>_questions.json(questioner 的输出)若直接调用,也可接受用户直接提供的问题列表。
并行策略:对问题列表中的每个问题,同时启动多个 subagent 并行处理,而不是串行逐一执行。这是提速的关键——5 个问题串行需要 5 倍时间,并行只需 1 倍。
outputs/rounds/round_N_questions.json)每个 subagent 的 prompt 模板:
你是一个信息检索 agent。请完成以下检索任务:
工作目录:<知识库根目录绝对路径>
今日日期:<YYYY-MM-DD>
当前轮次:<N>
**问题**:<问题文本>
请按以下步骤执行:
1. 生成 2-3 组搜索关键词(中文 + 英文)
2. 用 agent-browser 搜狗搜索获取 URL 列表
3. 筛选 3-5 个高质量 URL(过滤广告、登录墙、内容农场)
4. 逐一抓取正文
5. 质量评分(高/中/低),写入 raw/ 文件
搜索命令:
REAL_UA="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36"
agent-browser --user-agent "$REAL_UA" batch \
"open https://www.sogou.com/web?query=<关键词>" \
"wait --load networkidle" "get text body"
抓取正文:
agent-browser --user-agent "$REAL_UA" batch \
"open <url>" "wait --load networkidle" "get text body"
raw/ 文件格式(保存至 <工作目录>/raw/YYYY-MM-DD_<slug>.md):
# <页面标题>
> 来源:<URL>
> 抓取日期:<YYYY-MM-DD>
> 关联问题:<问题文本>
> 质量评分:高/中/低
> 质量说明:<一句话>
---
<正文>
完成后将新增文件路径列表作为你的最终输出(每行一个路径),以便主 agent 汇总。若所有 URL 均失败,输出"检索失败:<问题>"。
并行注意事项:
raw/ 目录,文件名用 slug 去重,同名跳过将问题转化为 2-3 组搜索关键词:
示例:
RAG 检索增强生成 技术挑战 问题RAG retrieval augmented generation challenges limitations实测结论(2026-04):设置真实 User-Agent 是绕过反爬的关键。所有 agent-browser 命令都应加上 --user-agent 选项:
REAL_UA="Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36"
各搜索引擎实测结果:
| 搜索引擎 | 无 UA | 真实 UA | 备注 |
|---|---|---|---|
| 搜狗 sogou.com | CAPTCHA | ✅ 可用 | 中英文均好,get text body 直接获取 |
| 百度 baidu.com | CAPTCHA | ✅ 可用 | 中文结果丰富,需用 snapshot -i 获取(get text body 不返回结果) |
| cn.bing.com | 部分可用 | 部分可用 | 仅中文通用词有效,英文和专业术语常跑偏 |
| DuckDuckGo | 超时 | 超时 | 国内不可访问 |
| CAPTCHA | CAPTCHA | 不可用 |
推荐搜索策略(按优先级):
agent-browser --user-agent "$REAL_UA" batch \
"open https://www.sogou.com/web?query=<关键词>" \
"wait --load networkidle" \
"get text body"
agent-browser --user-agent "$REAL_UA" batch \
"open https://www.baidu.com/s?wd=<中文关键词>" \
"wait --load networkidle" \
"snapshot -i -c -d 3"
直接访问已知高质量站点(当搜索引擎结果质量不佳时,按课题类型选择):
技术 / AI
arxiv.org/search/?query=<关键词>&searchtype=all)金融 / 投资
行业调研
政策 / 法规(中国)
学术研究
医疗健康
创业 / 商业
从搜索结果中提取:标题、摘要、URL(通常 10 条左右)。
Chrome 启动问题:若 Chrome 报错退出(DevToolsActivePort 文件未生成),设置环境变量后重启:
AGENT_BROWSER_ARGS="--no-sandbox" agent-browser --user-agent "$REAL_UA" open ...
对每条搜索结果,根据标题、摘要、域名判断质量:
优先保留:
过滤掉:
每个问题选 3-5 个 URL 进入下一步。多个关键词组的结果合并去重。
对每个筛选后的 URL,用 batch 合并多步命令减少启动开销:
agent-browser batch "open <url>" "wait --load networkidle" "get text body"
若页面内容过长(>50000 字符),改用 snapshot 并限制范围:
agent-browser batch "open <url>" "wait --load networkidle" "snapshot -c -d 5 -s article"
注意:-s 是 selector 参数(短选项),get text 的选择器直接跟在后面不加引号(如 get text body)。
提取正文,去除导航、页脚、广告等噪音。
对抓取到的正文评估:
| 维度 | 高质量 | 低质量 |
|---|---|---|
| 信息密度 | 有具体数据、案例、代码 | 空话、泛泛而谈 |
| 问题相关度 | 直接回答问题 | 擦边相关 |
| 来源可信度 | 作者可查、有引用 | 匿名、无出处 |
| 时效性 | 近 2 年内 | 过时信息(技术类尤其注意) |
评分结果:高 / 中 / 低,附一句话说明。
低质量内容仍然保存(保留原始记录),但在文件头部标注,wiki compile 时会降权处理。
文件命名:YYYY-MM-DD_<问题id>_<slug>.md
r1q3),确保不同 subagent 并行写入时不会发生 slug 碰撞,同时方便追溯每个文件来自哪个问题-、去除特殊字符)-2、-3 依此类推,保留不同来源文件格式:
# <页面标题>
> 来源:<URL>
> 抓取日期:<YYYY-MM-DD>
> 关联问题:<触发这次检索的问题文本>
> 质量评分:高/中/低
> 质量说明:<一句话评分依据>
---
<正文内容>
所有文件写入完成后,输出摘要:
## 检索完成(第 N 轮)
处理问题:X 个
新增文件:X 个(列出文件名)
跳过(已存在):X 个
抓取失败:X 个(列出 URL 和原因)
质量分布:高 X 个 / 中 X 个 / 低 X 个
新增文件列表:
- raw/2026-04-09_xxx.md [高质量]
- raw/2026-04-09_yyy.md [中质量]
同时返回新增文件列表供 autodidact 传给 wiki compile。