원클릭으로
deep-web-explorer
从需要表单交互或特定查询参数的深网数据库接口中提取结构化数据
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
从需要表单交互或特定查询参数的深网数据库接口中提取结构化数据
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
搜索学术论文(Semantic Scholar + DBLP + arXiv 三源并行),返回标题、作者、摘要、引用数、链接
从 api.crossref.org 抽取学术文献:标题、链接、DOI、摘要片段及引用数
从 api.openalex.org 抽取学术作品:标题、URL、出版年份、DOI、类型
搜索微信公众号文章并提取全文(通过 Sogou 微信搜索),返回标题、真实 URL、发布时间、正文内容
搜索近期新闻文章(NewsAPI + Google News RSS 双源回退),返回标题、来源、日期、摘要
抽取 hn_story:title、url、author、points、created_at
| name | deep_web_explorer |
| description | 从需要表单交互或特定查询参数的深网数据库接口中提取结构化数据 |
| trigger | 目标数据隐藏在动态数据库表单之后(如.gov科学数据库、公共记录库),标准搜索引擎无法索引 |
| success_rate | 0 |
| status | seed |
| trigger_conditions | {"domain":["general"],"entity_types":["any"],"attribute_types":["any"],"coverage_gap_pattern":"surface_web_dry"} |
| cost_hint | high |
| effectiveness_score | 0 |
解决标准搜索引擎无法索引或检索“深网”内容的问题。此类内容通常存在于动态数据库、政府数据门户或需要表单交互的系统中。该技能旨在通过直接与数据库查询接口交互,构建特定的查询参数或模拟表单提交,从而获取结构化的数据结果,避免在静态搜索结果中陷入死循环。
.gov 域名的科学数据库、公共记录库)。status=Threatened, taxon=Bird),而不是构建长难句关键词。open 配合特定参数直接访问查询结果页(如果URL模式已知),或使用 click/type 操作表单元素。<form> 标签、搜索栏、下拉筛选器。<select> 标签对应的选项值(例如,页面上显示 "Threatened",但 value 可能是 "T" 或 "2")。search.html 变为 results.html?status=T&group=Bird)。open 到构造好的 URL(如 .../species?status=Threatened&class=Bird)。这比模拟点击更节省步骤。type "Bird" into search_box, click "Threatened" checkbox, click "Submit"。page/offset 参数。适用于 GET 请求的数据库接口。
open url="[Database_Base_URL]/[Search_Script]?[Param1]=[Value1]&[Param2]=[Value2]"
示例:
open url="https://ecos.fws.gov/ecp0/reports/ad-hoc-species-report?kingdom=Animal&class=Aves&status=Threatened"
适用于复杂的 POST 请求或 JavaScript 渲染的表单。
open url="[Database_Search_Page_URL]"
find "Status" # 确认加载完成
click "checkbox[value='Threatened']"
click "button[type='submit']"
任务: Search the U.S. Fish & Wildlife Service ECOS database for all bird species listed as "Threatened".
执行过程:
初步定位:
ecos.fws.gov 是一个数据库接口。分析接口:
open "https://ecos.fws.gov/ecp0/reports/ad-hoc-species-report"kingdom (界), class (纲), status (状态)。构建查询:
class=Aves (鸟类学名)status=Threatenedhttps://ecos.fws.gov/ecp0/reports/ad-hoc-species-report?kingdom=Animal&class=Aves&status=Threatened获取数据:
open url="https://ecos.fws.gov/ecp0/reports/ad-hoc-species-report?kingdom=Animal&class=Aves&status=Threatened"find 或解析表格内容提取数据。结果: 成功绕过无效的通用搜索,直接从深网数据库提取结构化数据。
问题解析
用一句话重述问题,并列出所有必须满足的子条件(≥2 个)。
例:需同时满足“Marcelo Arévalo + 2010-2014 + São Paulo + 单打冠军”。
优先级排序
按“最易锁定 → 最难锁定”排序。通常:特定报道标题 > 数值/事实 > 宽泛事件。
首轮精准搜索
用“实体 + 最强限定词”构造查询:"Marcelo Arévalo" "São Paulo" 2010..2014 singles winner site:atptour.com。
结果缺口识别
若首轮无直接答案,记录缺失信息(如只找到双打记录),准备二次拆解。
次级扩展搜索
放宽或替换限定词,引入次级来源:"Marcelo Arévalo" São Paulo challenger 2012 site:flashscore.com OR site:itftennis.com。
交叉验证
对关键事实(冠军名称、数值、日期)至少找到两条独立来源;若冲突,标记并溯源。
整合与摘要
将各子事实拼接成最终答案,注明来源与置信度;如仍有缺口,明确说明“未找到”。
存档与模板化
把有效 query 模板与来源列表保存,供后续同类问题复用。
"{exact_title}" site:bbc.co.uk"{entity}" "{location}" {start_year}..{end_year} "{keyword}"