بنقرة واحدة
list-table-extraction
从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等)
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等)
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
搜索学术论文(Semantic Scholar + DBLP + arXiv 三源并行),返回标题、作者、摘要、引用数、链接
从 api.crossref.org 抽取学术文献:标题、链接、DOI、摘要片段及引用数
从 api.openalex.org 抽取学术作品:标题、URL、出版年份、DOI、类型
搜索微信公众号文章并提取全文(通过 Sogou 微信搜索),返回标题、真实 URL、发布时间、正文内容
搜索近期新闻文章(NewsAPI + Google News RSS 双源回退),返回标题、来源、日期、摘要
抽取 hn_story:title、url、author、points、created_at
استنادا إلى تصنيف SOC المهني
| name | list_table_extraction |
| description | 从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等) |
| trigger | 需要从单页或少量页面提取多行结构化数据 |
| success_rate | 0 |
| status | seed |
| trigger_conditions | {"domain":["general"],"entity_types":["entity"],"attribute_types":["list","table","enumeration"]} |
| cost_hint | mid |
| effectiveness_score | 0 |
解决从权威页面(如 Wikipedia、IMDb、官方数据库)提取结构化列表或表格数据时, 因逐行搜索或迭代提取导致的搜索死循环和效率低下问题。 核心策略:定位聚合页 -> 批量提取 -> 本地过滤,一次完成。 扩展策略:对于跨实体的宽泛查询,采用实体分解 -> 并行提取 -> 结果聚合的策略。
第一步必须尝试寻找包含完整数据的"聚合页面"(如 Wikipedia 的"List of..."页面)。 严禁直接遍历实体列表进行单独搜索。
永远不要直接搜索"完整列表"。搜索引擎很难返回完美的列表页面,但很容易返回实体主页。 搜索目标应是"人/团体名 + 权威来源",到达页面后再定位列表章节。
绝对禁止逐个点击链接或逐行提取证据。必须将整个数据源视为一个整体对象。 一旦定位到包含列表的页面,使用代码(Python/Pandas)批量解析。
如果时间范围由历史事件隐式定义,必须先将事件解析为具体年份, 再进行列表提取和过滤。未解析边界前,禁止大规模列表提取。
当目标会议/事件尚未正式发布完整列表时,优先搜索:
当查询包含"同一年份 + 多项赛事/活动"时,按(赛事, 年份)原子对拆分为并行子任务; 每个子任务独立搜索对应赛事的获奖公告或新闻页,再统一由 auto_extraction 收割奖项段落。
当查询范围过宽(如"国内所有电车"),导致单一权威页面不存在时,必须先识别关键子实体(如主要品牌),将任务分解为多个并行的子查询。严禁试图寻找一个包含所有数据的"超级列表页",应采用"分而治之"策略,按品牌/类别分发并行任务。
当查询涉及特定历史时间窗口内的产品发布(如"2022-2025年发布的车型")时,严禁仅依赖当前的"产品列表"或"在售车型"页面。当前列表通常只展示在售款,缺失已停产或迭代款。 必须优先搜索"Timeline"(时间线)、"History"(历史)或"Model Year"(年款)页面,或按年份拆分查询(如"Models released in 2023"),以确保覆盖该时间窗口内的所有历史条目。
查询模板:
{Entity Name} filmography/discography site:wikipedia.orgList of {Entity} members site:wikipedia.orgList of {attribute} of {entity_type}{entity_type} comparison table {attribute}{Institution} {Conference} {Year} papers site:aclanthology.org{Conference} {Year} accepted papers site:{lab_homepage_domain} OR site:arxiv.org{Institution} {Year} {Competition Name} award site:edu.cn{Brand/Category} {Product Type} list {Year} (用于并行子任务){Brand} {Product} history timeline site:wikipedia.org{Brand} models released in {Year}打开搜索结果中最权威的页面后:
find() 定位表格行,或用 Python 解析原 HTML在本地环境中处理数据: