ワンクリックで
list-table-extraction
从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等)
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等)
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
搜索学术论文(Semantic Scholar + DBLP + arXiv 三源并行),返回标题、作者、摘要、引用数、链接
从 api.crossref.org 抽取学术文献:标题、链接、DOI、摘要片段及引用数
从 api.openalex.org 抽取学术作品:标题、URL、出版年份、DOI、类型
搜索微信公众号文章并提取全文(通过 Sogou 微信搜索),返回标题、真实 URL、发布时间、正文内容
搜索近期新闻文章(NewsAPI + Google News RSS 双源回退),返回标题、来源、日期、摘要
抽取 hn_story:title、url、author、points、created_at
SOC 職業分類に基づく
| name | list_table_extraction |
| description | 从权威页面批量提取结构化列表数据(作品列表、成员名单、事件列表等) |
| trigger | 需要从单页或少量页面提取多行结构化数据 |
| success_rate | 0 |
| status | seed |
| trigger_conditions | {"domain":["general"],"entity_types":["entity"],"attribute_types":["list","table","enumeration"]} |
| cost_hint | mid |
| effectiveness_score | 0 |
解决从权威页面(如 Wikipedia、IMDb、官方数据库)提取结构化列表或表格数据时, 因逐行搜索或迭代提取导致的搜索死循环和效率低下问题。 核心策略:定位聚合页 -> 批量提取 -> 本地过滤,一次完成。 扩展策略:对于跨实体的宽泛查询,采用实体分解 -> 并行提取 -> 结果聚合的策略。
第一步必须尝试寻找包含完整数据的"聚合页面"(如 Wikipedia 的"List of..."页面)。 严禁直接遍历实体列表进行单独搜索。
永远不要直接搜索"完整列表"。搜索引擎很难返回完美的列表页面,但很容易返回实体主页。 搜索目标应是"人/团体名 + 权威来源",到达页面后再定位列表章节。
绝对禁止逐个点击链接或逐行提取证据。必须将整个数据源视为一个整体对象。 一旦定位到包含列表的页面,使用代码(Python/Pandas)批量解析。
如果时间范围由历史事件隐式定义,必须先将事件解析为具体年份, 再进行列表提取和过滤。未解析边界前,禁止大规模列表提取。
当目标会议/事件尚未正式发布完整列表时,优先搜索:
当查询包含"同一年份 + 多项赛事/活动"时,按(赛事, 年份)原子对拆分为并行子任务; 每个子任务独立搜索对应赛事的获奖公告或新闻页,再统一由 auto_extraction 收割奖项段落。
当查询范围过宽(如"国内所有电车"),导致单一权威页面不存在时,必须先识别关键子实体(如主要品牌),将任务分解为多个并行的子查询。严禁试图寻找一个包含所有数据的"超级列表页",应采用"分而治之"策略,按品牌/类别分发并行任务。
当查询涉及特定历史时间窗口内的产品发布(如"2022-2025年发布的车型")时,严禁仅依赖当前的"产品列表"或"在售车型"页面。当前列表通常只展示在售款,缺失已停产或迭代款。 必须优先搜索"Timeline"(时间线)、"History"(历史)或"Model Year"(年款)页面,或按年份拆分查询(如"Models released in 2023"),以确保覆盖该时间窗口内的所有历史条目。
查询模板:
{Entity Name} filmography/discography site:wikipedia.orgList of {Entity} members site:wikipedia.orgList of {attribute} of {entity_type}{entity_type} comparison table {attribute}{Institution} {Conference} {Year} papers site:aclanthology.org{Conference} {Year} accepted papers site:{lab_homepage_domain} OR site:arxiv.org{Institution} {Year} {Competition Name} award site:edu.cn{Brand/Category} {Product Type} list {Year} (用于并行子任务){Brand} {Product} history timeline site:wikipedia.org{Brand} models released in {Year}打开搜索结果中最权威的页面后:
find() 定位表格行,或用 Python 解析原 HTML在本地环境中处理数据: