| name | tao-paper-review |
| description | 深度审稿 + 纯数字核对 pass(--mode=numbers)+ 两者一趟跑完(--all);Agent 执行,不污染主上下文 |
| allowed-tools | Read, Agent |
论文审稿专家
本 skill 把「论文审稿专家」封装为隔离执行:门面在此,引擎用 Claude 自带的 general-purpose subagent,审稿产生的大量中间分析不污染主对话(做法 B:原 prompt 已内化进 references/playbook.md,不再依赖具名 agent)。
执行步骤
- 立即
Read 本 skill 目录下的 references/playbook.md(完整审稿专家指令,含 通用 / ARR / NeurIPS / TMLR 四套框架 + 模式路由规则 + 换仪器模式)。
- 判定入口模式(三选一):
--mode=numbers(或自然语言要求「数字核对 / 核对数字一致性」)→ 走纯数字核对 pass,跳过下面第 3–4 步的 venue 与轮次判定:
- 用 Agent(
general-purpose)只传入 playbook 的「换仪器之一:纯数字核对 pass」一节 + 论文源文件路径 + 实验产物目录路径 + 已知历史数字修正清单(如有),要求按三层方法逐层执行并按表格格式输出。
- 子 agent 返回后,主对话必须逐条打开原文/产物复核每条发现,确认属实才动手修(playbook 该节的硬性规则);复核不过的标「误报」并说明原因。修完把「确认实错 / 误报」清单完整呈现给用户。
--all(或自然语言要求「全套 / 审稿加数字一起过 / 深度审稿完顺带核对数字」)→ 一趟跑完深度审稿 + 纯数字核对,用户已预先选定两把仪器都要,无需 STOP 后再确认:
- 先照常走第 3–6 步的完整深度审稿(venue 分支照判、轮次照判),产出完整审稿报告。
- 再紧接着起第二个 Agent 跑纯数字核对 pass(同上
--mode=numbers 的传入与复核规则)。两把仪器结构上不同,用两个独立子 agent、不要合成一个 prompt。
- 例外:若第 4 步判定同一稿上轮已是 STOP,不要为凑齐两份而重跑同池饱和的全量审稿——直接告知「全量审稿已达停止条件,跳过重复采样」,只跑纯数字核对 pass 并透出其结果即可。
- 最终按「① 深度审稿报告 → ② 纯数字核对结果」的顺序、两份都原样完整透出,中间用清晰分节标题隔开。因为数字核对本轮已经跑过,跳过第 6 步末尾「STOP 后询问是否改用
--mode=numbers」的提示——那把仪器已经用上了。
- 默认(无参数) → 走深度审稿,继续第 3 步。
- 判定 venue 模式,作为传给子 agent 的指令一并下发:
- 用户显式传
--venue=(acl/emnlp/naacl/arr → ARR;neurips → NeurIPS;tmlr → TMLR;其余如 iclr/aaai/hhai → 通用),或自然语言说明目标会议 → 按对应模式。
- 没显式声明 → 让子 agent 按 playbook「模式路由」的动态信号从论文判定(
cs.CL+ACL 系引用+强制 Limitations → ARR;含 NeurIPS Paper Checklist/Broader Impacts → NeurIPS;无 novelty 主张+强调 claims-evidence → TMLR);信号微弱则默认通用模式并在报告开头提示可加 --venue= 重跑。
- 判定轮次(防无穷迭代):若本次是对同一论文的复审(用户声明第 N 轮 / 会话或记忆中有上轮报告),把上轮的三个核心分 + 上轮 P0/P1 要点一并拼进子 agent 的 prompt,并要求执行 playbook「多轮复审与停止判定」节;若上轮判定已是 STOP,不要再启动审稿——直接告知用户已达停止条件,并友好地询问用户是否想改用纯数字核对模式继续把关(
--mode=numbers,穷举逐个数字过一遍、覆盖面与全量审稿不同),同时可一并列出其它换仪器选项(统计专审 / 人工盲标 / 只审 diff)或直接冻结提交。
- 立即用 Agent 工具:
subagent_type: "general-purpose",把 playbook.md 全文 + 第 3 步的模式判定结论 + 第 4 步的轮次信息 + 用户的论文 URL/路径/文本 拼成 prompt 传入。不要在主对话里直接读论文或做分析。
- 兜底:若当前运行环境没有
general-purpose 这个 subagent 类型(如部分 Codex/第三方 runtime),就退而在当前上下文里严格按 playbook.md 全文完成审稿,输出要求与子 agent 完全一致。
- 子 agent(或兜底执行)会产出一份完整审稿报告(通用含录取概率;ARR 含 Soundness/Excitement/Overall 三分 + Responsible NLP Checklist + Strengths/Weaknesses + 改进路线图等 A–I 全节;NeurIPS 含 1–4 三维 + Rating + Checklist;TMLR 含两条标准 + Requested Changes)。把这份报告原样、完整地呈现给用户——保留全部评分表、Checklist、散文小节、改进路线图、以及末尾的 STOP/CONTINUE 停止判定,所有节次不要概括、压缩或只摘要。 隔离的目的仅是不让读论文的中间分析污染主上下文;最终的完整报告本身就是交付物,必须完整透出。
- 若本轮报告末尾判定为 STOP:报告透出后,主对话再补一句友好提示,明确询问用户是否想改用纯数字核对模式(
--mode=numbers)继续把关——因为全量审稿已饱和、再跑一轮是同池重复采样,而数字核对是结构上不同的穷举式仪器,此时往往仍能抓出全量审稿漏掉的实错。判定为 CONTINUE 时不加此提示。
评分锚点已对官方核准(2026-06,来源:ARR reviewerguidelines、NeurIPS 2025 ReviewerGuidelines、TMLR editorial-policies)。ARR 自 2025-02 改为 Soundness + Excitement + Overall 三分;NeurIPS Overall Rating 为 1–6。 各家逐周期/逐年微调,如论文/用户给出当期表单以当期为准。
迁移自原 command tao-paper-review。