| name | zh-proofreading |
| description | Use when proofreading Chinese articles for typos, grammar issues, and CJK-Latin formatting problems. Triggered by requests like "校对", "查错别字", "语病扫描", "typo检查", "帮我检查下文章". Also use when user pastes Chinese text and asks to "看看有没有问题". |
中文校对扫描
逐段扫描中文文章的错别字、语病、标点和中英混排问题,输出分级修复清单。
核心原则
- 只标真错误:口语化是风格选择,不是语病。不要把「你就把 Agent 想象成一辆车」标为语病。
- 分级输出:严重错误(影响专业度)先报,格式问题后报,可选优化最后。
- 引原文定位:每个问题必须引用原文片段 + 章节位置,不要只说「某处有错」。
扫描 SOP
三阶段流程:初扫(并行)→ 二次核查 → 汇总。
digraph proofreading {
rankdir=LR;
"读取全文" -> "Agent A: 硬伤扫描";
"读取全文" -> "Agent B: 格式扫描";
"Agent A: 硬伤扫描" -> "汇总初扫结果";
"Agent B: 格式扫描" -> "汇总初扫结果";
"汇总初扫结果" -> "Agent C: 二次核查";
"Agent C: 二次核查" -> "输出终审修复清单";
}
Agent A:硬伤扫描(错别字 + 语病)
逐段检查以下 6 类问题:
| 类别 | 典型症状 | 示例 |
|---|
| 错别字 | 同音替换、多字、漏字 | 不侃 → 不堪;做不多 → 做不到 |
| 英文拼写 | 核心术语拼错 | engeniering → engineering |
| 的/得/地混用 | 修饰动词用「的」 | 有效的执行 → 有效地执行 |
| 语序混乱 | 成分重复、嵌套失控 | 让它能认认真真让它找着 → 重复「让它」 |
| 成分残缺/多余 | 多字少字导致句子不通 | 这一版提针对 → 多一个「提」 |
| 前后矛盾 | 同段内数字/说法冲突 | 前说「三个方向」后说「两招」 |
Agent A Prompt 模板:
你是中文校对编辑。逐段扫描文章,找出错别字、英文拼写错误、的/得/地混用、语序混乱、成分残缺/多余、前后矛盾。
重要:这是一篇 [文章类型] 文章,语言风格偏 [口语化/书面化]。不要把刻意的口语化表达当语病。只标真正的错误。
对每个问题输出:位置(章节+段落)、原文片段、问题类型、修正建议。
Agent B:格式扫描(标点 + 中英混排)
| 类别 | 规则 | 示例 |
|---|
| 中英文间距 | 中文与英文/数字之间加空格 | Harness第一层 → Harness 第一层 |
| 英文大小写 | 同一术语全文统一 | agent vs Agent 需统一 |
| 中英标点混用 | 中文语境用中文标点 | 英文括号 () 出现在中文句子中 |
| 引号规范 | 全文统一用「」或 "" | 不要两种混用 |
| 中文标点后空格 | 中文标点后不加空格 | ,Anthropic 而非 , Anthropic |
| 括号内空格 | 「」()内侧不加空格 | 「Harness」 而非 「 Harness」 |
Agent B Prompt 模板:
你是排版编辑。扫描文章的中英混排格式问题。
检查项:中英文间距、英文大小写一致性、中英标点混用、引号规范统一、中文标点后不要多余空格、括号内侧不要空格。
对每处问题输出:位置、原文片段、修正建议。如果某类问题全文大量出现(>10处),只列出代表性的 5 处,然后注明「全文约 N 处,建议统一处理」。
Agent C:二次核查(误报过滤 + 漏报补扫)
Agent A 和 B 的初扫结果汇总后,交给 Agent C 做二次送检。Agent C 是一个独立的、未参与初扫的审查员,它的职责是:
1. 逐条复审每个 P0/P1 问题(误报过滤)
对初扫报告中的每一条 P0 和 P1,Agent C 必须:
- 回到原文,读取问题句的前后 3 句完整上下文
- 判断:这到底是真错误,还是刻意的风格选择?
- 给出裁定:确认 / 降级(P0→P1 或 P1→P3)/ 撤销(误报)
- 如果撤销,必须说明理由(如:「这是文章自定义的比喻用法」)
2. 针对初扫的高频错误类型做漏报补扫
如果初扫发现了 3 处以上的「的/得/地混用」,Agent C 要专门对全文做一次该类型的定向扫描,检查是否有遗漏。同理适用于其他高频错误类型。
3. 交叉验证数字和事实
初扫中标记的「前后矛盾」类问题,Agent C 需要回到原文验证:矛盾是真的存在,还是作者在不同语境下用了不同的说法(合理的)?
Agent C Prompt 模板:
你是独立审查员,负责对校对初扫结果做二次核查。你没有参与初扫,立场中立。
你拿到的是 Agent A 和 Agent B 的初扫报告(附后)。请逐条复审:
1. 对每条 P0/P1,回到原文读前后 3 句上下文,判断是真错误还是风格选择
2. 给出裁定:确认 / 降级 / 撤销(撤销需说明理由)
3. 如果初扫中某类错误出现 3 次以上,对全文做该类型的补充扫描
4. 对「前后矛盾」类问题,验证是真矛盾还是合理的语境差异
重要:你的职责是过滤误报和补捞漏报,不是重复初扫的工作。只关注初扫已标记的问题和高频错误类型的遗漏。
输出格式:
- 每条问题的裁定(确认/降级/撤销 + 理由)
- 补扫发现的新问题(如有)
- 最终修复清单(合并初扫确认项 + 补扫新增项)
为什么需要二次核查:
| 初扫常见问题 | 二次核查如何解决 |
|---|
| 把口语化当语病(误报) | 读上下文后判断是风格还是错误 |
| 同类错误只抓到部分(漏报) | 高频类型定向补扫 |
| 前后矛盾判断不准 | 回到原文验证语境 |
| P0/P1 分级不当 | 独立审查员重新评估严重性 |
输出格式:分级修复清单
P0:严重错误(影响专业度,必修)
核心术语拼错、明显错别字、影响语义的语病。这些如果发出去,读者会直接质疑作者水平。
P1:一般错误(建议修)
的/得/地混用、成分多余/残缺、前后矛盾、指代不清。
P2:格式问题(全文统一处理)
中英混排空格、大小写不一致、标点规范。这类通常可以用脚本批量修复。
P3:可选优化(不改也行)
拗口但不算错的表达、风格层面的微调。
批量修复脚本模板
对 P2 格式问题,建议用 Python 脚本批量处理而非逐个手改:
import re
with open(filepath, 'r', encoding='utf-8') as f:
text = f.read()
text = re.sub(r'([\u4e00-\u9fff])([A-Za-z0-9])', r'\1 \2', text)
text = re.sub(r'([A-Za-z0-9])([\u4e00-\u9fff])', r'\1 \2', text)
text = re.sub(r'([,。、;:!?」)》】]) ', r'\1', text)
text = re.sub(r'([「『(《【]) ', r'\1', text)
text = re.sub(r' ([」』)》】])', r'\1', text)
text = re.sub(r' +', ' ', text)
with open(filepath, 'w', encoding='utf-8') as f:
f.write(text)
注意:脚本执行后必须人工抽检,常见误伤包括:
- URL 中被插入空格
- Markdown 语法(
**加粗**、*斜体*)被打断
- 代码块内内容被改动
常见误判(不要标为错误)
| 表达 | 为什么不是错 |
|---|
| 「你就把 X 想象成 Y」 | 口语化叙事风格 |
| 句子以「但」「所以」开头 | 中文非正式写作允许 |
| 「干活儿」「跑起来」 | 口语化用词,非错别字 |
| 「金鱼」指代模型 | 文章自定义的比喻,非错误 |
| 英文术语不翻译 | 技术文章惯例 |
修复后复查
修复完成后,必须再跑一轮验证:
- 原报告中的每个 P0/P1 问题逐项确认已修复
- 检查脚本批量修复是否引入新问题(URL、Markdown 语法、代码块)
- 抽读 3-5 段,确认行文流畅度未被破坏