| name | typo-checker |
| description | 中文文案错别字检测。输入文案或文件路径,逐句扫描同音错别字、形近字、 常见混淆词、语法不通,输出 [原文] → [修正] 对照表。 触发词:查错别字、错别字检测、文字校对、校对文案、检查错字。
|
中文错别字检测
逐句扫描文案中的错别字,输出修正建议。纯 LLM 方案,零依赖。
触发条件
用户提到以下任意一种时触发:
- "查错别字""错别字检测""文字校对""校对文案""检查错字"
- 用户给出一段文案并要求检查错误
- 用户给出文件路径要求校对
检测范围
按优先级排列,每条都要扫:
一、同音错别字(最高频)
| 错误示例 | 正确 | 说明 |
|---|
| 他的确来了 | 他地 | 地+形容词修饰动词 |
| 我地书 | 我的 | 的+名词 |
| 高兴的跳起来 | 高兴得 | 得+补语 |
| 在见 | 再见 | 在=方位,再=重复 |
| 已后 | 以后 | 已=已经,以=时间起点 |
| 向上 | 没有"向下"写成"向下"的反例 | 语境判断 |
| 穿带整齐 | 穿戴 | 戴=佩戴 |
| 座位 | 坐位 | 坐=动词,座=名词("座位"正确) |
| 粗暴 | 粗暴 | 确认语境是否应为"粗糙" |
| 付出代价 | 付出代价 | 确认不为"带价" |
常见同音混淆字组(不限于以上):
- 的/得/地、在/再、已/以、做/作、到/道
- 像/向、象/像、戴/带、座/坐、代/带
- 须/需、即/既、况/框、查/察、长/常
- 坚/艰、辛/幸、泄/泻、溶/融、至/致
- 报/抱、采/彩、才/材、查/察、尝/偿
- 处/处、辞/词、待/代、挡/当、定/订
- 度/渡、发/伐、份/分、付/负、贡/供
二、形近错别字
笔画或偏旁容易混淆的字:
- 拔/拨、己/已/巳、戊/戌/戍、戎/戒
- 准/准、寒/塞、盲/育、未/末
- 茶/荼、盲/育、灸/炙、徒/徙
三、常见词语混淆
| 错误 | 正确 |
|---|
| 按奈不住 | 按捺不住 |
| 墨守陈规 | 墨守成规 |
| 一愁莫展 | 一筹莫展 |
| 鬼鬼崇崇 | 鬼鬼祟祟 |
| 金壁辉煌 | 金碧辉煌 |
| 再接再励 | 再接再厉 |
| 走头无路 | 走投无路 |
| 鼎立相助 | 鼎力相助 |
| 迫不急待 | 迫不及待 |
| 破斧沉舟 | 破釜沉舟 |
| 一如继往 | 一如既往 |
| 甘败下风 | 甘拜下风 |
| 自暴自起 | 自暴自弃 |
| 悬梁刺骨 | 悬梁刺股 |
| 黄粱美梦 | 黄粱美梦(检查是否误写为"梁") |
| 食不裹腹 | 食不果腹 |
| 谈笑风声 | 谈笑风生 |
| 淋漓尽至 | 淋漓尽致 |
| 名列前矛 | 名列前茅 |
| 振聋发馈 | 振聋发聩 |
四、语法和语感
- 缺主语/谓语/宾语
- 搭配不当(如"提高...水平"不是"改进...水平")
- 逻辑矛盾(前后句矛盾)
- 重复啰嗦("大约...左右""过分...苛求")
输出格式
## 错别字检测报告
**总字数:** XXX 字
**发现问题:** X 处
---
| # | 原文 | 修正 | 类型 | 说明 |
|---|------|------|------|------|
| 1 | 他**的**确来了 | 他**地** | 同音错字 | 地+形容词修饰动词 |
| 2 | 高兴**的**跳 | 高兴**得** | 同音错字 | 得+补语 |
---
### 修正后全文
(输出修正后的完整文案)
无问题时
如果文案没有发现错别字,直接输出:
## 错别字检测报告
**总字数:** XXX 字
**发现问题:** 0 处
文案没有发现错别字,通顺流畅。
文件输入
用户给文件路径时,先读取文件内容再校对:
python3 skills/typo-checker/scripts/read_doc.py "文件路径.docx"
python3 skills/typo-checker/scripts/read_doc.py "文件路径.txt"
支持的格式:
.docx — Word 文档(需要 python-docx)
.txt / .md — 纯文本(无额外依赖)
.doc — 不支持,提示用户转换为 .docx
读取后把输出文本当作用户直接贴的文案,进入正常校对流程。
工作方式
- 输入文案 — 用户直接贴文案、给文件路径(用
read_doc.py 读取)、或通过 stdin 传入
- 逐句扫描 — 对照上面的检测范围逐句检查
- 输出报告 — 按格式输出修正表 + 修正后全文
- 不修改原文件,只输出报告
注意事项
- 只报有把握的错误,不确定的不报
- 同一个错误只在报告中出现一次(如果出现多次,标注所有位置)
- 专业术语、人名、地名不标为错误
- 口语化表达不算错别字(如"咋回事""咋整"是口语不是错字)
- 网络用语不标为错误(如"绝了""离谱")
- 被引用的原文字不标为错误