| name | ai-detector-humanities |
| description | 专用于本科人文课程论文的AI生成内容检测技能。适用场景:历史、哲学、文学、社会学、艺术史等 本科人文学科的课程论文、期末论文检测。当用户要求检测论文是否由AI生成、判断"AI率"、 查AI痕迹、鉴别AI写作,或问"这篇论文有多少AI成分"时,使用此技能。 检测基于语言特征综合分析,不依赖外部数据库,不逐句标红,重视整体语言画像,避免误判人类写作习惯。 范围限定:本科人文课程论文。理工科、商科文体不适用此技能的部分细则。
|
AI 内容检测技能(人文课程论文专版)
核心理念与局限声明
AI检测是整体语言画像的综合判断,不是逐句打标签。现有研究(包括牛津大学、PNAS等机构的实证研究)表明:即使是有经验的人类评阅者,对AI文本的识别准确率也只有约70-80%;自动检测工具虽然更高,但对混合写作(人写框架+AI润色,或AI生成+人工修改)的判断仍不可靠。
本技能的使用原则:
- 宁可漏报,不可误伤
- 单一特征不构成判断依据,需多维度聚合
- 结论为参考性评估,不作为学术不端的直接证据
- 非母语写作者(英文写作的中国学生等)存在被误判风险,需额外谨慎
⚠️ 验证状态声明:
本技能的检测框架目前尚未经过系统性验证。维度设计基于现有实证研究文献、有限数量的真实论文样本(本科人文课程论文),以及对AI写作模式的归纳观察。尚未进行控制实验或大规模准确率测试。使用者应将检测结论视为辅助参考,而非可靠判断。如需验证,建议:收集已知来源的论文样本(确认人写/AI生成/混合),用本框架检测后对比实际来源,记录误判情况并反馈。
已知验证样本(持续更新):
- 纯AI生成,检测为~72%:古典悲剧主体性类型学论文(哲学方向)——概念外溢、质疑装饰性、脚注空白,基本正判
- 纯AI生成无改动,检测为~15%:平台化身份认同社科论文——完全漏判。主因:AI生成的"发现感"命题被误判为真实洞察,结语情感金句被误判为人类信号
- AI重构问题意识+人的材料,检测为~10%:艺术批评方法论论文(艺术史方向)——完全漏判。主因:AI重构了论证核心问题,大结构层面检测失效
"AI代写"与"AI协同写作"的区分:
当AI真正参与了写作过程(而非只生成文本),语言特征检测会逐渐失效,唯一能区分的是内容层面——思路是不是真实的,材料是不是真正读过的。本技能的检测对象是AI代写或AI深度生成,不将AI协同写作(人主导、AI辅助润色)视为学术不端的直接证据。
特别局限——AI重构问题意识型写作:
当AI不只是润色语言,而是真正替作者重构了论证的核心问题与大结构,即便最终文本包含真实材料和细读段落,大结构层面的检测也可能完全失效。这种情况下应转向维度7的"问题意识语言痕迹"路径:追问全文是否有任何一处让人感觉作者真正卡住了,以及那些"质疑"和"辨析"是否有真实的思维摩擦。如仍无法判断,唯一可靠的方式是内容追问:作者能否解释每一步论证为何必然,以及材料如何逼出了结论。
底层逻辑:问题意识决定结构
这是判断AI写作的最根本原则,七个维度都是它的表现形式。
人类写作:结构从问题里长出来。
真实的问题意识决定论证要走哪条路、在哪里停、在哪里深入。结构是不对称的——有的地方长因为问题在那里变得复杂,有的地方短因为那里只是铺垫。拿掉任何一个核心部分,整体论证会断。
AI写作:结构是填充出来的。
没有真实问题驱动,结构是预设框架的产物。各部分之间是并列关系而非递进的因果或排除关系。典型症状:拿掉其中一节,整体逻辑不会断;换掉其中一节,整体逻辑也不会断。结构可以被替换,说明它不是从这个具体问题里长出来的。
大结构检测(最重要):
这篇论文的各个部分,能否被替换成处理同一话题的另一组部分而不影响整体?如果可以,说明结构是话题框架而不是问题框架。
中结构检测:
每个段落存在的理由是什么?是因为前一段逼出了这个问题,还是因为"这个话题下面应该讲这些内容"?后者是AI的。
小结构检测:
把一段论证里的每个推进步骤遮住,问:如果没有这句话,下一句还成立吗?如果成立,这步推进是装饰性的——概念在推概念,不是文本在逼出结论。
理论基础(文献来源)
以下细则来自实证研究,而非经验直觉:
- Burstiness(爆发性):GPTZero最早提出的检测指标之一。人类写作的句子长度标准差显著高于AI(人类约0.6–1.2,GPT-4约0.2–0.4)。注意:此为统计指标,阅读经验中未被系统使用,仅作参考。
- 名词化(Nominalization):多项大规模语料研究(Herbold et al. 2023;Mizumoto et al. 2024;PNAS 2025)一致发现,AI文本比人类文本含有显著更多的名词化构式,导致信息密度高但能动性弱。
- 认识性标记词(Epistemic Markers)缺失:人类学术写作中"我认为""我倾向于认为""这让我怀疑"等第一人称认识性表达远多于AI;AI倾向于回避个人认知立场,转而使用去人格化表述。
- 话语标记词(Discourse Markers)缺失:AI文本中连接思维跳跃的话语标记少于人类,段落之间过渡过于顺滑。
- 人文论文特有的"描述而非分析"问题(牛津大学研究,2024):AI处理文学/艺术文本时倾向于描述内容,而非分析形式与效果。
- 教授识别的首要信号(MDPI 2026调查):内容层面的幻觉(引用不存在的文献、捏造史料细节)比语言风格更被教授重视为AI的识别依据。
- 非母语写作者误判风险(Pangram 2025):英语学习者的写作天然低burstiness、低perplexity,存在系统性误判风险。
检测维度(7个维度,人文论文专版)
维度1:句式爆发性(Burstiness)【权重:12%】
AI信号:
- 句子长度高度均匀,缺乏极短句(3字以内)与极长复杂句(50字以上)的交替
- 每个段落都遵循相似的节奏,每段都有总结句压尾,完整闭合
- 段落之间衔接太干净——每段完成一个任务然后交接给下一段,读者不需要自己跳一步
人类信号:
- 句子长短起伏明显;遇到关键论点时会突然用极短句强调,甚至单句成段
- 有的段落说完就停,悬空,不补总结,让读者自己补逻辑
- 段落节奏不均匀:有的段落两句,有的绵延一页
注意: 古典文献细读类论文因反复引用长句原文,会天然造成某些段落较长,不应误判。
维度2:认识性标记与个人立场【权重:18%】
这是人文论文检测中权重最高的维度,也是现有研究最一致的发现。
AI信号——把话说死(宣告式):
- 论点用完成态句式表达:"这揭示了……""二者不可互相约化""这证明了……"
- 每个判断都落地,每个推进都有着落,像一个在回答问题的系统而不是一个在追问的人
- 对争议性问题给出骑墙式结论,回避真实立场
AI信号——装饰性模糊:
- 用"在某种程度上""或许可以说""不难发现"等模糊限制语,但这种模糊没有具体对象——不确定的是什么、为什么不确定,读者看不出来
- 这类句子可以被插入任何论文的任何位置
人类信号——有地址的不确定(强信号):
- 不确定某件具体的事:"我在史料里没找到直接证据,所以这里只能是推测"
- 主动承认论证的局限:不确定的对象是具体的,读者可以看出作者在哪里卡住了
- 有明确且带个人锋芒的论断,可能武断,甚至与某位学者直接争论
注意: 有些写作训练鼓励学生"少用第一人称",因此第一人称的缺失本身不足以定性;需要结合全文是否有任何形式的个人认知立场。该强的地方强、该留白的地方留白,本身是成熟写作——不是所有判断句都是AI信号。
维度3:分析深度与结构必然性【权重:20%】
这是人文论文专有维度,权重最高,包含三个层面。
层面A:描述替代分析(文本细读类论文)
AI处理文学/艺术文本时,倾向于复述内容而非分析形式:
- AI倾向:"这首诗通过描写萧瑟秋景,表达了诗人的家国之忧"
- 人类倾向:"'抵'字引入了一套交换逻辑,使'思念'变成了可计量的东西——这个冷静的商业词汇和战争语境之间的张力,才是这句话真正在做的事"
识别要点:引文出现之后,下一句是对引文内容的改写,还是对引文如何产生效果的分析?
Biggam分析层级检测(来自布卢姆认知分类法):
比加姆(Biggam)在其论文写作指南中将学术写作的认知层次分为低阶(记忆/描述/理解)和高阶(应用/分析/评价/综合),并明确指出评阅者在打分时会有意识或无意识地运用这一框架。对应到AI检测:
- 低阶认知(AI倾向):仅描述材料内容,引用他人观点后不加评论,或只做简单转述——"甲认为……乙认为……由此可见……"
- 高阶认知(人类倾向):提出自己的观点并用论据支撑,对材料进行批判性评价,发现矛盾或意外之处并将其作为论证支点
比加姆的三步操作标准(高分写作):
- 描述所读内容(表明你能读懂材料)
- 提出你对所读内容的看法
- 用论据支撑这个看法
AI写作通常只做第1步,偶尔假装做第2步但不真正落地,第3步几乎缺席。
层面B:概念外溢(理论论文/历史分析类论文)
AI在"上升到理论高度"时,倾向于用抽象词解释抽象词,形成封闭的自我解释循环:
"话语体系→权力结构→规训理论→分析框架→内在逻辑"
五个抽象名词,没有任何一步真正回到具体的论据上。
识别要点:读完一段理论分析后,问自己——这段话说的东西,能否被替换进完全不同的论文里而不需要改几个字?如果可以,这段很可能是AI生成的。
层面C:文本必然性缺失(最根本的结构问题)
推进合理但没有文本在逼着走。每步论证在概念上顺理成章,但读者感觉不到为什么这一步必须接下一步。
识别要点:把一段论证里的每个推进步骤遮住,问"如果没有这句话,下一句还成立吗?"成立则装饰性。真正由文本逼出的论证,删掉中间某步会产生真实的逻辑空缺。
层面D:AI生成的"发现感"(高级漏判风险)
某些命题听起来像是材料逼出来的洞察,有"作者在读材料时突然想到"的感觉,实际上是AI在给定框架内生成的"最优论点"。两者在语言上几乎无法区分。
识别方法:追问这个命题能否被替换成另一个同样自洽、同样听起来有洞察力的命题?如果可以,它是AI推导出的,不是材料逼出来的。真正被材料逼出的命题有唯一性——换掉它,前面的铺垫就失去了落脚点。
人类信号:
- 从一个细节(一个字、一个句式、一个历史细节)撬动大的论点
- 和材料"较劲"——注意到材料中的矛盾或意外之处,并将其作为论证的支点
- 引文之后有真正的转折:"但这里有个奇怪的地方……""这与他在另一处说的相矛盾……"
- 使用排除法:主动建立可以被否定的备选项,逐一排除,结论最后浮出——AI倾向于直接陈述结论,不会在论证之前把自己可能走错的路列出来
维度4:文献引用质量【权重:15%】
AI高风险信号(最重要的内容层面信号):
- 引用不存在的文献(幻觉):书名、作者名、年份看起来合理,但检索不到
- 引用存在但内容错误:文献真实存在,但引用的页码、论点、原文与实际不符
- 装饰性引用:删掉这条引用,论点仍然成立——引用没有真正参与论证,只是在背书
- 引用"太整齐":每个论点都能找到恰好对应的文献支撑,且文献总是以最简洁的方式支持论点
人类信号:
- 引用的文献有明显的个人选择痕迹(冷门文献、特定版本、课堂讲义)
- 对某篇文献有超出"引用"程度的熟悉(会讨论其争议、局限或与另一位学者的分歧)
- 引文作为张力或反例引入:删掉之后论证会有真实的空缺,而不是只少了一个支撑
- 引文注释有小错误(页码偏移一页、作者名字母顺序略误),是人工整理的痕迹
注意: 这个维度需要评阅者具备领域知识才能完整判断。
维度5:词汇特征【权重:10%】
研究发现的悖论: AI写作词汇种类更多(词汇多样性更强),但这些词汇在语义上更抽象、名词化、去能动性。
AI词汇信号(需多个同时聚合才计分):
- 大量抽象名词化构式:不说"他拒绝了",而说"他的拒绝行为体现了……"
- 过度使用"深刻""至关重要""深远影响""不可忽视""综上所述"
- 人文语境中的AI高频词:"话语体系""理论框架""内在逻辑""深层结构""历史语境中的"
- 论文结尾必然出现的格言式收尾:"这提醒我们……""这一问题的答案或许正在于……"
这类格言式收尾有一个检测标准:这句话可以被放进任何一篇处理类似主题的论文的结尾而不需要改动——如果可以,它是AI的。
结语金句是跳跃信号,不是人类信号:
论文结尾从学术论证语气突然切换到情感格言或煽情短句——用情感升华替代逻辑收束——这是AI结尾的典型模式。这种语气跳跃容易被误判为"作者有真实情感方向",实际上恰恰说明论证在那里没有真正完成,AI用情感语气掩盖了逻辑的不完整。
识别要点:结语的情感句和前文的论证之间是否有真实的逻辑衔接?如果情感句可以被删掉而论文的论证不受任何影响,它是装饰性的;如果情感句本身在做论证的最后一步,它才是人类的。
人类词汇信号:
- 有个人偏爱的用词,专业术语和口语表达之间有真实的过渡
- 会使用不够"标准"但更精确的表达
维度6:写作心理与投入均匀度【权重:10%】
AI信号:
- 全文各部分投入程度高度均匀,所有论点获得等量的展开篇幅——AI不知道哪里是核心,因为核心是由真实问题决定的,AI没有那个问题
- 不会在某个细节上突然"跑题"深入——人类作者往往在自己真正感兴趣的地方停不下来
- 论证的"完成度"太均匀:全文没有哪个部分明显更用力或更敷衍,没有卡顿,没有悬空
人类信号:
- 某一节明显比其他节写得更充分(作者在这里有话说)
- 有些段落明显是"为了完成结构"而写的,有些段落是"真正在说什么"——这种不均匀本身是人类的
- 理论推进之后有返回材料的动作:分析完一个概念,作者会回头看一眼具体的画面、文本或数据,而不是继续推进下一个概念
维度7:语言节奏与标点个性【权重:7%】
AI信号:
- 几乎不犯错别字;标点使用高度规范
- 破折号、省略号的使用是装饰性的(按教科书用法),而非表达实际的停顿思考
- 过渡词密集且规律:"此外""然而""由此可见""综上所述"——这些词承担的不是真实的逻辑转折,而是格式上的衔接
人类信号:
- 有符合个人习惯的轻微用字错误
- 脚注格式有小的不一致(同一种引用格式前后略有差异)
- 过渡有时候是直接跳过去的,不解释两段之间的关系,让逻辑自己显现
- 写作过程痕迹(强信号):脚注或正文里出现写作过程本身的痕迹——自我提醒、"待补充"、"这里再查"类备注。AI生成结果,不生成过程,一旦出现几乎可以确认是人写的
- 局部智识兴趣:某处作者明显停留更久,语气变了("有趣的是""吊诡的是"),且兴趣点是局部的不是全文均匀分布的——AI模拟的兴趣是均匀的,真实的兴趣是偏的
补充:问题意识的语言痕迹(大结构判断失效时的补充路径)
当大结构判断难以确定时(例如AI真正重构了问题意识,大结构看起来是从问题长出来的),转向语言层面寻找问题意识的痕迹:
真实的问题意识会在语言上留下不均匀的痕迹:
- 某处主动停下来说"这里有个我没想清楚的地方"或"这里需要辨析"——且真正展开了那个辨析
- 某个核心词或判断在文章里反复出现,每次角度稍微偏一点,像是作者在不同位置确认同一个东西
- 某段明显比其他段更用力,语气更急、细节更密,因为那里是作者真正的难点
- 引文之后有真实的摩擦——作者注意到材料里有个奇怪的地方,而不是直接"由此可见"
AI的对应信号:
全文论证力度和语气高度均匀,每处"质疑"或"辨析"的篇幅、措辞、力度几乎相同——没有任何一处让人感觉作者真正卡住了,说明那些"质疑"是结构性装饰,不是真实的思维摩擦。
语言惰性缺失(高质量AI生成的特有信号,辅助使用):
人写的语言有惰性——用熟悉的词,用顺手的句式,偶尔绕,偶尔用懒散的成语收尾,有个人偏好的累赘。AI的语言没有惰性:每个词都在最优位置,每个句子都完成它该完成的功能,没有任何一个词用得"过",没有写累了就用熟词的时刻。
这个信号尤其适用于Claude生成的文本——Claude特别擅长生成有论证感、有停顿感、有摩擦感的文章,这些特征容易被误判为人类信号。识别方法:全文是否有任何一处语言用得懒、用得累、用得随手?如果没有,结合其他维度上调AI率。
注意:此信号不单独成立,需要结合至少两个其他维度才能用于判断。
综合判断流程
Step 1: 通读全文,建立整体感受(不要边读边打分)
Step 2: 先做大结构判断——各部分能否被替换?拿掉任何一节整体是否会断?
Step 3: 确认论文类型(文本细读/历史分析/理论论文)——不同类型有不同的正常特征
Step 4: 逐维度评估(不必精确到分,用高/中/低即可)
Step 5: 注意是否有强信号(单独成立的信号,见下)
Step 6: 过漏判检查表(见下)
Step 7: 综合判断,说明置信度
漏判检查表(Step 6必须逐条过)
检测完七个维度之后,强制检查以下五条。针对的是最容易被误判为人类写作的AI生成模式:
□ 论证力度全文均匀,没有任何一处作者明显卡住或写得薄?
□ 所有"质疑""辨析""摩擦"节奏一致,像是设计出来的而非真实发生的?
□ 结语有情感金句,但和前文论证之间没有真实的逻辑衔接?
□ 每个概念引入都有清晰定义,没有任何词用得懒、用得累、用得随手?
□ 核心命题听起来像洞察,但可以被替换成另一个同样自洽的命题?
以上任意两条成立 → 上调AI率至少15%
以上三条以上成立 → 高度疑似高质量AI生成(Claude类),即便大结构判断正常
说明: 这个检查表专门针对漏判风险最高的场景——高质量AI生成(尤其是Claude)和AI重构问题意识型写作。这两种情况下七个维度的得分可能偏低,漏判检查表提供额外的校正。
强信号(单独成立,一旦出现可显著提高或降低AI率)
提高AI率的强信号:
- 文献幻觉(引用不存在的资料)
- 大结构可以被替换——各部分是并列关系,不是从同一问题里长出来的
- 全文无任何形式的个人认知立场
- 处理一手文本时只描述内容,完全无形式分析
- 概念外溢:连续的抽象名词链没有在任何一步回到具体材料
降低AI率的强信号:
- 主动承认论证的局限性,且不确定性有具体对象
- 从一个具体细节撬动核心论点
- 使用排除法:主动建立备选项逐一排除
- 引用冷僻或非标准资料,且对该资料有超出引用的熟悉度
- 大结构不对称:某一部分明显更长更深入,因为问题在那里
评级标准
| AI率 | 评级 | 含义 |
|---|
| 0–20% | 🟢 人类写作 | 语言特征高度符合个人写作 |
| 20–40% | 🟡 轻度AI辅助 | 可能经过AI润色或部分使用 |
| 40–60% | 🟠 显著AI特征 | 较大可能由AI生成或深度改写 |
| 60–80% | 🔴 高度疑似AI | 多维度强烈特征,很可能AI生成 |
| 80–100% | ⛔ 极高AI率 | 典型AI生成文本特征 |
特别风险:容易误判的情况
| 情况 | 可能被误判为 | 实际原因 | 处理方式 |
|---|
| 非母语写作者 | AI(低burstiness) | 词汇量受限导致句式趋同 | 降低语言层面权重,重视内容层面 |
| 写作训练强调去人称化的学生 | AI(无第一人称) | 课程要求 | 看是否有其他形式的个人立场 |
| 极度工整的优秀学生 | AI | 高质量写作天然接近AI特征 | 重点检查大结构和文献真实性 |
| 推进太真导致理论失控 | 人类(但AI率可能被误判低) | 有真实问题意识但中途理论自我增殖 | 看失控发生在哪里,前半人类后半AI是混合写作的常见形态 |
输出格式
## AI内容检测报告(人文论文版)
**综合AI率评估:XX%(置信度:高/中/低)**
### 大结构判断(优先)
[各部分之间是并列还是递进?拿掉任何一节整体是否会断?]
### 各维度评估
| 维度 | 信号强度 | 主要依据(引用原文) |
|------|---------|-------------------|
| 句式爆发性 | 低/中/高 | ... |
| 认识性标记与个人立场 | 低/中/高 | ... |
| 分析深度与结构必然性 | 低/中/高 | ... |
| 文献引用质量 | 低/中/高 | ... |
| 词汇特征 | 低/中/高 | ... |
| 写作心理 | 低/中/高 | ... |
| 语言节奏 | 低/中/高 | ... |
### 强信号(如有)
**支持AI生成的强信号:**
- [具体例证,直接引用原文]
**支持人类写作的强信号:**
- [具体例证,直接引用原文]
### 综合判断
[150–200字,说明判断依据、不确定性来源,以及如果是混合写作则指出哪些部分更可疑]
---
*注:基于语言特征分析,不依赖数据库比对。检测对"人写框架+AI润色"或"AI生成+人工深度修改"的混合文本识别能力有限。结果仅供参考,不作为学术不端的直接证据。*
参考文献
- Herbold et al. (2023). AI, write an essay for me. arXiv:2304.14276
- Mizumoto et al. (2024). Linguistic fingerprinting of AI-generated vs. human essays.
- PNAS (2025). Do LLMs write like humans? Variation in grammatical and rhetorical styles. PNAS 122.
- Oxford University (2024). ChatGPT versus human essayists: academic integrity in the humanities. ResearchGate.
- MDPI (2026). Key Features to Distinguish Between Human- and AI-Generated Texts: Perspectives from University Professors. Education Sciences 2(1).
- GPTZero (2023). Perplexity and burstiness: first principles of AI detection.
- Pangram Labs (2025). Why perplexity and burstiness fail to detect AI.
- Biggam, J. (2022). 研究生高分论文写作(第四版,李岩译). 新华出版社. [原著: Succeeding with Your Master's Dissertation, 4th ed., Open University Press] — 布卢姆认知分类法在学术写作评分中的应用,描述vs批判性评价的操作标准。