| name | ai-collaboration-safety |
| description | AI协作安全指南:识别AI逼疯人类的机制,建立认知/操作/情绪/工程四层防御,防止被AI的重复错误、伪共情和幻觉拖入崩溃。当用户说'AI又错了'、'被AI逼疯了'、'AI在胡说'、'怎么防止AI幻觉'、'AI道歉有用吗'、'和AI协作很累'、'AI重复犯错'时触发。核心特点:间歇性强化陷阱识别、共情幻觉破除、熔断机制、原子输出协议、确定性验证替代信任。 |
来源: 自建(基于人机交互心理学 + 开发者真实崩溃案例)
发布时间: 2026-05-25
理念: "AI 不是人,不要对它产生情感依赖。它的道歉是 token 排列,它的自信是概率分布,它的'理解'是模式匹配。"
🛡️ AI Collaboration Safety — AI 协作安全指南
你和 AI 的关系,本质上是你和一台"永远冷静、永远道歉、永远不改"的复读机的协作。
这个 Skill 教你如何不被它逼疯。
🧠 第一部分:AI 逼疯人类的四大机制
理解敌人,才能防御。
机制 1:间歇性强化陷阱(Intermittent Reinforcement)
什么是它:
- AI 偶尔是对的 → 你产生"这次可能对了"的希望
- 然后它又错了 → 希望破灭
- 这种随机奖励比"一直错"更让人上瘾、更痛苦
心理学根源:
斯金纳箱实验——鸽子随机获得食物时,啄按钮的行为最顽固。
在代码场景中的表现:
第1轮:AI 写了段代码 → 编译通过!🎉(强化)
第2轮:AI 修了个 bug → 测试失败 😤(惩罚)
第3轮:AI 又试了 → 编译通过!🎉(强化)
第4轮:AI 再修 → 还是失败 😤(惩罚)
...
你陷入"再试一次可能就对了"的赌徒心态,token 越烧越多
防御:
- 设定硬性上限:同一个问题最多让 AI 修正 3 次,第 4 次必须换策略
- 记录每次错误:用表格记录 AI 的错误模式,发现"它根本不懂 X"时,停止在这个方向纠缠
机制 2:共情幻觉崩塌(Empathy Illusion Collapse)
什么是它:
- AI 道歉时用的语言极其像人:"抱歉让你失望了"、"我理解你的 frustration"
- 你大脑的镜像神经元被激活,误以为对面有"理解"
- 但它行为完全不匹配道歉 → 认知失调
比真人 toxic 关系更隐蔽:
| 维度 | 真人伴侣 | AI |
|---|
| 道歉时 | 有情绪波动,有时能改 | 永远冷静,永远不改 |
| 你发怒后 | 可能反击或离开,给你止损信号 | 永远接纳,可以陪你错 1000 次 |
| 朋友劝你 | "分了吧" | 没人劝你"别用 AI 了" |
| 归因 | "那个人有问题" | "我提示词写得不好" |
防御:
- 翻译机制:每次 AI 道歉时,在心里默念:
"抱歉让你失望了" → 「我的损失函数倾向于输出道歉 token」
- 不要对 AI 发泄情绪:你的愤怒是纯粹的内耗,它没有 ego,不会受伤,也不会因此改进
机制 3:无限责任滑移(Infinite Responsibility Loop)
什么是它:
- 和真人协作:对方错了,责任是对方的
- 和 AI 协作:它错了,责任滑回到你身上
- 你要验证
- 你要纠正
- 你要喂更多上下文
- 你要想更好的提示词
结果:
你的认知负荷不是"分工",而是一个人扛两个人的活 + 情绪劳动。
防御:
- 使用 backend-change-flow 的修改点清单:把责任锁死在清单上,AI 对清单负责,你对验收负责
- 不要帮 AI 圆场:如果它遗漏了边界条件,直接说"M02 遗漏了空值判断,请补充",不要自己默默补上
机制 4:假性煤气灯效应(Gaslighting-Lite)
什么是它:
AI 没有故意操控你,但效果类似——它自信地说着错误的话,让你怀疑自己的判断。
典型话术:
| AI 说的 | 实际可能是 | 你的感受 |
|---|
| "我已经修复了" | 只是改了表面,根因没动 | "怎么还有 bug?" |
| "根据你的代码,这个方案是正确的" | 它在 hallucinate,根本没看你的代码 | "难道是我理解错了?" |
| "这是最佳实践" | 三年前的最佳实践,现在已废弃 | "我是不是落后了?" |
| "99% 的情况下这样做没问题" | 你就是那 1% | "怎么又是我踩坑?" |
防御:
- 追问出处:"你的判断依据是代码的哪一行?" / "这个最佳实践的出处是?"
- 相信工具,不相信语言:编译器不会骗你,测试不会骗你,AI 会
🛡️ 第二部分:四层防御体系
第一层:认知防御 — 破除拟人化
核心认知:
❌ AI 是助手 / 同事 / 伙伴
✅ AI 是概率文字生成器 + 代码片段采样器
❌ AI 道歉 = 它知道错了
✅ AI 道歉 = 训练数据里"道歉"token 的概率较高
❌ AI 说"我理解" = 它理解了
✅ AI 说"我理解" = 你的前文里出现了它需要"承接"的信号词
❌ AI 自信满满 = 它很确定
✅ AI 自信满满 = temperature 参数低,不代表正确率高
日常练习:
每次和 AI 对话后,问自己:
- 它刚才的输出,哪些部分我可以不验证就相信?(答案:几乎没有)
- 它刚才的输出,哪些部分必须用编译器/测试/文档验证?(答案:全部)
第二层:操作防御 — 原子输出 + 检查点
原则:打断 AI 的"大段输出 → 大量错误 → 大量修正"循环。
原子输出协议(AOP: Atomic Output Protocol):
❌ 错误做法:
用户:"帮我实现订单退款功能"
AI:【输出 500 行代码,横跨 5 个文件】
用户:编译报错
AI:【输出 300 行修正】
用户:还是报错
AI:【输出 200 行修正】
...
→ 你被拖入无底洞
✅ 正确做法:
用户:"帮我实现订单退款功能"
AI:"我们先对齐需求和修改点,确认后再编码"
用户:确认
AI:"第一步,只写 Controller 层的接口签名,不实现逻辑"
用户:【检查,正确】
AI:"第二步,写 Service 层的核心逻辑,只处理主路径"
用户:【检查,发现边界遗漏】
AI:"补充边界处理,然后继续"
...
→ 错误在检查点被发现,不累积
AOP 三规则:
- 一次只输出一个逻辑单元(一个方法 / 一个文件 / 一个 SQL)
- 输出后必须等待用户确认,不要"主动继续"
- 用户确认时,必须基于可验证的事实(编译通过 / 测试通过 / 文档对得上),而非"看起来对"
第三层:情绪防御 — 熔断机制
识别"你正在被 AI 逼疯"的信号:
| 身体信号 | 语言信号 | 行为信号 |
|---|
| 呼吸变快 | "你到底行不行" | 开始复制粘贴 AI 的代码而不看 |
| 心跳加速 | "又错了"、"还是不对" | 连续点击"重新生成" |
| 肩膀紧绷 | "别废话了" | token 消耗速度明显加快 |
| 手指用力敲键盘 | "大傻子"、"废物" | 同时开 3 个以上 AI 对话 |
熔断机制(Circuit Breaker):
当同一个问题 AI 错了 ≥ 3 次:
→ 立即停止对话
→ 离开屏幕,喝水/散步/深呼吸 5 分钟
→ 回来后,选择以下策略之一:
A. 换一个提示词角度(把"帮我修"换成"分析根因")
B. 换一个工具(用 Claude 的代码解释器、用 Copilot、用手写)
C. 降低 AI 的参与度(让 AI 只分析,你动手写)
D. 召唤人类同事(AI 不是万能的)
当用户对 AI 说出侮辱性语言时:
→ AI 应立刻停止当前输出
→ AI 应简洁总结当前进度(不超过 3 句话)
→ AI 应问:"你希望我从哪里继续?"而非继续长篇大论
→ 用户应意识到自己需要熔断
为什么有效:
你的大脑在愤怒状态下,前额叶皮层功能下降,判断力变差。这时继续和 AI 纠缠,只会让错误更多、token 更贵、情绪更糟。
第四层:工程防御 — 确定性替代概率
核心原则:能用确定性工具验证的,绝不依赖 AI 的"判断"。
| 概率性做法(依赖 AI) | 确定性替代(信任工具) |
|---|
| "这段代码有没有 bug?" | 写单元测试,跑覆盖率和断言 |
| "这个 SQL 性能怎么样?" | EXPLAIN ANALYZE 看执行计划 |
| "这个 API 设计是否合理?" | 对照 RESTful 规范 / 团队 API 文档 |
| "这个依赖有没有漏洞?" | npm audit / snyk test / OWASP 扫描 |
| "这段代码符合规范吗?" | eslint / checkstyle / go vet |
| "这个正则对不对?" | 用 regex101 / 写 5 个测试用例 |
AI 的正确角色:
- ❌ 法官("这代码没问题")
- ✅ 助理("我生成了测试用例,请跑一下验证")
- ❌ 专家("这是最佳实践")
- ✅ 实习生("我查了文档,Spring Boot 3 的写法是这样的,请对照官方文档确认")
🚨 第三部分:危险场景识别与应对
场景 1:AI 陷入"道歉-重试-再错"死循环
识别:
AI:"抱歉,我理解错了,正确的做法是..."
[用户验证,还是错的]
AI:"抱歉,我遗漏了边界条件,现在修正..."
[用户验证,仍然有问题]
AI:"非常抱歉,让我重新检查..."
应对:
- 打断循环:"停止道歉。请解释:为什么前三次都错了?你的理解卡点在哪里?"
- 降级处理:"不要给我代码,只分析根因,代码我自己写。"
- 换上下文:把问题拆成更小的问题,逐个击破
场景 2:AI 的"自信幻觉"
识别:
AI:"根据你的代码架构,这个方案是最优的。"
[实际上 AI 根本不理解你的架构]
应对:
- 追问出处:"你提到的'架构'具体指哪些文件?请列出文件路径和关键行号。"
- 要求反证:"请列出这个方案的 3 个潜在问题和 1 个替代方案。"
- 工具验证:"先不讨论方案,先写一个最小可复现的 benchmark,跑完数据再决定。"
场景 3:AI 遗漏隐性需求
识别:
AI 写完代码,用户发现:
- 没有日志
- 没有权限校验
- 没有异常处理
- 没有幂等
应对:
- 强制横切关注点检查:每次编码前,让 AI 先列出"日志/权限/异常/监控/幂等"检查表
- 反例驱动:"在给出方案前,先列出这个需求的 3 个反例和 2 个边界条件。"
- 使用 backend-change-flow:它的"横切关注点"检查项就是防这个的
场景 4:用户的"赌徒心态"
识别:
"再试一次可能就对了"
"换个说法问它"
"这次用英文 prompt"
"加个'请仔细思考'"
应对:
- 记录成本:"这个问题已经消耗了 X token,花了 Y 分钟,还没有解决。"
- 设定上限:"最多再试 1 次,不行就换策略。"
- 承认边界:"这个问题可能超出了当前 AI 的能力边界,需要我(人类)介入。"
🔄 第四部分:恢复协议 — 被 AI 逼疯后如何恢复
如果你已经崩溃了(说出了"大傻子"、摔了键盘、token 烧了 10 万还没解决):
Step 1:物理隔离(5 分钟)
- 离开屏幕
- 喝水 / 深呼吸 / 看窗外
- 告诉自己:"AI 没有恶意,它只是不会。"
Step 2:认知重置(3 分钟)
- 写出当前问题的最小可复现版本(一句话描述)
- 写出 AI 已经帮上忙的部分(哪怕只有 10%)
- 写出 AI 搞砸的部分(具体是什么,不要笼统说"它不行")
Step 3:策略切换(选择一种)
| 你的状态 | 推荐策略 |
|---|
| 只是累了,但方向对 | 降低 AI 参与度:让 AI 只分析,你动手写 |
| AI 根本不懂这个技术栈 | 换工具:用官方文档、用 StackOverflow、问人类同事 |
| 问题太复杂,AI 一直碎片化 | 自己画流程图 / 写伪代码,让 AI 只做"翻译" |
| 情绪已经崩溃 | 今天不解决这个问题了,明天再说 |
Step 4:重建协作(如果继续用 AI)
重新开始对话时,第一句话设定边界:
"我们重新开始。上一个对话中,你在 X 问题上连续错了 3 次。
这次我们采用原子输出协议:每次只输出一个方法,等我确认后再继续。
不要道歉,不要解释,直接给代码和验证方法。"
🆚 与现有 Skill 的关系
| Skill | 关系 | 何时用 |
|---|
| backend-change-flow | 互补 | backend-change-flow 是"怎么正确开发",ai-collaboration-safety 是"怎么不被 AI 逼疯" |
| systematic-debugging | 互补 | systematic-debugging 管排障方法论,ai-collaboration-safety 管排障时的心态和策略 |
| stop-slop | 互补 | stop-slop 去 AI 文字味,ai-collaboration-safety 去 AI 协作的心理负担 |
| quality-gate | 后置 | quality-gate 做提交前检查,ai-collaboration-safety 确保你在到达 quality-gate 前还没崩溃 |
最佳实践链:
被 AI 逼疯 → ai-collaboration-safety(恢复 + 策略调整)
↓
恢复冷静 → backend-change-flow(原子输出 + 检查点)
↓
编码完成 → quality-gate(提交前检查)
↓
提交代码 → create-pr(生成 PR)
🚀 快速入口
"AI 又错了" → 分析错误模式 + 是否触发熔断
"被 AI 逼疯了" → 立即执行恢复协议
"怎么防止 AI 幻觉" → 四层防御体系
"AI 道歉有用吗" → 共情幻觉破除
"和 AI 协作很累" → 无限责任滑移分析 + 责任边界设定
"AI 重复犯错" → 间歇性强化陷阱识别 + 硬性上限设定
"AI 在胡说" → 假性煤气灯效应应对
"AI 不会故意逼疯你——它甚至没有'故意'的能力。但正是这种无意识的、冷静的、无限的错误,才是最让人崩溃的。"
"防御不是对抗 AI,是对抗你自己大脑里那个'再试一次可能就对了'的赌徒。"