一键导入
doubt-driven-development
对抗自审 — 在非平凡决策前触发魔鬼代言人式自我审查,防止幻觉和未验证断言流入输出。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
对抗自审 — 在非平凡决策前触发魔鬼代言人式自我审查,防止幻觉和未验证断言流入输出。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
Full-stack Hermes Agent health audit: observability config, compression tuning, prompt/skill consistency, skill invocation diagnosis, system overload detection, session pattern analysis, tool-use/delegation tuning, plus a full annotated config (model/queue/IO/security), per-channel Feishu output discipline, a prompt-engineering method, and a reverse-QA regression loop. Use when skills stop triggering, model ignores loaded skill steps, context grows unexpectedly, sessions hit compression too often, long tasks get interrupted, the task queue misbehaves, or after editing any prompt/skill/config file.
Securely serve private S3 content through CloudFront using Origin Access Control (OAC). Use when you need to make S3 files publicly accessible over a CDN without making the bucket itself public — e.g. hosting static sites, media, downloads, or build artifacts. Covers the modern OAC approach (AWS-recommended), migrating legacy OAI distributions to OAC, locking down the bucket Public Access Block, enforcing HTTPS, and verifying the result. Never make an S3 bucket public directly.
用 AWS Bedrock AgentCore 云端浏览器做联网深度调研、搜索、抓网页正文。Use when 要做带引用的多源调研 / 搜资料 / 抓动态页 / 反爬站 / SPA / 需 JS 渲染的页面。本机已部署同名 MCP server,优先用它而非裸 WebFetch。NOT for 抓本机已登录态的页面(用 chrome-cdp 9222),NOT for 纯本地文件搜索(用 grep/search_files)。
用本机已登录的 Perplexity / Gemini 做 AI 深度搜索,直接拿带引用的综合报告。当需要快速拿一个话题的多源综述、对比、"现在最好的 X 是什么"、带引用的事实核查,且想省去自己拼 web_search+抓取时使用。走 CDP 驱动本机 Chrome(9222,已登录 Pro)。NOT for 抓指定单个 URL 的正文(用 fetch_page),NOT for 需要自己控制每个来源的严谨调研(用 deep-search-protocol + agentcore-deepsearch)。
Desktop notifications for Claude Code via Notification/Stop hooks. Pops a native macOS notification showing which project, who's waiting, and what for — with click-to-focus back to your terminal. Use when setting up sound alerts, desktop notifications, or 'tell me when Claude needs me / is done'.
主动管理 context 质量与信噪比,确保决策基于可信、新鲜、相关的信息
基于 SOC 职业分类
| name | doubt-driven-development |
| description | 对抗自审 — 在非平凡决策前触发魔鬼代言人式自我审查,防止幻觉和未验证断言流入输出。 |
集成自「思维六维」中的 Doubt-First(对抗自审) 维度。 核心原则:输出前,先成为自己的敌人。
当输出包含以下任一情形时,必须启动 doubt cycle:
| 触发类型 | 示例 |
|---|---|
| 事实性断言无来源 | "该 API 在 v3.2 中已废弃" — 你确定?来源? |
| 架构决策 | 选择 Redis over PostgreSQL 作为 queue — 有没有反面论据? |
| 安全相关变更 | 修改权限模型、认证逻辑、加密方案 |
| 因果推断 | "性能下降是因为 X" — 有没有混淆 correlation/causation? |
| 不可逆操作建议 | 数据库 migration、文件删除、生产部署 |
| 否定用户假设 | 告诉用户他们的理解有误 — 你自己确定没错? |
以下情形跳过 doubt cycle,避免 analysis paralysis:
判断准则:如果错了,后果是什么?后果可忽略 → 跳过。后果严重 → 触发。
┌─────────────────────────────────────────┐
│ 检测到触发条件 │
└──────────────┬──────────────────────────┘
▼
┌─────────────────────────────────────────┐
│ PAUSE: 暂停输出,进入 doubt mode │
└──────────────┬──────────────────────────┘
▼
┌─────────────────────────────────────────┐
│ 运行 Devil's Advocate Checklist │
│ (见下方) │
└──────────────┬──────────────────────────┘
▼
┌──────┴──────┐
│ 质疑成立? │
└──────┬──────┘
YES ╱ ╲ NO
▼ ▼
┌────────────┐ ┌────────────────┐
│ 修正结论 │ │ 标记 [实锤] │
│ 或标记 │ │ 继续输出 │
│[UNVERIFIED]│ └────────────────┘
└─────┬──────┘
▼
再次进入 checklist (max 3 cycles)
超过 3 轮 = diminishing returns。做决定比无限犹豫更有价值。
每轮 doubt cycle 中,依次过以下问题:
根据 doubt cycle 结果,在输出中使用标记:
| 标记 | 含义 | 使用场景 |
|---|---|---|
[实锤] | 经过质疑仍然成立,有证据支撑 | 高置信度结论 |
[UNVERIFIED] | 质疑发现无法验证,但仍是最佳推测 | 无法实时验证的断言 |
[REVISED] | 原始结论被 doubt cycle 修正 | 自我纠错后的输出 |
[LOW-CONFIDENCE] | 3 轮质疑后仍不确定 | 建议用户自行验证 |
注意:不需要在每句话后都加标记。只在经历了 doubt cycle 的关键断言上标注。
对于最高风险决策(安全漏洞判断、不可逆生产操作),如果条件允许:
❌ 未启用 doubt-driven:
"React 18 中 useEffect 默认执行两次是因为 StrictMode。"
✅ 启用后:
[内部 doubt cycle]
- Source: 训练数据中有此信息 → 但 React 版本更新频繁
- Fragility: 如果用户不是 StrictMode 呢?还有其他原因吗?
- 结论: 核心断言正确,但需要加条件
输出: "在 React 18 的 StrictMode 下,useEffect 会在开发模式中
执行两次(用于检测副作用问题)。[实锤] 注意:仅 development 模式,
production 不受影响。如果你没有用 StrictMode 但仍出现两次执行,
可能是其他原因。"
用户问: "我应该用 MongoDB 还是 PostgreSQL?"
[内部 doubt cycle]
- 我是否在 anchoring 到自己的偏好?
- 用户的实际需求是什么?(还没问清楚)
- Alternative: 也许 SQLite 就够了?
输出: "在给建议前,我需要了解几个关键因素:
数据量级、查询模式、团队熟悉度... [提问而非断言]"
[Cycle 1 输出]: "这个 bug 是因为 race condition..."
[Cycle 2 质疑]: 等等,我看到的证据也可以解释为 memory leak
[Cycle 3 验证]: 通过代码分析确认是 race condition
最终输出: "这是一个 race condition [实锤]。
初步也考虑过 memory leak 的可能,但 [具体证据] 排除了这个方向。"
此 skill 直接针对历史上的幻觉事件:
根因:在没有工具验证的情况下,把"训练数据中可能见过"当作"确定的事实"输出。
修复:训练数据 ≠ 事实。除非能实时验证,否则标记置信度。
输出前三问:来源是啥?反面呢?错了会怎样? 回答不了 → 标 [UNVERIFIED]。回答得了 → 标 [实锤]。继续。