원클릭으로
auto-harness-santa
执行 Santa Method 双独立对抗验证。Use when reviewing high-risk changes, production deployments, or complex logic before shipping.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
执行 Santa Method 双独立对抗验证。Use when reviewing high-risk changes, production deployments, or complex logic before shipping.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
为当前项目初始化完整的 Harness Engineering 配置(Rules、Hooks、Constraints、QA 标准)。Use when bootstrapping a new project or adding harness to an existing project.
执行 5 层 QA 金字塔检查,生成量化验证报告。Use when completing a feature, before committing, or before creating a PR.
执行交付前 5 项复盘检查,确保流程合规和质量达标。Use when about to deliver work to users, before final handoff, or when completing a development cycle.
启动 Harness 任务(交互式收集需求,自动带上全部流程约束)。Use when starting a new feature, task, or any development work in a Harness-enabled project.
在 AI 工具内执行受控自动修复 loop。Use when tests, E2E, quality gate, or verification fails and the user expects the agent to fix and rerun instead of only reporting failure.
为缺少测试的已有项目渐进式补充多层自动化测试覆盖。Use when project has low or no test coverage and needs automated test generation.
| name | auto-harness-santa |
| description | 执行 Santa Method 双独立对抗验证。Use when reviewing high-risk changes, production deployments, or complex logic before shipping. |
双独立 Reviewer 对抗验证——两个 Agent 独立审查,都通过才放行。
收集待审查的材料:
并行启动两个独立 Reviewer Agent:
Reviewer A(Claude Agent):
你是独立的质量审查者。你没有看过其他任何审查意见。
## 待审查内容
{代码变更}
## 审查标准
{Rubric}
## 指令
逐项对照标准检查。对每一项:
- PASS: 完全满足,无问题
- FAIL: 发现具体问题(引用具体位置)
输出 JSON:
{
"verdict": "PASS" | "FAIL",
"checks": [{"criterion": "...", "result": "PASS|FAIL", "detail": "..."}],
"critical_issues": ["..."],
"suggestions": ["..."]
}
严格检查。你的工作是发现问题。
Reviewer B(可选用 Codex /codex:adversarial-review,或另一个 Claude Agent):
同样的 Rubric,同样的代码变更,独立上下文。
关键不变量:
Reviewer A: PASS AND Reviewer B: PASS → NICE → 放行
其他情况 → NAUGHTY → Phase 4
一个发现问题就算 NAUGHTY。
收集两个 Reviewer 的所有 issues
↓
派 Fix Agent 修复(只修 flagged issues,不做额外重构)
↓
重新启动两个全新 Reviewer Agent 审查修复后的代码
↓
最多 3 轮。超过 3 轮 → 升级给人工处理。
关键: 每轮修复后用全新 Agent 重审,防止锚定偏差。
| 检查项 | PASS 条件 | FAIL 信号 |
|---|---|---|
| 功能正确性 | 所有 spec 需求被覆盖 | 遗漏需求项 |
| 无幻觉 | 无虚构的 API/函数/URL | 引用不存在的东西 |
| 安全性 | 无硬编码密钥,输入有验证 | 发现敏感信息 |
| 一致性 | 无自相矛盾 | A 处说 X,B 处说 non-X |
| 技术正确性 | 代码可编译运行,逻辑正确 | 语法错误、逻辑 bug |
| 错误处理 | 异常路径有处理 | 缺少 error handling |
根据项目补充领域特定的检查项。
Reviewer A 用 Claude,Reviewer B 用 Codex(/codex:adversarial-review)。不同模型有不同盲区,交叉审查进一步降低逃逸率。
只要任务涉及代码变更,AI 不能等用户提醒才验证。按下面顺序做:
AI 可以调用 shk quality status --format json、shk e2e plan --format json、shk e2e run --format json、shk loop state --format json 作为测试准出后端检查器,但不要把这些命令丢给用户自己记。