| name | Review |
| description | Multi-agent review with dual-mode detection for code and paper changes |
| phase | review |
Review Skill
Overview
Multi-agent review that auto-detects what changed and spawns the appropriate review fleet. Code changes get code reviewers. Paper changes get research reviewers. Both get both.
Input
- Changed files since last review (from git diff or bead notes)
- Epic context:
bd show <epic> for acceptance criteria and verification contract
- Previous review commit hash (if any) for accurate diff range
Methodology
Step 1: Detect Review Mode
- Run
git diff --name-only HEAD~N (or compare against last review commit) to identify changed files
- Classify changes:
- Code changes:
*.py, *.sh, src/**, tests/**, *.toml, *.cfg
- Paper changes:
*.tex, *.bib, paper/**
- Both: files from both categories changed
- Select review mode:
- Code only -> spawn Code Review Fleet
- Paper only -> spawn Paper Review Fleet
- Both -> spawn both fleets in parallel
Step 2: Code Review Fleet (when code files changed)
Spawn these reviewers in parallel via AgentTeam:
security-reviewer (.claude/skills/drl/agents/security-reviewer/SKILL.md) -- P0-P3 security audit
simplicity-reviewer (.claude/skills/drl/agents/simplicity-reviewer/SKILL.md) -- complexity check
test-coverage-reviewer (.claude/skills/drl/agents/test-coverage-reviewer/SKILL.md) -- test adequacy
performance-reviewer (.claude/skills/drl/agents/performance-reviewer/SKILL.md) -- efficiency check
runtime-verifier (.claude/skills/drl/agents/runtime-verifier/SKILL.md) -- pipeline runs end-to-end (uv run python -m pytest)
Step 3: Paper Review Fleet (when paper files changed)
Spawn these reviewers in parallel via AgentTeam:
methodology-reviewer (.claude/agents/drl/methodology-reviewer.md) -- statistical validity
coherence-reviewer (.claude/agents/drl/coherence-reviewer.md) -- logical consistency
writing-quality-reviewer (.claude/agents/drl/writing-quality-reviewer.md) -- prose quality
citation-checker (.claude/agents/drl/citation-checker.md) -- citation accuracy
reproducibility-verifier (.claude/agents/drl/reproducibility-verifier.md) -- reproducibility
argumentation-reviewer (.claude/agents/drl/argumentation-reviewer.md) -- argument coherence
statistical-methods-reviewer (.claude/agents/drl/statistical-methods-reviewer.md) -- method audit
theoretical-framing-reviewer (.claude/agents/drl/theoretical-framing-reviewer.md) -- theory-question fit
contribution-clarity-reviewer (.claude/agents/drl/contribution-clarity-reviewer.md) -- novelty assessment
robustness-checker (.claude/agents/drl/robustness-checker.md) -- robustness assessment of statistical results
Step 4: Collect and Classify Findings
- Aggregate findings from all active fleet(s)
- Deduplicate overlapping findings across reviewers
- Classify by severity:
- Critical: blocks progress, invalidates results or introduces security risk
- Major: must address before proceeding, weakens conclusions or correctness
- Minor: optional, cosmetic or stylistic improvements
- Present findings to user grouped by fleet and severity
- Create beads issues for Critical and Major findings:
bd create --title="Review: ..." --priority=1
Step 5: Resolution
- Critical and Major findings MUST be resolved before proceeding
- Create beads tasks for deferred Minor findings
- Re-run affected reviewers after fixes to verify resolution
Gate Criteria (Gate 4)
| Criterion | Verification |
|---|
| No Critical findings remain | bd list --status=open shows no P0 review issues |
| No Major findings remain | bd list --status=open shows no P1 review issues |
| All reviewer outputs collected | Every spawned reviewer returned findings |
| Findings classified by severity | Each finding tagged Critical, Major, or Minor |
| Human confirmation | AskUserQuestion approval received |
Handoff Checklist
| Output | Location | Format |
|---|
| Review findings summary | Beads epic notes | Severity-classified list |
| Deferred issues | Beads tasks | Minor findings as tasks |
Memory Integration
drl search before starting review
drl learn after discovering review patterns
Failure and Recovery
- If a reviewer agent fails: report which reviewer failed, re-spawn it once, if still failing skip and note in findings
- If too many findings: prioritize Critical > Major, present in batches
- If partially interrupted mid-review: check which reviewers reported, re-spawn only the missing ones
- If a Critical finding cannot be resolved: log to
docs/decisions/ using ADR template, escalate via AskUserQuestion
Common Pitfalls
- Running only one fleet when both code and paper changed
- Not re-running reviewers after fixes
- Proceeding with unresolved Critical findings
- Ignoring paper reviewers for "small" paper changes
- Running reviewers sequentially instead of in parallel
- Not creating beads issues for deferred Minor findings
- Treating all findings as equal severity
Quality Criteria