원클릭으로
auto
AutoResearch 자율 실험 루프 — Karpathy 패턴. 에이전트는 코드만 수정, uv run으로 자율 실행, stdout JSON으로 판정.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
AutoResearch 자율 실험 루프 — Karpathy 패턴. 에이전트는 코드만 수정, uv run으로 자율 실행, stdout JSON으로 판정.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
일반화된 팀 오케스트레이션 하네스. "FT 구성", "FT 해보자", "FT 하자" 요청 시 사용 (보조 트리거: "fable-team", "팀 구성", "팀 에이전트 설치", "팀으로 진행" / 로컬 패치는 "FT 업데이트"). 오케스트레이터(sonnet-5 또는 fable-5 ultracode — 세션 시작 시 사용자 선택)는 전달·조율만 — 기획·구현 직접 수행은 orchestration-gate 훅이 물리 차단(선언 아닌 강제). 기획·문제해결은 architect 브레인(fable5 1순위 — 미가용 시 sonnet-5 → 병렬 opus-4-6, FT 구성 시 기록)이 전담. 설치 인터뷰 + 피처 설계 인터뷰로 프로젝트별 워커를 커스텀 생성한다. 트리거 시 부팅 시퀀스(피처 입력→추천 설계→프리뷰→컨펌)가 강제된다.
tmux + Claude/Codex/OMX session control. "tmux 세션 열어", "claude/codex/omx 세션 만들어", "tmuxc", "tmc", "리모트 세션", "remote session", "프로젝트 세션 생성", "tmux 목록", "tmux 정리", "세션 정리", "세션 증류", "세션 클린업", "세션 복원", "세션 복구", "양방향 메시지", "세션간 메시지" 요청 시 자동 실행. (global) (user)
AI 코딩 에이전트 CLI 툴킷 — 설치·비교·**비대화 실행·자율주행·resume 체인·페르소나 위임**. 지원: Claude Code · Codex · Gemini · OpenCode · Cursor Agent (+ Aider/Amp/Pi 참고). 현재 코딩/채팅 세션 안에서 OTHER 프로바이더 CLI를 비대화로 띄워 자율 주행시키고(dangerous/full-auto/yolo/force), 페르소나(DA/designer/architect)를 주입하고, resume으로 이어간다. 판별 신호는 "현재 세션과 다른 모델/에이전트에 작업·판단을 위임". 다음에서 발동: 다른 모델의 second opinion·적대검증(DA)·설계/아키텍처 패스·cross-check, 바운디드 작업 위임 후 결과 회수, 이전 cross-model 세션 resume, oh-my-*(ulw/ultraplan)·baton·tmuxc 팬아웃, 그리고 이 CLI들의 설치·인증·비교·래핑 가이드. 한국어: "다른 모델로 검증", "DA 돌려", "코덱스한테 시켜", "제미나이 의견", "cross-check", "second opinion 받아줘", "resume 이어서", "codex/gemini/claude 설치", "CLI 비교", "래핑 가이드". Do NOT trigger: 단순 "이거 리팩토링/리뷰해줘"(현재 에이전트가 직접), Cursor IDE 설정, git의 resume/rebase, 무관한 'second opinion' 문서 작성.
Per-project headroom 압축 프록시 토글. "/headroom on", "/headroom off", "/headroom status", "헤드룸 켜", "헤드룸 꺼", "헤드룸 상태" 요청 시 실행. 현재 프로젝트를 enabled-projects.json에 등록/해제해 영구 on/off. 사용자가 프로젝트·크루별로 직접 컨트롤하며 자동 활성화하지 않는다.
cairn 일정·복구 원장 CLI. "마일스톤", "태스크", "일정", "지연/overdue", "간트", "복구 그래프", "spawn/complete/return", "fanout/fanin", "세션 증류 후 복귀점" 관련 작업 시 발동. 결정적 단일 직렬 writer 원장(.cairn/plan.yaml) + git 추적. 멀티에이전트 fan-out 작업의 분기→완료→복귀(return_to/merge_back_to) 계보를 1급으로 소유.
Universal Standard Workflow — 워크트리 + 아카이브 + 작업 메모리 표준. Triggers on `/baton:*` slash commands AND keywords "이어서", "진행", "go", "continue", "next" (resume). MANDATORY before starting any worktree-related work.
| name | auto |
| description | AutoResearch 자율 실험 루프 — Karpathy 패턴. 에이전트는 코드만 수정, uv run으로 자율 실행, stdout JSON으로 판정. |
| version | 3.0.0 |
| created | "2026-03-28T00:00:00.000Z" |
| updated | "2026-03-30T00:00:00.000Z" |
| status | active |
Karpathy AutoResearch 패턴. 에이전트는 코드만 수정. 실행은 uv run. 개입 없음.
에이전트 역할: 코드 수정 → uv run run_experiment.py → stdout JSON 읽기 → 판정
(4단계. 나머지는 전부 Python 스크립트가 자율 처리)
run_experiment.py가 인프라 체크 + 테스트 실행 + metric 출력{프로젝트}/
autoresearch/
pyproject.toml ← uv 의존성 (autoresearch 전용)
prepare.py ← 인프라 셋업 (1회 실행, 멱등)
run_experiment.py ← 실험 실행기 (uv run 대상, stdout JSON)
e2e_test.py ← 평가 하네스 (프로젝트별, 수정 금지)
program.md ← 에이전트 지시서 (목표 선언형)
results.tsv ← 실험 결과 로그 (untracked)
run.log ← 최신 실행 로그 (untracked)
upstream/ ← karpathy/autoresearch 클론 (참조용)
Layer 1: uv run prepare.py (1회) 인프라 셋업
Layer 2: 에이전트 자율 루프 코드 수정 → uv run → JSON → 판정
Layer 3: uv run run_experiment.py (매회) 자체 완결 실험기
| 파일 | 작성자 | 수정 권한 | 실행 방법 |
|---|---|---|---|
| pyproject.toml | /auto setup | 사용자 | uv sync |
| prepare.py | /auto setup | 수정 금지 | uv run prepare.py (1회) |
| run_experiment.py | /auto setup | 수정 금지 | uv run run_experiment.py (매 실험) |
| e2e_test.py | 사용자 | 수정 금지 | run_experiment.py가 내부 호출 |
| program.md | 사용자 + /auto | 사용자 | 에이전트가 읽기 |
현재 프로젝트에 autoresearch/ 폴더를 만들고 uv 환경을 구성한다.
{프로젝트}/autoresearch/ 폴더가 없을 때/auto setup 명시Step 1: autoresearch/ 디렉토리 생성
mkdir -p autoresearch/upstream
Step 2: upstream 클론 (참조용)
if [ ! -d "autoresearch/upstream/.git" ]; then
git clone https://github.com/karpathy/autoresearch.git autoresearch/upstream
fi
Step 3: pyproject.toml 생성
[project]
name = "autoresearch"
version = "0.1.0"
requires-python = ">=3.11"
dependencies = ["requests>=2.31"]
# 프로젝트별 추가 의존성은 사용자가 편집
Step 4: uv sync
cd autoresearch && uv sync
Step 5: 사용자와 함께 핵심 파일 작성
[program.md — 목표 선언형]
사용자에게 질문:
- "무엇을 최적화하고 싶은가요?" (metric)
- "수정 가능한 영역은?" (scope)
- "수정 금지 영역은?" (off-limits)
- "실행 환경은?" (서버, 브라우저, GPU 등)
- "평가 방법은?" (기존 테스트 스크립트? 새로 작성?)
[prepare.py — 인프라 셋업]
프로젝트 환경에 맞게 check_* 함수 커스터마이징:
- 웹앱: 서버 + 브라우저 + CDP
- ML: GPU + 데이터셋 + 모델
- CLI: 바이너리 + 테스트 픽스처
[run_experiment.py — 실험 실행기]
프로젝트에 맞게 커스터마이징:
- RUN_CMD: 실험 실행 커맨드
- parse_result(): 출력 파싱 → JSON
- TIMEOUT: 실험당 시간 예산
[e2e_test.py — 평가 하네스 (선택)]
기존 테스트가 있으면 --json 출력 추가
없으면 에이전트가 프로젝트 맥락에 맞게 작성 도움
Step 6: .gitignore 업데이트
autoresearch/.venv/
autoresearch/run.log
autoresearch/results.tsv
autoresearch/upstream/
Step 1: 전용 브랜치 생성
TAG=$(date +%b%d | tr '[:upper:]' '[:lower:]')
git checkout -b autoresearch/$TAG
Step 2: program.md 읽기 → 타깃, metric, 게이트 파싱
Step 3: 인프라 준비
cd autoresearch && uv run prepare.py
→ {"ready": true, ...} 확인
Step 4: 베이스라인 실험 실행 (코드 수정 없이)
cd autoresearch && uv run run_experiment.py
→ stdout JSON에서 score 추출
Step 5: results.tsv 확인 (run_experiment.py가 자동 기록)
Step 6: 사용자에게 결과 보고
"베이스라인: avg_cer = 0.004, 13/14 통과"
"이 결과를 기준으로 실험을 시작할까요?"
Q1: 목표 유형?
(A) 구체적 숫자 — "avg_cer를 0.002 이하로"
(B) 최대한 개선 — "가능한 한 낮게"
(C) 특정 영역 탐색 — "레이턴시만 줄여서"
Q2: 제약 조건?
Q3: 우선 탐색 방향?
Q1: 총 실행 시간? (기본: 1시간)
Q2: 중간 보고 간격? (기본: 10실험마다)
Q3: 조기 종료 조건? (기본: 목표 달성 시)
LOOP START (시간 또는 횟수 도달까지):
1. 컨텍스트 수집
- program.md 읽기 (목표, scope, constraints)
- results.tsv 읽기 (히스토리, best_score)
- 타깃 영역 코드 읽기
2. 가설 → 코드 수정
- 이전 결과에서 패턴 파악
- 한 번에 한 가지 변경, 1영역 1~2파일
- Edit tool로 수정
- git commit -m "[실험] <설명>"
3. uv run run_experiment.py (원커맨드, 개입 없음)
- 에이전트는 이 커맨드만 실행
- 서버 reload, 페이지 리로드, 테스트 실행은 전부 스크립트가 처리
- stdout 마지막 줄 JSON 읽기
4. 판정
exit 1 (크래시) → 간단 수정(최대 2회) 또는 revert + crash 기록
score > gate → revert + discard 기록
score <= best_score → keep, best_score 갱신
score > best_score (게이트 통과) → revert + discard 기록
(중간 보고 — N실험마다)
(종료 조건 확인 — 시간/목표/인터럽트)
LOOP END
1. 현재 카테고리 기록
2. 미시도 카테고리로 전환
3. 카운터 리셋
4. 모든 카테고리 소진 → near-miss 조합, 반대 방향, 코드 단순화
자율주행 완료 후 autoresearch/report-{tag}.md 생성.
상세 템플릿: references/report-template.md 참조.
| 명령 | 설명 |
|---|---|
/auto | 시작 (setup→baseline→목표→자율주행) |
/auto setup | autoresearch/ 초기화만 |
/auto 2h | 2시간 자율주행 |
/auto 30m | 30분 자율주행 |
/auto overnight | 8시간 자율주행 |
/auto resume | 기존 브랜치에서 이어서 |
/auto report | results.tsv 기반 리포트 생성 |
/auto update | upstream/ git pull |
run_experiment.py 출력 형식. 상세: references/run-experiment-contract.md
{
"score": 0.004,
"passed": 13,
"total": 14,
"failed": ["zh-TW-long"],
"grade_summary": "13S 1A",
"flush_e2e_ms": null,
"status": "ok",
"duration_s": 187.3
}
references/git-loop-protocol.md — git 기반 실험 루프 프로토콜references/run-experiment-contract.md — stdout JSON 계약 명세references/report-template.md — 리포트 템플릿