Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/thetahealth/mirobody-eval --skill run-e2e-test명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SKILL.md 표시 중
Use when analyzing ESL-Bench evaluation reports - extracting scores by difficulty dimension, comparing methods, checking fail rates, token costs, duration per query. Triggers on keywords like eslbench report, benchmark results, group by difficulty.
集成外部 benchmark 数据集到 HolyEval 框架 — 从论文/仓库到可执行评测的端到端流程。
Scaffold a new EvalAgent plugin (config + implementation + registration).
SOC 직업 분류 기준
| name | run-e2e-test |
| description | 运行端到端测试,验证评测框架各组件协作正常。 |
运行端到端集成测试,验证 TestAgent、TargetAgent、EvalAgent、Orchestrator 整体工作正常。
确认 .env 中配置了 OPENAI_API_KEY,e2e 测试需要调用 LLM:
grep OPENAI_API_KEY .env
如果未配置,提示用户先执行 /quick-start 完成环境设置。
根据用户需求选择运行方式:
# 运行全部 e2e 测试(4 条用例)
pytest evaluator/tests/test_e2e.py -v -s
# 运行单条用例(用 -k 过滤)
pytest evaluator/tests/test_e2e.py -v -s -k "manual_headache_001"
pytest evaluator/tests/test_e2e.py -v -s -k "auto_history_llm_004"
# 运行批量测试(含 BatchSession 进度跟踪验证)
pytest evaluator/tests/test_e2e.py -v -s -k "batch"
测试用例覆盖范围:
| ID | 用户模式 | 被测系统 | 评估器 |
|---|---|---|---|
manual_headache_001 | manual | theta_api | semantic |
auto_cough_child_002 | auto | theta_api | semantic |
auto_history_sleep_003 | auto | theta_api | semantic |
auto_history_llm_004 | auto | llm_api | semantic |
全部通过 = 框架工作正常。如果有失败:
pytest evaluator/tests/ -v
单元测试使用 mock,不需要 API Key。