Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
直接コマンドでは確認用 Prompt が省略されます。実行前にソースを確認してください。
npx skills add https://github.com/thetahealth/mirobody-eval --skill run-e2e-testコマンドは1行のまま表示されます。コピー前に横へスクロールして全体を確認してください。
ローカルで確認しますか?SkillsMP が現在取得できるファイルをダウンロードできます。
Use when analyzing ESL-Bench evaluation reports - extracting scores by difficulty dimension, comparing methods, checking fail rates, token costs, duration per query. Triggers on keywords like eslbench report, benchmark results, group by difficulty.
集成外部 benchmark 数据集到 HolyEval 框架 — 从论文/仓库到可执行评测的端到端流程。
Scaffold a new EvalAgent plugin (config + implementation + registration).
SOC 職業分類に基づく
SKILL.md を表示中
| name | run-e2e-test |
| description | 运行端到端测试,验证评测框架各组件协作正常。 |
运行端到端集成测试,验证 TestAgent、TargetAgent、EvalAgent、Orchestrator 整体工作正常。
确认 .env 中配置了 OPENAI_API_KEY,e2e 测试需要调用 LLM:
grep OPENAI_API_KEY .env
如果未配置,提示用户先执行 /quick-start 完成环境设置。
根据用户需求选择运行方式:
# 运行全部 e2e 测试(4 条用例)
pytest evaluator/tests/test_e2e.py -v -s
# 运行单条用例(用 -k 过滤)
pytest evaluator/tests/test_e2e.py -v -s -k "manual_headache_001"
pytest evaluator/tests/test_e2e.py -v -s -k "auto_history_llm_004"
# 运行批量测试(含 BatchSession 进度跟踪验证)
pytest evaluator/tests/test_e2e.py -v -s -k "batch"
测试用例覆盖范围:
| ID | 用户模式 | 被测系统 | 评估器 |
|---|---|---|---|
manual_headache_001 | manual | theta_api | semantic |
auto_cough_child_002 | auto | theta_api | semantic |
auto_history_sleep_003 | auto | theta_api | semantic |
auto_history_llm_004 | auto | llm_api | semantic |
全部通过 = 框架工作正常。如果有失败:
pytest evaluator/tests/ -v
单元测试使用 mock,不需要 API Key。