用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/thetahealth/mirobody-eval --skill run-e2e-test命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
Use when analyzing ESL-Bench evaluation reports - extracting scores by difficulty dimension, comparing methods, checking fail rates, token costs, duration per query. Triggers on keywords like eslbench report, benchmark results, group by difficulty.
集成外部 benchmark 数据集到 HolyEval 框架 — 从论文/仓库到可执行评测的端到端流程。
Scaffold a new EvalAgent plugin (config + implementation + registration).
基于 SOC 职业分类
正在显示 SKILL.md
| name | run-e2e-test |
| description | 运行端到端测试,验证评测框架各组件协作正常。 |
运行端到端集成测试,验证 TestAgent、TargetAgent、EvalAgent、Orchestrator 整体工作正常。
确认 .env 中配置了 OPENAI_API_KEY,e2e 测试需要调用 LLM:
grep OPENAI_API_KEY .env
如果未配置,提示用户先执行 /quick-start 完成环境设置。
根据用户需求选择运行方式:
# 运行全部 e2e 测试(4 条用例)
pytest evaluator/tests/test_e2e.py -v -s
# 运行单条用例(用 -k 过滤)
pytest evaluator/tests/test_e2e.py -v -s -k "manual_headache_001"
pytest evaluator/tests/test_e2e.py -v -s -k "auto_history_llm_004"
# 运行批量测试(含 BatchSession 进度跟踪验证)
pytest evaluator/tests/test_e2e.py -v -s -k "batch"
测试用例覆盖范围:
| ID | 用户模式 | 被测系统 | 评估器 |
|---|---|---|---|
manual_headache_001 | manual | theta_api | semantic |
auto_cough_child_002 | auto | theta_api | semantic |
auto_history_sleep_003 | auto | theta_api | semantic |
auto_history_llm_004 | auto | llm_api | semantic |
全部通过 = 框架工作正常。如果有失败:
pytest evaluator/tests/ -v
单元测试使用 mock,不需要 API Key。