mit einem Klick
run-e2e-test
运行端到端测试,验证评测框架各组件协作正常。
Mit Codex oder Claude installieren Kopieren Sie diesen Prompt, fügen Sie ihn in Codex, Claude oder einen anderen Assistant ein und lassen Sie die Skill-Seite prüfen und installieren.
Menü
运行端到端测试,验证评测框架各组件协作正常。
Mit Codex oder Claude installieren Kopieren Sie diesen Prompt, fügen Sie ihn in Codex, Claude oder einen anderen Assistant ein und lassen Sie die Skill-Seite prüfen und installieren.
Use when analyzing ESL-Bench evaluation reports - extracting scores by difficulty dimension, comparing methods, checking fail rates, token costs, duration per query. Triggers on keywords like eslbench report, benchmark results, group by difficulty.
集成外部 benchmark 数据集到 HolyEval 框架 — 从论文/仓库到可执行评测的端到端流程。
Scaffold a new EvalAgent plugin (config + implementation + registration).
Scaffold a new TargetAgent plugin (config + implementation + registration).
引导项目初始化 — 环境安装、配置、验证、启动 Web UI(含 hma-web 公开评测平台)。
审查项目架构健康度 — 检查 GitOps 合规、Plugin 可插拔性、CLI/Web 复用。当用户要求架构审查、代码重构后验证、或新增模块后检查依赖关系时使用。
Basierend auf der SOC-Berufsklassifikation
| name | run-e2e-test |
| description | 运行端到端测试,验证评测框架各组件协作正常。 |
运行端到端集成测试,验证 TestAgent、TargetAgent、EvalAgent、Orchestrator 整体工作正常。
确认 .env 中配置了 OPENAI_API_KEY,e2e 测试需要调用 LLM:
grep OPENAI_API_KEY .env
如果未配置,提示用户先执行 /quick-start 完成环境设置。
根据用户需求选择运行方式:
# 运行全部 e2e 测试(4 条用例)
pytest evaluator/tests/test_e2e.py -v -s
# 运行单条用例(用 -k 过滤)
pytest evaluator/tests/test_e2e.py -v -s -k "manual_headache_001"
pytest evaluator/tests/test_e2e.py -v -s -k "auto_history_llm_004"
# 运行批量测试(含 BatchSession 进度跟踪验证)
pytest evaluator/tests/test_e2e.py -v -s -k "batch"
测试用例覆盖范围:
| ID | 用户模式 | 被测系统 | 评估器 |
|---|---|---|---|
manual_headache_001 | manual | theta_api | semantic |
auto_cough_child_002 | auto | theta_api | semantic |
auto_history_sleep_003 | auto | theta_api | semantic |
auto_history_llm_004 | auto | llm_api | semantic |
全部通过 = 框架工作正常。如果有失败:
pytest evaluator/tests/ -v
单元测试使用 mock,不需要 API Key。