Run the WBench 22-metric evaluation pipeline on a model's videos. Use when the user asks to evaluate / score a model, run metrics, or produce a report (e.g. "evaluate kling3", "跑一下 hyworld1.5 的评测", "只算 video_quality"). Drives main.py (precompute → gpu → vlm → report) over work_dirs/<model>/videos.
Generate WBench videos for a model. Use when the user asks to generate / produce videos for a registered model (e.g. "generate kling videos", "用 wan 生成全部 case", "跑 camera_preview 的 navi case"). Drives generate.py over data/cases and writes work_dirs/<model>/videos/case_<id>_combined.mp4.
Package and submit a model's results to WBench (leaderboard). Use when the user asks to prepare a submission, build the meta.json/turns.json package, or upload videos to the WBench-examples HF dataset (e.g. "package kling3 for submission", "生成 turns.json", "上传到 huggingface"). Produces the work_dirs/<model>/{meta.json,turns.json,videos/} bundle.
Automate Project Genie (labs.google) benchmark runs. Use when the user asks to run a case on Genie3 (e.g. "run case_XXX on genie3", "用genie3跑case_XXX"). Uses OS file-dialog upload because Genie3 enforces Private Network Access.
Automate happyoyster.cn/create benchmark runs. Use when the user asks to run a case on Happy Oyster (e.g. "run case_XXX on happy", "用happy跑case_XXX"). Fully JS-driven (fetch + DataTransfer for image upload, no pyautogui coordinates).