职业分类
其他计算机职业
描述
執行 claw-eval-zh 中文 agent benchmark,評估 OpenClaw agent 在中文真實任務上的表現。可用於測試模型的中文 agentic 能力、比較模型、跑 Pass^k 一致性評估,或匯出 Claw-Eval 風格的中文任務集。改編自 PinchBench,任務格式參考 Claw-Eval 中文任務風格。
更新
菜单
SkillsMP 已收集 voidful/taiwan-agent-bench 中的 1 个 Skill。打开任一 Skill 可查看来源和详情。
已展示 1 / 1 个已收集 Skill。
執行 claw-eval-zh 中文 agent benchmark,評估 OpenClaw agent 在中文真實任務上的表現。可用於測試模型的中文 agentic 能力、比較模型、跑 Pass^k 一致性評估,或匯出 Claw-Eval 風格的中文任務集。改編自 PinchBench,任務格式參考 Claw-Eval 中文任務風格。