职业分类
数据科学家
描述
驱动 One-Eval 对「纯文本 LLM」做端到端评测。当用户想评测一个模型(API 或本地 vLLM)在某些 benchmark 上的表现、对比多个 benchmark 分数、补充多维度 metric、或生成图文评测报告时使用本 skill。
更新
菜单
SkillsMP 已收集 OpenDCAI/One-Eval 中的 1 个 Skill。打开任一 Skill 可查看来源和详情。
已展示 1 / 1 个已收集 Skill。
驱动 One-Eval 对「纯文本 LLM」做端到端评测。当用户想评测一个模型(API 或本地 vLLM)在某些 benchmark 上的表现、对比多个 benchmark 分数、补充多维度 metric、或生成图文评测报告时使用本 skill。