Skip to main content

evaluation-skill

太极平台模型评测子 skill —— 通过 MCP 协议查询评测结果/得分/进展、管理 Insight、复制/重试/停止/删除评测任务、导出下载 Insight & Case 数据、生成评测分析报告、解析 Agent 轨迹;并基于导出数据做下钻分析、错误归因、底线问题检测与 WildClaw Bench 专项分析;同时支持把开源评测集(opencompass/lm-evaluation-harness 等)自带的打分代码改写为 hy_unify_eval 的 Metric 并提交推送到个人分支。当用户提及"评测结果 / 评估报告 / 评测得分 / Insight / case 导出 / 下钻分析 / 错误归因 / 底线问题 / 复读乱码检测 / 深度分析 / 横向对比 / 多模型对比 / 模型优劣 / 逐case分析 / WildClaw / agent 轨迹 / 触发事件 / 伴生评估 / 触发事件复制 / 基于..创建触发事件 / 修改模型参数 / 配置伴生评估 / 复制训练任务 / 批量复制 / 复制到新任务 / 复制伴生配置 / 发布集合版本 / 上线集合版本 / 下线集合版本 / 新建评估版本 / 创建 Arena / 新增开源 metric / 把某评测集改写进 evals / 接入 MMLU HumanEval GSM8K 等开源评测集 / hy_unify_eval 加 metric / langfuse / trace 查询 / 查看调用链 / 拉取 trace 数据"等关键词时,应使用本 skill。边界排除项见 §0。

跳到安装

来源信息

仓库
liuhanzuo/Mixture-of-Memory
最近来源活动
2026年8月17日 04:21
检测到的 SKILL.md 语言
中文
星标
4
分支
1

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。