بنقرة واحدة
eval
综合评测技能:先采集SDD流程的代码变更信息,再使用第三方评测模型对代码质量进行评估。当用户需要"综合评测"、"完整评测流程"、"SDD评测"时触发本技能。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
综合评测技能:先采集SDD流程的代码变更信息,再使用第三方评测模型对代码质量进行评估。当用户需要"综合评测"、"完整评测流程"、"SDD评测"时触发本技能。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
按 Git/非 Git、是否指定 BRANCH_NAME 与 FEATURE_DIR 分支决策,解析输入并创建或复用特性分支与功能目录,输出 BRANCH_NAME、SPEC_FILE、FEATURE_DIR。用于 /specify 或单独创建/复用特性分支。
基于已定义的功能识别并调整逻辑实体,输出实体责任边界、协作关系与关键数据结构,并生成数据模型文档。仅被显式调用,不自动触发。
SDD流程代码变更采集Skill。在SDD流程执行完毕后,采集目标目录的代码变更信息,提取feature_infos和code_blocks,生成评测所需的JSON文件并保存到当前SDD分支的evalset目录下。当用户提到"采集SDD变更"、"生成评测数据"、"收集代码变更信息"、"build_configi_eval"、"evalset"时触发本技能。
深度逻辑架构要素反构编排Skill. 当 reverse 的 --target 为 deep_logic_architecture 时触发.
实体清单与实体关系反构的编排Skill. 当 reverse 的 --target 为 entities 或 all 的实体阶段时触发.
功能清单与功能详情文档反构的编排Skill. 当 reverse 的 --target 为 functions 或 all 的功能阶段时触发.
| name | eval |
| description | 综合评测技能:先采集SDD流程的代码变更信息,再使用第三方评测模型对代码质量进行评估。当用户需要"综合评测"、"完整评测流程"、"SDD评测"时触发本技能。 |
| compatibility | Requires Python environment with requests, jinja2, loguru packages and access to LLM API endpoint |
本技能整合了代码变更采集和第三方模型评测功能,提供完整的 SDD 流程代码质量评估。
调用 /eval-collector 技能:
changes/{FEATURE_DIR}/evalset/config.result.json调用 /eval-evaluator 技能:
changes/{FEATURE_DIR}/evalset/config.result.json 文件自动检测当前项目的主要代码目录:
changes/{FEATURE_DIR}/evalset/result.txt - 包含详细的评测报告/eval
执行步骤:
/eval tests
执行步骤:
tests 目录的变更评测开始...
第一步:采集代码变更信息
- 当前分支: 001-TCF-5064840-vpn-service
- 目标目录: networking_zte (自动检测)
- 采集完成,生成 evalset/config.result.json
第二步:执行代码质量评测
- 使用模型: glm4.6
- 评测中...
评测结果
代码已使用 glm4.6 模型完成评测,以下是详细结果:
📊 综合评分
平均LLM评测指标: 0.83
- 功能正确性: 0.75
- 实用性: 1.0
- 代码一致性: 0.75
🔍 详细分析
功能正确性 (0.75/1.0)
优点:
- xxx
主要问题:
- xxx
实用性 (1.0/1.0)
优点:
- xxx
代码一致性 (0.75/1.0)
发现的不一致问题:
- xxx
💡 改进建议
1. xxx
2. xxx
总结:xxxx
结果已保存到: changes/001-TCF-5064840-vpn-service/evalset/result.txt
tasks.md 和目标目录是否存在