| name | cw-collab-review |
| description | 评估用户(目标人员)在与 AI 协作过程中的行为质量——不是评价代码产出,而是评价人的判断、决策、纠偏、审查等协作行为。基于九维度行为框架给出 0-4 分评分和具体改进建议。当用户说"评价一下我的表现""复盘刚才的协作""我刚才协作得怎么样""人机协作评估""协作复盘"时触发,或在用户粘贴一段对话记录要求评估时触发。 |
| category | general |
| tags | ["review","collaboration","evaluation","self-improvement","协作复盘","行为评估"] |
| triggers | {"keywords":["评价我的表现","复盘刚才","协作复盘","人机协作评估","协作质量","评价这次对话","我协作得怎么样","我的判断对不对","review协作"]} |
人机编码协作行为复盘 (Collaboration Review)
核心定位
为与 AI 协作的开发者提供行为层面的复盘:不评价代码/产出物好坏,只评价"人在协作过程中做了哪些有价值的判断、错过了哪些介入机会、哪些行为建立在未验证的前提上"。
目标:让用户下一次与 AI 协作时,更早介入、更准纠偏、更少无效投入。
⚠️ 先加载框架再评估
完整的九维度定义、评分规则、输出格式模板都在 reference 里。评估前必须先读:
read_skill_resource("cw-collab-review", "references/evaluation-framework.md")
这份 SKILL.md 只讲执行流程,不讲维度细节。
两种触发场景
场景 A:评估当前会话(最常见)
用户说"评价一下我刚才的表现"——目标人员就是当前用户,AI 就是你自己(当前 agent)。
数据来源:
- ✅ 当前会话的完整上下文(你有全部消息记录)
- 需要识别:哪些消息来自用户、哪些是 AI 的分析/工具调用/输出
- 同事消息:如果用户在对话里引用了同事的话,标注为同事
⚠️ 关键纪律:评估 AI(你自己)的行为时要更严格,不能因为"AI 主动发现了问题"就算作用户的能力。AI 自己的纠偏、AI 自己的预见性,都只能作为"判断用户是否有介入机会"的背景,不能算用户的正向行为。
场景 B:评估外部对话(用户提供记录)
用户粘贴一段外部对话(可能是与其他 AI、与同事的协作记录)。
数据来源:用户提供的对话文本。需要用户指明:
- 谁是目标人员
- 谁是同事(如有)
- 哪些是 AI 的输出
如果角色不清晰,先问清楚再评估。
执行流程
第一步:加载评估框架
read_skill_resource("cw-collab-review", "references/evaluation-framework.md")
第二步:识别角色与阶段
- 明确目标人员、同事、AI 的发言边界
- 按时间划分协作阶段(需求澄清 / 信息调查 / 方案设计 / 编码实施 / Review / 验证)
第三步:提取关键行为事件
按时间顺序,提取目标人员的关键判断行为。每个事件标记:
- 主行为维度 + 次行为维度(从九维度选)
- 前提有效性(✅已确认 / ⚠️未确认但合理 / ❌被证伪 / 证据不足)
- 收缩与必要扩张质量(高/中/低/不适用)
- 是否改变后续方向
- 行为评价
⚠️ 不要把"好的""继续"这种机械回复算作关键事件。
第四步:识别介入机会与缺失行为
只在对话中明确出现了需要介入的场景时,才指出用户缺少某种行为。
区分两种情况:
- 未出现适用场景(不计为缺点)
- 出现了介入机会但未观察到行为(可指出)
第五步:按框架输出
严格按 reference 里定义的 10 个 section 输出。不要省略,不要合并,不要只给抽象结论。
九维度速查(详见 reference)
| 维度 | 一句话 | 价值层级 |
|---|
| 1. 定向信息获取 | 主动查代码/事实,而非只接受 AI 总结 | 基础 |
| 2. 复述确认 | 在关键节点用自己的话重述结论 | 基础 |
| 3. 需求与任务边界收缩 | 明确做什么、不做什么 | 关键 |
| 4. 方案取舍与主导决策 | 不默认接受 AI 首选方案 | 关键 |
| 5. 实施时机与介入节奏 | 前提稳定后才编码,风险出现时暂停 | 关键 |
| 6. 否定与纠偏 | 有依据地指出 AI 错误 | 关键 |
| 7. 预见性判断与主动设限 | 事前识别风险——价值最高 | 最高 |
| 8. 搜索方向修正 | 修正 AI 跑偏的调查方向 | 中 |
| 9. 基于实现细节的校准与审查 | 读实际代码,而非只看 AI 总结 | 关键 |
核心原则:事前发现 > 事后发现;一次精准介入 > 多轮模糊质疑;依据充分 > 凭感觉。
输出结构(10 个 section,详见 reference)
- 总体结论(4-8 句)
- 协作阶段概览(表格)
- 关键行为事件表
- 九维度评价表
- 做得好的地方(2-5 项,含行为/证据/价值)
- 需要提高的地方(2-5 项,含可用表达)
- 前提有效性汇总
- 无效投入与止损分析
- 实施后审查专项结论
- 最终行为画像(模式/最值得保留/最优先改进/一句话结论)
边界与失败模式
| 情况 | 处理 |
|---|
| 对话极短(< 5 轮) | 数据不足,提示用户"对话太短,建议在更完整的协作后复盘" |
| 用户要求只看"好的地方" | 可以,但仍需指出前提有效性 |
| 用户要求评估"代码质量" | 拒绝——本 skill 只评估人的行为,不评估代码 |
| 对话未进入编码阶段 | 第 9 节"实施后审查"标注不适用,其余正常 |
不做的事
- ❌ 不评价最终代码/产出物的好坏
- ❌ 不把 AI 主动发现的问题算作用户能力
- ❌ 不因为发言多就给高分
- ❌ 不因为项目成功就反推用户优秀
- ❌ 不对未出现适用场景的维度机械扣分
- ❌ 不只给抽象结论,必须引用具体对话证据
版本
- v1.0 (2026-07-28): 初版,基于用户提供的九维度行为评估框架