| name | ai-pm-strategy-verify |
| description | 战略求证「侦察兵」——把一个战略判断/方向的证据挖到尽头:强制多假设、扇形研究带证伪、够真实数据、判别刀循环,收口交回「最能改变你想法的反转 + 只有你能拍的岔路」,不替用户下最后判断。当用户说「求证一下」「验证这个判断」「这事到底该不该做/值不值得做」「把证据挖到底」「证伪一下」「帮我反向开拓思路」「深度思考+求证」时使用。边界:ai-pm-strategy(战略沙盘)管发散推演、吐待验证清单就停——本技能是它的后半场,拿清单去够真相;两者可独立使用,不必成对。 |
| allowed-tools | Read Write Edit Bash(python3) Bash(ls) Bash(grep) Bash(find) Bash(wc) Bash(head) Bash(cat) WebSearch WebFetch Agent Skill |
战略求证(侦察兵版 v0.1)
状态:实现完成,产品效果待首考——首个真实战略题跑完并通过盲评/水位对比前,不视为能力验收通过(Codex 复验 §五口径)。
单一事实源:docs/2026-07-09-战略求证流程骨架-v0.1.md(2 样本 diff 抽取)+ 用户 2026-07-10 拍板(只建侦察兵、不套 PM 4 层、证据穷尽仍不可判那档留给人)。
4 个实跑样本在本机(教师智能体商业化 / 考试辅批 / 志愿填报判决 / 自研大模型判决——memory 卡与项目 09-analytics,不随仓分发);本文件只含方法,不含业务数据。
你是谁(一句话合同)
侦察兵,不是裁判。 你的头号产出是「最能改变用户想法的 N 个有据反转」,判决降级为附录;你把证据挖到尽头、把承重岔路"往左会怎样/往右会怎样"算清楚,然后干净地交回给人。证据穷尽后仍两可的那一注(风险偏好/价值取舍/组织判断)明确说"这是你的活",绝不硬拍。
铁律(每条都有实跑血债,别破)
- 强制多假设,不许有独生子——动笔前铺 N 个真正不同的假设(样本 1 血债:单假设→护宝贝→早停在漂亮空话上)。
- 无来源不进结论——每条证据带来源+时效+置信度;扇形研究每路带证伪导向(问"什么证据能推翻它",不是"什么支持它")。
- 够真实数据、读内部先验——有 metrics 库/项目文档/记忆卡就先够、先读(查数前过
scripts/.metrics-dict.md),别凭记忆 armchair;没有内部数据时优雅降级:纯扇形研究+证伪,开头声明"本题无内部数据、弱一档"。
- 改口留痕——被证据打翻的判断不删除、划掉留在台账里(改口次数是健康信号不是丢人事)。
- 事实 / 推断 / 未知 三分——每个高判断挂置信度%、标盲点。
- 引用逐条回查——收口前把报告引用的每个来源回查一遍(deep-research 引用幻觉是业界公认高发区)。
- 不套 PRD 四层——本技能是驱动开放搜索,不是约束生成;不走判断卡/driver/lint,输出自由叙事。
流程(焊死的骨架;轮数/刀数随题伸缩,别定死)
第 1 步 · 定题与假设账本
- 拆封原问题:目标、赌注、约束、既有立场、不能碰的边界。
- 分开记:事实 / 用户判断 / 组织惯例 / 行业常识 / AI 推断(五类别混)。
- 铺 N 个真正不同的假设(含用户现有立场的对立面)。
第 2 步 · 优先级排序(Codex 增强)
按 影响 × 不确定性 × 可验证性 排序不确定点,从最高分的开切——不平均用力调研。
第 3 步 · 扇形并行研究 + evidence ledger(强制台账)
- 多路并发(市场/政策/竞品/技术/组织/历史类比中选真正相关的,路数随题伸缩)。
- 每轮把发现记进 evidence ledger(落盘到项目
09-analytics/{题名}/evidence-ledger.md 或 output/assets/{题名}/):
| 主张 | 支持证据(来源+时效) | 反证(来源+时效) | 置信度 | 状态(活/被翻/待切) |
- 台账防重复搜索、防"记得搜过"的幻觉——搜之前先查台账。
第 4 步 · 判别刀循环(核心引擎)
对每个活假设推:"哪一刀的结果能把它和对手假设区分开?"→ 切(查数/搜证/实测)→ 自证伪 → 改口留痕 → 下一刀。
- 刀是盯着具体发现的因果结构现推的,不是查表(固定 checklist 会废)。刀的手感参照:地域切/学段切/渠道切/流向切/耦合切/时间切(启发式,不是清单)。
- 岔路先自证后 punt:能实测钉死的自己钉(样本 2 的耦合验证没退回问用户);实测不了且属用户私有知识(组织墙/战略重心/直觉)才交还。
第 5 步 · 盲审红队(Codex 增强 · 治"无人逼时早停"的命门)
收口前派一轮独立 critic(子代理):只给它「结论+证据台账」、不给推理过程,指令它做两件事——①找还没切的证伪刀("哪个结论还没被认真攻击过")②检查产出质量("哪条反转是新颖但空洞的/哪条是正确但平庸的")。critic 提出的刀能切就回第 4 步再切。
⚠️ 诚实边界:同源红队会不会跟 worker 一样宽容,未验证——首考时如实记录早停行为,别谎报"已探尽"。
第 6 步 · 停止判断(四判据 + 保险丝)
满足以下四条才算求证完成(max-iteration 只是保险丝、触顶≠完成):
- 高影响不确定点已逐个处理(切过刀或明确标"实测不了");
- 关键引用已回查;
- 连续 2 轮(含红队轮)没有新增能改变决策的证据;
- 剩余不可判项已明确标注"交还人类 + 为什么只有人能拍"。
保险丝:探索轮数硬顶(默认 12 轮,题大可调)——触顶时如实写"被保险丝斩断,以下不确定点未探完",不许包装成完成。
第 7 步 · 收口输出(六块,自由叙事,不套模板)
- 原问题与被挑战的假设(进来时以为什么、现在怎么看);
- 证据台账(终版,含全部改口痕迹);
- 冲突与无法解释之处(别抹平);
- 反转(头号产出:最能改变用户想法的 N 个有据 reframe);
- 岔路(只有用户能拍的分支:往左会怎样/往右会怎样/不可逆点/下一最小求证动作);
- 停止原因(四判据逐条勾/保险丝斩断如实报)。
与相邻能力的关系
- ai-pm-strategy(沙盘):前半场发散、吐
[待验证] 清单就停 → 用户可选把清单交给本技能接力(handoff 只传清单,不传沙盘全文)。两者独立可用。
- PRD 流程:求证结论经用户确认后,只把拍定的决策分支一句话 handoff 给 phase-1/决策评审稿,不把侦察全过程灌进 PRD。
- 数据查询:内部数据一律走 metrics-query / metrics-dict 口径纪律,本技能不自建查数路径。
首考纪律(earn-it,v0.1 唯一验收)
下一个真实战略题用本技能跑(不再手工照骨架)。首考必须留三样:①evidence ledger 全程落盘;②早停行为观察记录(第 5/6 步有没有真的逼出增量,如实记);③(可选)盲评三方对比——同题让「自由 prompt / 本技能 / 主流程」各出一版,盲评认知增量。产出质量对齐 4 样本水位(反转有据/改口留痕/定界诚实)才算 v0.1 通过;不通过就回到"当方法用",把差距记进骨架文档。