| name | multi-perspective-research |
| description | Skip 优先判定:一查便知的单点事实问题 → 直接回答不套流程;请求点名了候选让选、或用裁决措辞要结论(选哪个 / 要不要上 X / 该不该做 / 可不可行)→ 先 `product-rd-workflow`(它可回调本技能产调研底稿);纯主题/领域/写作准备调研留在本技能;拷问已有方案 → `grill-me`;bug 根因 → `defect-diagnosis`;复盘沉淀 → `skill-extraction-workflow`。触发:调研一个主题 / 深度调研 / 多视角研究 / 帮我研究一下 X / 写作前调研 / 领域·组织研究(不喂决策)/ research a topic → run a structured research loop(视角枚举 → 矛盾图 → 合成简报 → 自评)with evidence-grounding discipline, instead of one-question surface answers. |
Multi-Perspective Research(多视角主题调研)
当用户要研究、调研、深入了解一个主题(写文档前、竞品/组织/领域研究、演讲/谈判准备,或被 product-rd-workflow 的选型/评估 gate 调用产调研底稿)时使用。单问单答只会返回最大众化的表面共识;本技能用结构化的多视角流程逼出争议、利益结构、历史先例和领域盲区。
方法改编自 STORM(Shao et al., "Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models", NAACL 2024;开源实现 github.com/stanford-oval/storm)。论文报告的同行评审评测显示,其成文条理性与覆盖面均显著优于 outline-driven RAG 基线(具体数字以原文为准:aclanthology.org/2024.naacl-long.347)。后续 Co-STORM(Jiang et al., EMNLP 2024)加入 moderator(从检索到但未被使用的信息中提问,专挖盲区)与动态思维导图。STORM 的核心洞察:研究质量取决于提问的视角多样性,而不是单个问题的措辞。
主张边界(外部证据核查后收窄):证据支持多视角提问提升调研的覆盖面、条理性和盲区发现(写作/研究合成场景);证据不支持"同一模型模拟多个 persona 辩论就能稳定提升事实正确性"——两项独立评测(Smit et al., "Should we be going MAD?", ICML 2024, PMLR v235;及 "Stop Overvaluing Multi-Agent Debate", arXiv:2502.08788, 2025)均显示同质 persona 辩论常打不过 self-consistency 等单模型基线,模型异构与真实检索才是可靠增益。所以本技能把多视角用于提问与覆盖,把正确性交给下面的证据落地纪律。
何时不用
- 用户已有方案、要的是追问和压力测试 →
grill-me。
- 请求本质是交付决策(选型结论、可行性评估、方案评估)→
product-rd-workflow 的对应 gate 拥有决策与证据标准;本技能只产出调研底稿。判别标准取可操作面:请求点名候选让选或用裁决措辞要结论(选哪个/要不要/该不该/可不可行)→ product-rd-workflow;纯主题/领域/写作准备调研 → 本技能。调研中若演变为要拍板(用户开始追问"那选哪个"),当场移交 product-rd-workflow。
- 一次性的简单事实问题(一查便知)→ 直接回答,不要套流程。
核心流程
先做覆盖预检,再按顺序执行四步。轻量场景(快速了解)可只跑 1+3,但此模式不得输出"可操作建议"或任何载重结论,且未跑矛盾图时发现列表不得声称"按可靠性排序"(可靠性判断依赖矛盾图/自评)——产出只能作为探索性概览交付,仍必须附逐条 grounded/ungrounded 标注;任何包含可操作建议/载重结论/可靠性排序的简报必须跑完第 2、4 步并附待核验清单。提示词模板见 references/research-prompts.md。
-
覆盖预检:第一次检索前先写覆盖矩阵:研究问题/载重主张 | 必需证据类别 | 检索入口 | 关闭条件 | 状态。证据类别由主张决定,至少区分用户提供的线索、一手/官方材料、独立外部证据和反例/负面证据;主张依赖时效、规模或因果时,再增加对应类别。仅当用户确实未提供任何材料或线索时,该类才能记 不适用,并必须写明原因及其对结论的限制;用户已提供任何材料时不得标 不适用,也不得为凑齐四类虚构线索。这四类是完整/深度标签的组织控制,不是宣称所有主题都遵循同一套系统综述标准。用户材料默认只是线索,不是研究边界;只有用户明确要求“仅基于这些材料”时才能封闭外部检索。“本轮不要执行检索/先给计划”只把检索状态留为 pending,不等于限定来源范围。每格必须以本次取回的来源关闭,或写明不可得/不适用及其对结论的限制。矩阵未闭合时,只能交付定向/部分调研,不得宣称“深度调研完成”。外部方法依据与适用边界见 ../skill-extraction-workflow/references/external-practice-controls.md#research-coverage。调研对象是一个具体组织(而非主题)时,先定 estimand 再走一遍组织披露渠道类别清单:四类证据问的是"证据是什么种类",只查官网与年报就能把"一手/官方"格正当关上,而强制披露制度、监管方批量数据、他国法定登记通常信息量更大却一次未被想到。references/public-disclosure-channels.md 是这个组织场景的渠道起点,只用来防"没想到",是起点不是全集,不另立闭合状态;走完它不构成任何终局判断,走不动的类别按本节既有纪律计为未关闭格。references/public-data-acquisition.md 则说明公开材料怎么取回、解析与自校验,适用于组织、主题、政策、技术、市场等场景。组织场景的 estimand 要写清目标是单一法人、合并集团、品牌或业务单元还是某个网络、依据与截至日期;依据不足时只能称"有界的工作口径",且人数与比例类结论不得进入承重结论。
-
多视角枚举:为主题选 3–6 个会产生不同答案的视角。默认五视角:实践者(每天做这件事的人)、研究者(同行评审证据)、怀疑者(最强反方论点)、利益追踪者(谁从当前叙事获利)、历史对照者(先例与规律)。按主题替换不合适的视角(如加监管者、终端用户、竞争者)。每个视角输出:核心立场、最强证据、只有该视角会说的一件事。
-
矛盾图:视角间哪些主张直接冲突;哪个视角证据最强/最弱及原因;所有视角都同意什么(大概率为真);没有任何视角提及什么(领域盲区,常是最有价值的发现);哪一个问题被回答后能化解最大矛盾。
-
合成简报:一段话总结(面向决策者,要 nuance 不要标题党);关键发现(每条标注支持/质疑它的视角;按可靠性排序仅四步全跑时输出,轻量模式给不排序列表;每条发现标注主张状态——「来源明确陈述 / 有证据支持的推论 / 作者判断」三态,与第 2 步产出的共识/争议/盲区分区是两个正交轴(分区说内容归哪块,状态说主张立在什么上);「来源明确陈述」是归因不是真实性——写成「来源 X 声称」,可信度仍由 grounded 纪律与来源质量单独表达;作者判断句显式带「判断」类标记;证据只撑到推论级就用分级句式写(如「机制可证、参数不可证」),不让判断穿事实的句式。三态管解释性/推断性主张,直接观测豁免只限原始计数/测量值(本次工具调用真实取回的数字,走证据表 grounded 行按原样陈述)——工具生成的分类/评分/裁决(如某检查器给出的通过/风险级)仍按推论或判断标注并写明工具及其权威边界;约束覆盖简报全部此类主张——一段话总结、隐藏关联、可操作建议、前沿问题不得引入关键发现之外的承重新断言,新增承重断言先回填为关键发现并入证据表);一个只有合看所有视角才可见的隐藏关联;一条针对用户角色的可操作建议(仅四步全跑时输出);一个回答后会改变全局理解的前沿问题。
-
自评:每条发现的置信度;最弱环节;是否有视角被过度代表;是否漏了第 6 个视角;哪些结论只是模型先验、尚未被真实证据支撑。
硬规则(证据落地纪律)
-
模拟视角输出是假设级证据,不是事实。无检索支撑时它反映的是模型先验。每条关键发现必须标注 grounded 或 ungrounded;grounded 仅在本次会话真实执行过的检索/抓取工具调用返回了支撑内容时成立——锚点是会话里可回查的工具调用记录,不是引用长得像不像;证据表须附来源链接和取回的关键摘录,凭记忆写出的 URL、未实际抓取的来源、给不出引用的,一律默认 ungrounded;无法出示工具调用轨迹时整份交付降级为探索性草稿。这是评审可证伪的纪律,不是机械门禁:证据表每个 grounded 行须逐字引用它依据的工具调用(检索词/URL + 取回摘录 + 会话内可回查的调用位置),让评审者能回查证伪;出示不了的行即为 ungrounded。当前会话没有检索/抓取能力时,全部发现强制标 ungrounded,且整份产出只能作为"探索性草稿"交付。(多轮 program 的继承行是唯一例外形态,但它不冒充本会话 grounded——用独立状态 grounded@第N轮 标注,语义与边界见"多轮 program 模式"章。)
-
**载重结论必须真实核验。**数字、归因(谁提出/谁发表)、版本、时间线、以及用户将据以行动的任何结论,在有检索能力的环境里必须用真实检索/一手来源核验后再作为事实呈现;无检索能力时明确声明"未核验"并降低置信度,不得伪装成已核实。
-
支撑重要决策时,正确性核验优先用真实检索 + 独立异构评审(另一个模型/真人 reviewer 做挑战),而不是再加几轮同模型 persona 互辩——后者对覆盖有益、对正确性无稳定增益(见上"主张边界")。
-
矛盾图阶段借用 moderator 机制挖盲区:有检索时,主动看一眼"检索到但没写进任何视角"的信息,从中再生成 1–2 个问题;盲区常藏在被丢弃的检索结果里。
-
**禁止编造引用。**给不出真实可点开的来源就不写来源;宁可标 ungrounded。
-
完整四步交付必须区分三层:共识(各视角同意)、争议(矛盾图)、盲区(无人提及)。把三者混成一篇顺滑的综述是本技能要防止的失败模式。轻量模式(跳过第 2 步)产出争议/盲区两层时须标注"未分析(跳过矛盾图)",不得默认留白冒充无争议。
-
派生聚合值发布前须过源内配平与边界核对。 即使 grounded 的全部条件都满足(来源链接、实际取回的摘录、会话内可回查的调用位置),也不能保证取到之后的加总是对的:法定报表常在同一行同时给出分项与行合计,整行求和即得 2 倍值;反向也会发生——看不懂来源的数被当作解析噪声丢弃,实际是子项合计。进入承重结论的派生聚合值,在来源提供控制总数时必须过一次源内配平(分项之和 vs 源内自述合计;子实体之和 vs 母体自述合计);来源只有微观明细、没有控制总数时改为独立复算 + 边界检查并写出不确定性,不能因为无从配平就否决一个本来合法的聚合值。配平只证明"我没读错这张表",不是独立验证——分项与合计常出自同一口径与同一生成程序,必然相等;配平之后仍须单独查单位、期间、法人与地理范围、唯一键重复、缺失分区。与另一独立口径比量级只是 sanity check:能否证不能确证。配平不上时按诊断顺序走(解析/单位/舍入/版本 → 来源修订与内部矛盾 → 仍不可解释则如实报告冲突、不以确定值进入结论)。被禁止的是"为了配平而反复调参",不是禁止一切解析修正——有来源格式或模式证据支持的修正是正当的(括号负数、千分位、脚注单位),留下改前改后差异与依据即可。方法见 references/public-disclosure-channels.md。
-
负结果进承重结论前必须先过判别力对照——"确实没有关系"与"度量根本检不出关系"在观测上不可区分。 任何承重的负结果(两组无对应、某通道查无此人、加了变量没有差异)都有一个孪生解释:所用的匹配规则、相似度或管线本身检不出任何东西,坏掉的工具返回的结果与真实的"无"逐字相同。所以负结果只有在方法被证明"能在已知存在对应的情形下检出"之后才算发现,否则只是未测,不得写成已否证。两种自建对照(都不需要外部真值):
- 阳性对照(自匹配):把同一实体的数据按与结论无关的维度劈成两半,各自建档,问 A 半在所有 B 半档案里的最近邻是不是它自己——同一批对象、同一批特征,这是方法必须找到的对应。找到了,则原负结果是关于被测对象的;找不到,则方法太弱,本轮负结果降级为"未测"。但自匹配只有在剔除标识性捷径后才算数:两半若共享直接标识符(同一 ID、同一姓名串、同一唯一短语),或共享只有目标侧才有的特征,自匹配会靠这些捷径成功,而真实任务里两侧根本没有这种共享——于是方法"通过"了对照却仍检不出跨组关系。构档时按真实任务的可见特征建,把捷径特征剔掉再做自匹配;剔不掉的,说明这个对照对该负结果不适用,另找对照或如实记未测。
多轮 program 模式
同一对象/主题的调研跨多轮或多会话推进(下轮建立在上轮产物上)时,除上述各节外,按本节节拍执行;单轮一次性调研不适用。本节的统一原则是质量基础设施前置:charter/estimand/口径先于抓取(默认序——换序仍走上文"基线顺序"条的既有例外与记录义务,限窗源可先抓后立口径,但承重结论前必须冻结)、渲染管线始于第一张图、载体登记始于第二载体;写作基准先于初稿、读者版/工作版分离在满足适用条件且 owner 同意时同样前置(这两项的适用条件、时点与授权门归 tighten-doc,此处只是指针不另立规则)。这组前置针对的是一次多轮 program 复盘中实际观察到的返工类型——事后补都付过纠偏成本。初始证据来自一次多轮组织调研的复盘:该 program 最大的两类返工——发布载体不同步(跨多会话被反复纠正)与每轮由用户重述「目标是什么/做到哪了」——都不是规则缺失,而是轮节拍上缺机械检查点。
- 轮起点两问,必答后再动手:(1) program-state note 在哪——随产物存放的状态记录,登记唯一 canonical 位置,内容至少含 program 目标 / covered-through 已覆盖轮次 / 下一步 / 最后更新轮次。无则本轮建立;有则先对账再定本轮范围,让「今天目标完成了么」可即答;发现多份 state note 或内容分叉时,先对账合一再开工,不得任选一份继续。note 按单写者假设运作:同一时刻只有一个会话推进 program,开工时在 note 记「第 N 轮开工 + 计划动的载体」(这本身是一次写入,同样更新最后更新轮次),此后每次写回前核对最后更新轮次仍是自己上次写入的值——不一致说明有并发写入,停下对账(并行推进须显式分工与隔离,归并发执行类技能);重启会话看到开工记录而 covered-through 未推进 = 上轮做了一半,先确认原会话确已终止(不能确认就问用户,不得径直接管),再盘点半成品载体继续,不得当作稳定产物。program-state note 与载体登记表、零损清单一样是工作记录:随工作版或访问受控的工作区存放,不进 reader-facing 发布目录,整目录发布/分享前先排除。(2) 本轮 estimand 与口径是否与既往轮一致——口径变更不是记一句就完:变更须版本化(新旧口径并记),列出受影响的既有结论/覆盖矩阵行/派生物并逐项重开或显式封存;covered-through 按口径分支分别记录,不得用一个全局水位横跨两个口径;不同口径的数字不得混入同一结论,加脚注不算处置(同口径纪律见上"趋势与对比"条)。
- 跨会话证据继承走证据表,继承不等于常青:多轮 program 中,上轮证据表的
grounded 行(来源链接 + 取回摘录 + 当轮可回查的调用位置)就是本轮引用该发现时的可回查锚点——继承行用独立状态 grounded@第N轮(不写作也不等于本会话 grounded——硬规则的"本次会话真实执行/无检索能力全 ungrounded"约束只管本轮新增主张,继承行保持其历史轮次标注);继承的是原主张原文与其口径——任何改写、聚合、外推或口径迁移都构成新主张,按硬规则本轮重新 grounding,不得挂在旧证据行下。但历史 grounded ≠ 当前仍 grounded:来源内容可能已更新,时效敏感的主张(覆盖预检里标了时效类别的)在载重引用前按其时效要求复核或复取;未复核的继承行标「第 N 轮取回、未复核当前版本」。上轮证据表行缺链接或缺摘录、或来源已不可达且结论载重时,按既有规则降级或本轮重取。
- 第二发布载体出现的当刻,建载体登记表;转入 program 模式时回溯盘点既有载体:本地正文、云端文档、画板/白板、渲染图表、静态导出件各一行(
载体 | 位置 | 状态(active/retired/superseded/ephemeral) | canonical 派生自哪个源 | 最后同步轮次);派生关系单向(从 canonical 正文出发),不得循环。从此每轮只要动了任一 active 载体,收尾跑一次机械的载体一致性校验(脚本或逐行核对清单皆可,但要可判定);校验器先按上面"先证明检查器能报失败"的规则自测;校验谓词钉在结构与实体上,且对承载性字段比对值/单位/口径/限定及其宿主对应关系**(哪个值挂在哪个实体/系列/行上——值集合都在但对应关系接错同样判红;同一字段跨载体冲突判红),并核输入身份与新鲜度;不钉在文件名或标题词表上,也不满足于"实体在场"的存在性检查**——载体改名后,词表谓词要么误报(假红),要么在校验器仍读陈旧文件或按名跳过时静默通过(假绿),后者更危险。载体退役解除同步义务,但退役是动作不是宣称:以只读标旧或重定向实现(superseded 须记后继指针),之后才能改状态;已暴露的载体不得标 ephemeral 逃逸同步(生成过共享链接、发给过他人、放入过共享位置即算暴露,不以"有没有人看过"判定);带协作评论的载体退役不删除(comment-safe 红线归 tighten-doc),删除须用户明确授权;仍在流通的旧载体不因"不想再同步"而退役。单载体交付无本条义务。
- 轮收尾按暴露面收尾:判据不是本轮干了什么,而是本轮是否把承载性结论或载体暴露给他人消费。正式传播或供决策使用:暴露面按 Closeout 章的表族收尾;owner 索要或同意先行过目时,未闭合数字走 provisional 通道——限具名收件人且载体访问面同样只限这些收件人(放进继承组织可见权限的云文档不算具名,先收权限或换载体)、醒目标「未闭合 / 不得据此决策或转发」、附当前证据状态,并把这次暴露记进 state note,不触发全表族;扩大访问面前先补齐交付收尾;一旦发生转发、决策引用或受众扩大,先补齐交付收尾再继续;provisional 不是自授的 Closeout 绕行道;纯内部的取数、管线修复轮:至少更新 program-state note、受影响的覆盖矩阵行与负结果常设节(「语料中无 / 未找到可靠来源 / 走过但无产出的渠道」跨轮累积防重挖,见
references/public-data-acquisition.md §五;抓取失败格如实留空或记状态,不得用估计值填补)。
- :上一轮的取数脚本、解析方法、口径映射是假设级输入,不是可信 oracle——;复验的不变量清单与覆盖记录要求由 §三/§四(增量更新条)单一持有,按其执行。上轮通过不担保本轮:源改版、文件改名、字段漂移会让旧脚本失效,最危险的形态是静默假绿(仍读陈旧文件或按名跳过)。
Closeout
交付研究简报时必须附两张表:覆盖矩阵的关闭结果,以及逐条发现的证据表(每条关键发现一行:发现 | grounded/ungrounded | 来源链接 + 取回摘录,或待核验动作;多轮 program 的继承行可为 grounded@第N轮,语义见"多轮 program 模式"章;grounded 行缺来源 URL 或缺实际取回的摘录任一项,即自动降级为 ungrounded)。另附视角清单(含替换理由)、矛盾图要点、自评结论、建议的下一步(直接可用 / 需人工核验清单 / 转交决策 owner)。任何“完整/深度调研”交付的覆盖矩阵都必须逐行显示用户线索、一手/官方、独立外部、反例/负面这四类;缺一类就是未关闭格,不能靠不列该行视为已覆盖。调研对象是具体组织时,还须附 estimand 说明(目标是单一法人/合并集团/品牌或业务单元/网络、依据、截至日期)与渠道类别走查记录(走过哪些类别、各自查了什么边界、哪些没走或走不动,见 references/public-disclosure-channels.md)。走查记录不产生闭合判断,闭合与降级仍由本章覆盖矩阵按"哪条载重主张 × 哪类证据"裁决;不得把"被挡住"或"取到但不足以关闭"写成"未命中"。不要对渠道集合使用"穷尽/挖完了"这类措辞,也不要写"查过了确实没有"——只写走过哪些类别、各自的检索边界、哪些没走,这才可核。覆盖矩阵有未关闭格时,标题和结论必须降级为“定向/部分调研”,并逐格写出缺口;缺任一张表的交付不合格。本次会话没有任何真实检索调用时,产出必须以"探索性草稿(零检索,全部 ungrounded)"作为首行横幅,且不得以"研究简报/调研报告"命名或宣称——多轮 program 中合格的 grounded@第N轮 继承行除外(保持其历史标注,不降级也不冒充本会话 grounded);强制降级只作用于本轮新增主张。仍为 ungrounded 的发现不得进入"可操作建议"——只能进待核验清单;可操作建议引用的每个来源都必须出现在证据表里,引用了表外来源的交付视为不合格。
- 过程自省不进交付物。 上面几张表是读者判断可信度所需的(覆盖矩阵、证据表、estimand、走查记录、自评);研究者犯了什么错、怎么发现的、下次怎么避免,不是——读者要结论、出处、口径与限制,不要实验日志。多轮调研最易违反:每轮把本轮修订追加到同一份产物,过程叙述越积越多。两个正确去处:修订后的结论就地改写正文(连同口径与限制),可迁移的方法教训沉淀进技能;都不是在末尾加一节轮次日志。
- 错误的呈现形式,加免责声明救不回来。 当结论的形式本身在多说——多对多画成一对一、推断排版成结论、下界写成计数——必须改结构(拆开、改表头、降级措辞、整段撤回);不得只在旁边补一句"这是解读不是验证"就当处置完毕——读者仍按结构去读。判据:把免责声明删掉,剩下的还在主张什么——仍超出证据就改它。免责声明只对"结构正确但证据不足"有效。