| name | claim-verification |
| description | 对一段陈述/视频/文章/分析报告做真实性验收:拆解论点链 → 联网核查关键数据 → 找出反方证据 → 输出可点击的 8 维度红绿灯诊断与最终客观判断。当用户说"帮我看看这个说法靠不靠谱 / 验证真实性 / 反方观点是什么 / 这是不是泡沫 / 帮我做一个验收 / 这观点合理吗"时调用。 |
Claim Verification(陈述真实性验收)
What this skill does
把"一段有结论的内容"(视频转录、公众号文章、研报、社交媒体长帖、他人分析报告、自己写的草稿)当成被告,执行结构化的真实性验收流程:
- 拆解论点链:把"事实 / 因果 / 判断"三层剥开,明确哪些是可证伪命题。
- 联网交叉核查:对关键数据点用 ≥2 个独立信源验证,并显式标注信源的议程属性。
- 强反方搜寻:主动找出最强反方论据(不是稻草人),评估对原结论的破坏力。
- 8 维度红绿灯诊断:用统一的验收表给出可视化判定。
- 输出客观最终判断:用"事实/机制/判断"三层定性 + 实操建议,替代原文的情绪化结论。
核心价值:把"读完很有道理"的内容,过一遍反爆款过滤器,让用户拿到一个 6 个月后回看也站得住脚的判断。
When to invoke
满足以下任一即调用:
- 用户说"帮我看看这个说法 / 验证一下真实性 / 这观点合理吗 / 帮我做个验收"
- 用户说"反方观点是什么 / 有哪些漏洞 / 缺失了什么 / 设计一个验收结构"
- 用户对前一轮分析报告/视频转录/文章提出"客观看 / 更全面 / 多维度"的要求
- 用户给出爆款财经/政经/科技长文,要求拆穿或证实其逻辑
- 紧接在
youtube-video-analysis 输出 report.md 之后,被显式 hand off 做事实核查
- 用户给出含"信号 / 警示 / 必将 / 一定 / 见顶 / 崩盘 / 泡沫 / 拐点"等高判断性词汇的内容
不适用场景:
- 单纯抽取要点/做摘要(用
meeting-minutes-deep-extraction 或直出)
- 内容本身是定义性/教学性(无可证伪命题,无验收对象)
- 用户只要情绪共鸣不要批判(先确认意图)
Directory Convention
- 当输入来自
out/<videoId>__<slug>/ 的视频 workspace 时,必须遵守 AGENTS.md §1。
- 验收报告默认直接在对话中输出;如用户要求落盘,写入
$WS/verification.md(与 report.md / note.md 并列),禁止覆盖既有文件、禁止写到 out/ 根。
- 报告中所有
file:// 链接必须指向当前 workspace 内文件;跨 workspace 引用需显式注明"对照基线"。
SOP(5 步标准流程,禁止跳步)
Step 1|论点链拆解(Decomposition)
目标:把整篇内容压缩成 3-7 条断言(A/B/C/...),形成可验收的最小单元。
动作:
- 通读原文,识别"事实陈述(数字、事件、引用)"和"因果链(→ → →)"和"最终判断(结论/预测/警示)"。
- 把每条核心断言写成"A 导致 B,因为 C"的可证伪格式。
- 标出每条断言下面所依赖的关键论据(数据、案例、引用专家),形成"断言 → 论据"映射表。
- 标出隐含假设——原文没说但成立才能让因果链工作的前提。
Step 1 产出物:
断言 A:……(事实层 / 因果层 / 判断层)
└ 关键论据 a1: ……
└ 关键论据 a2: ……
└ 隐含假设 a*: ……
Step 2|事实层核查(Cross-Validation)
目标:对所有数字、事件、引用做 ≥2 个独立信源交叉验证。
动作:
- 对每个关键数据点(XX% / 多少亿 / 某机构数据 / 某专家原话)发起 WebSearch,要求:
- ≥2 个独立信源(同一篇报道被多家转载不算独立)
- 优先一手源:央行/统计局/上市公司财报/学术论文/原始 X 帖 > 二级媒体 > 自媒体
- 显式追溯源头:写明"数据 → 媒体 A → 信息源 B(机构/议员/分析师办公室)"
- 对每条核查打一个状态:
- ✅ 完全属实(≥2 独立源印证,数据精确对得上)
- 🟡 部分属实(数字大致对,但表述被简化/夸大/截断)
- ⚠️ 严重存疑(只有单一源 / 印象化论断 / 缺独立验证)
- ❌ 不实(被反向证据推翻)
- 必须显式标注信源的议程属性:政治立场、商业利益、阶段性叙事需求。原文如未披露,本验收必须补上。
Step 2 产出物:事实核查表(断言编号 × 是否属实 × 信源链 × 议程标注)。
Step 3|机制层归因审查(Causal Audit)
目标:检查"因为 X 所以 Y"的因果方向是否唯一/最强。
动作:
- 对每条因果链问 3 个问题:
- 是否倒果为因?(X 是 Y 的结果还是原因)
- 是否单因谬误?(除了 X,还有 X2/X3/X4 同时作用,权重如何)
- 是否指标移植?(借用的理论/指标是否在同一语境下成立——同国、同时期、同方法论)
- 对每条因果至少构造 1 个替代解释,按强度排序(⭐⭐⭐⭐⭐ → ⭐)。
- 标出原文中"框架借用"陷阱:把美国/历史/某行业的指标搬到本案讨论。
Step 3 产出物:因果归因对比表(原文主因 vs 替代解释 1/2/3 + 各自证据强度)。
Step 4|反方搜寻(Steelman Opposition)
目标:主动找出最强反方论据(而非稻草人版反方)。
动作:
- 针对最终判断,问"什么证据能推翻这个结论"——然后去找这种证据。
- 反方至少包含 3 类:
- 学术反方:同行评议论文、经典实证发现(Case-Shiller / NBER / 顶刊 RCT 等)
- 市场反方:与原文方向相反的实际市场行为(外资流向、估值倍数、机构持仓)
- 方法论反方:原文借用的理论/指标是否在学界有方法论批评
- 用 steelman 笔法陈述反方立场(用反方自己最有说服力的表达)。
Step 4 产出物:≥3 个反方立场 + 每个立场的论据 + 对原结论的破坏力评分。
Step 5|综合判断(Triangulation)
目标:给出"事实 / 机制 / 判断"三层独立打分 + 实操建议。
动作:
- 输出 8 维度红绿灯诊断表(见下方"验收标准")。
- 输出"现象 / 原因 / 预警价值"三层分级定性(事实层 vs 机制层 vs 判断层准确率分开打分)。
- 给出可证伪的真正预警指标(替代原文的模糊判断)。
- 给读者一条"以后看到类似内容怎么读"的元方法论。
Step 5 产出物:最终客观判断 + 可证伪指标清单 + 元方法论。
验收标准(Acceptance Criteria)
8 维度红绿灯(输出报告必须包含此表)
| 维度 | 检查项 | 通过标准 |
|---|
| AC-1 事实层 | 关键数字是否在 ≥2 个独立信源交叉验证 | 🟢 全部对得上;🟡 大致对但有截断;🔴 单一源/无法验证 |
| AC-2 来源层 | 数据源头是否有政治/商业议程,原文是否披露 | 🟢 无议程或已披露;🟡 有议程未披露但影响小;🔴 议程化数据被包装为权威 |
| AC-3 因果层 | 原文主因是否是唯一/最强解释 | 🟢 唯一最强;🟡 主因之一但被夸大;🔴 倒果为因或忽略政策/外生冲击 |
| AC-4 框架层 | 借用的理论指标在同一语境(同国/同方法论)下是否成立 | 🟢 同语境;🟡 跨语境但仍可类比;🔴 指标移植谬误 |
| AC-5 反方层 | 是否陈述并驳斥最强反方(≥3 类) | 🟢 学术+市场+方法论全覆盖;🟡 提到但未深入;🔴 完全缺席或只打稻草人 |
| AC-6 隐含假设层 | 是否把"幸存者偏差"案例当趋势证据 | 🟢 无;🟡 有但已加免责;🔴 把孤例当趋势 |
| AC-7 规模层 | 异常资金流/数据点是否大到足以构成系统信号 | 🟢 占大盘 >X% 有意义;🟡 边际;🔴 < 0.1% 却被说成"潮" |
| AC-8 预测层 | 是否给出可证伪的触发条件 | 🟢 给出明确指标+阈值;🟡 给出方向无阈值;🔴 模糊预言 |
判定规则:
- 8 项 ≥6 绿:内容站得住,可信赖。
- 8 项 4-5 绿:核心事实可用,结论需大幅修正。
- 8 项 ≤3 绿:典型"事实正确 + 框架借用 + 结论放大"的爆款写法,经不起跨指标交叉验证,建议读者降级到"情景假设"而非"因果预测"。
报告交付硬性 AC
| 编号 | 标准 |
|---|
| D-1 | 必须包含 Step 1-5 的全部产出物,不允许跳步 |
| D-2 | 事实核查表每行必须有可点击信源链接 |
| D-3 | 反方立场必须 ≥3 类,且用 steelman 笔法 |
| D-4 | 8 维度红绿灯表必须完整填写 |
| D-5 | 最终判断必须分"事实/机制/判断"三层独立打分 |
| D-6 | 必须给出至少 1 条"可证伪的真正预警指标" |
| D-7 | 所有 file:// 链接指向当前 workspace 内文件 |
| D-8 | 对在世人物的判断性内容,区分"主张/事实/推论",避免事实化传谣 |
重要原则(Operating Principles)
1. 信源权重原则
一手源 > 二手转载 > 自媒体加工。同一份韩联社数据被 5 家媒体转载,仍然算 1 个独立源。必须沿信源链回溯到"数据生产者"(央行 / 统计局 / 议员办公室 / 公司财报 / 学术原文),并标注其议程属性。
2. 议程显式化原则
任何数据都有生产者,任何生产者都有目的。反对党议员办公室的数据可以用,但必须显式标"出自反对党议员办公室,目的是攻击执政党政策"。原文未披露的,本 skill 必须补上。
3. Steelman 反方原则
反方必须用反方自己最有说服力的版本陈述,禁止稻草人。如果反方论据强到能动摇原结论 30% 以上,必须在最终判断中显式反映。
4. 跨语境指标警觉原则
借美国指标证韩国/中国市场风险 = 红色警报。任何"达利欧说" / "巴菲特指标" / "席勒 PE" 在跨国/跨周期应用时,必须先问"本土版本数值是多少",未给出本土数据就用别国指标做警示,自动降级到 🔴。
5. 政策因果与市场因果分离原则
当现象同时受政策外生冲击(限购、加息、补贴)和市场内生反馈(情绪、估值、配置)驱动时,必须分开归因并标权重。混在一起讲的就是伪深度。
6. 规模即真伪原则
被描述为"潮 / 浪 / 趋势"的资金流/人群行为,必须算占大盘的比例。< 0.1% 不构成趋势,只是统计噪音被叙事化。
7. 可证伪原则
最终判断必须给出可证伪的指标 + 阈值 + 时间窗。"可能反转 / 值得警惕 / 已现端倪"这类模糊语必须翻译成"如果 X 指标在 Y 时间内突破 Z 阈值则证伪"。给不出的,自动降级。
8. 三层准确率分离原则
"事实层 90% 准确 + 因果层 60% 误读 + 判断层 30% 牵强"是典型爆款配方。验收报告必须把这三层分开打分,避免"事实对所以结论对"的传染性谬误。
9. 反方相对原文的破坏力评分原则
对每个反方立场打分:能否(a)削弱论据强度(b)翻转因果方向(c)推翻最终判断。三项打勾越多,原结论越脆弱。
10. 中立交付原则
本 skill 不站队。既不为了"打脸"而过度否定(用户可能恰好爱看),也不为了"温和"而打折扣评估。打分按证据给,不按情绪给。
Output Template(固定 7 节结构)
# 🔍 真实性验收报告|<主题>
> **被验收对象**: <原文路径 / URL / 视频 ID>
> **验收日期**: 2026-MM-DD
> **验收依据**: claim-verification SOP v1
---
## 总判(30 秒结论)
<3-5 句话,包含:核心断言 + 红绿灯总分 + 最大缺陷 + 替代解读>
---
## Step 1|论点链拆解
- 断言 A(事实层): ……
- 断言 B(因果层): ……
- 断言 C(判断层): ……
- 隐含假设: ……
---
## Step 2|事实核查表
| # | 原文论据 | 状态 | 信源链 | 议程标注 |
|---|---|---|---|---|
| 1 | …… | ✅/🟡/⚠️/❌ | [源A](url) + [源B](url) | …… |
---
## Step 3|因果归因审查
| 断言 | 原文归因 | 替代解释 1 | 替代解释 2 | 主因权重 |
|---|---|---|---|---|
---
## Step 4|反方立场(Steelman)
### 反方 1:学术反方
…… [论据链接](url)
**破坏力**: 削弱论据 ☑ / 翻转因果 ☑ / 推翻判断 ☐
### 反方 2:市场反方
……
### 反方 3:方法论反方
……
---
## Step 5|8 维度红绿灯诊断
| 维度 | 检查项 | 红绿灯 | 说明 |
|---|---|---|---|
**红绿灯总分**: X 绿 / Y 黄 / Z 红 → <可信赖 / 需修正 / 经不起验证>
---
## 综合判断(三层独立打分)
- **事实层准确率**: NN%
- **机制层准确率**: NN%
- **判断层准确率**: NN%
**真正应该盯的可证伪指标**:
1. ……(阈值 X,时间窗 Y)
2. ……
**给读者的元方法论**: <一句话能带走的判断框架>
Examples(触发场景)
- ✅ "帮我验证一下这个视频说的韩国卖股买房是不是真的预警信号"
- ✅ "这篇财经文章的逻辑有问题吗?反方观点是什么?"
- ✅ "对刚才那份 report.md 做一个真实性验收"
- ✅ "假设我想验证这个说法的合理性,你会如何设计验收结构?"
- ❌ "帮我总结一下这篇文章"(→ 用摘要类 skill)
- ❌ "把这份分析归档"(→ 用
research-to-knowledge-note)