| name | narrative-truth-audit |
| description | 对金融/宏观/政经/商业叙事做真实性与逻辑性校验:拆命题→查数据→验结构→找反例→打分→出验收结论。当用户说"帮我验证下这段话 / 这个说法靠谱吗 / 找反例 / 是不是叙事过拟合 / 真伪核查 / 二次考察"时调用。 |
Narrative Truth Audit(金融/宏观叙事真实性与逻辑性校验)
What this skill does
把一段「听起来合理但感觉不对」的金融/宏观/政经/商业叙事,转化为一个可验证的结构化判断问题。
核心不是"否定叙事",而是把叙事拆成事实层 / 结构层 / 因果层三层独立命题,逐层取证、找反例、打分,最后给出"可决策 / 仅供观察 / 叙事驱动不可用"的明确验收结论。
核心价值:抵御"事实是对的,但因果是编的"这一最常见的叙事陷阱。
When to invoke
满足以下任一即调用:
- 用户贴出一段宏观/市场/政经/商业叙事并问"靠谱吗 / 真的吗 / 是不是过度解读 / 帮我验下"
- 用户要求"找反例 / 反向推导 / 二次考察 / 压力测试这段叙事"
- 用户对前序输出(如
youtube-video-analysis 的报告、研报摘录、公众号文章)的因果链表示怀疑
- 用户说"识别叙事型文章 vs 可交易信息 / 过滤噪音 / 反欺诈"
- 紧接在
youtube-video-analysis、research-to-knowledge-note 后做"真伪复核"环节
不适用场景:
- 纯数据查询(直接
WebSearch 或调数据 API)
- 主观审美/口味判断(无可验证命题)
- 已经做过的真伪核查二次复述(不需要重跑 SOP)
三层验证模型(必须按顺序)
Layer 1:事实层(A 是否真的发生过 / 数据是否真实)
Layer 2:结构层(即使 A 为真,是否能支持结论 B)
Layer 3:因果层(A → B 这条因果是否成立,还是仅相关或反向)
关键警觉:大部分"看起来对其实错"的内容,事实层都过得了,问题在结构层和因果层。
SOP 标准流程(6 步,按顺序执行)
STEP 1:拆解原文命题结构(关键起手式)
不要直接判断对错,先拆句子。任何一段叙事都拆成 4 类独立命题:
| 命题 | 含义 | 示例 |
|---|
| P1(数据) | 市场/世界发生了什么 | "KOSPI 突破 3000 点" |
| P2(行为) | 谁在买/卖 | "韩国散户疯狂入场" |
| P3(因果) | 为什么发生 | "AI 半导体牛市驱动" |
| P4(推演) | 未来会发生什么 | "将引发卖股买房潮" |
输出 Step 1 工作单:
## 原文命题拆解
- P1(数据):……
- P2(行为):……
- P3(因果):……
- P4(推演):……
四类命题独立打分独立验证,禁止把它们捆绑成"一对"或"一错俱错"。
STEP 2:事实层验证(Data Check)
按三类数据源逐级核查,每一层都标注来源和获取时间。
2.1 官方市场数据(第一优先级)
- 用于验证指数点位、涨跌幅、权重股贡献、汇率
- 工具:交易所(KRX/NYSE/HKEX/SSE/SZSE)、IMF、World Bank、BIS、公司财报(10-Q/20-F/年报)
2.2 结构数据(比价格更重要)
- 外资流入流出、margin debt(融资余额)、ETF 资金流、居民贷款、M2、社融
- 用来判断"是资金驱动 vs 仅叙事驱动"
2.3 行为数据(防止故事造假)
- 散户开户增量、日内交易占比、成交量结构、贷款用途结构、税务申报
判停规则:
- ❌ 若 P1 数据虚构(指数点位错、涨幅夸大、数据源不可能存在)→ 直接判死,不必继续
- ✅ 若 P1 可验证 → 进入 Step 3
工具偏好:WebSearch 优先官方域名(带 site: 限定);必要时用 WebFetch 拉原始数据页面。
STEP 3:结构层验证(最关键的一步)
回答:"即使数据是真的,它能不能支持这个结论?"
Q1:是否存在更简单的解释(Occam's Razor)?
枚举至少 3 个替代解释,例如:
- 是不是只是行业周期(AI 半导体、新能源、地产)?
- 有没有汇率因素(USD 强弱影响计价)?
- 有没有被动资金/指数纳入驱动?
- 有没有政策事件(降息、QE、监管放松)?
判定:若存在更简单且证据更强的解释 → 原叙事可信度大幅下降。
Q2:关键变量是否同步变化?
填一张变量同步表:
| 变量 | 原叙事预测方向 | 实际数据方向 | 同步? |
|---|
| 股市 | 上涨 | 上涨 | ✔ |
| 房地产成交 | 上涨 | 持平 | ❌ |
| 居民信贷 | 扩张 | 收缩 | ❌ |
| 外资流入 | 流入 | 流出 | ❌ |
判定:≥1 个关键变量不同步 → 因果关系大概率是错的。
Q3:是否遗漏关键变量?
常见遗漏变量清单(每次都过一遍):
- 美元周期(DXY)
- 联储/本国央行利率与缩表节奏
- 被动指数资金、ETF 再平衡
- 期权结构(gamma squeeze、0DTE)
- 财政赤字、政府债发行
- 地缘政治冲击
STEP 4:反例系统(最重要的一步,必须执行)
至少完成 3 类反例,缺一不可。
反例 1:跨国家反例(最强)
"同样条件下,别的国家发生了吗?"
例:若原叙事说"股市涨 → 全民卖股买房",则查美国、日本、台湾、德国近 20 年是否在类似牛市中出现同款行为。
若仅单一国家出现:高度怀疑叙事过拟合。
反例 2:历史反例(时间维度)
"以前类似牛市/危机时发生过吗?"
参考样本:2000 科技泡沫、2008 次贷、2015 中国杠杆牛、2021 美股 meme 行情、1989 日本资产泡沫。
查:"股市→房地产大迁移"是否曾发生?以何种形态?
反例 3:微观行为反例
房屋成交结构、贷款用途结构、税务申报数据、券商开户/销户数据是否支持?
很多"卖股买房"故事在这一层被打穿。
反例 4:极端约束反例(逻辑压力测试)—— 可选但推荐
"如果叙事为真,会触发什么系统性后果?这些后果是否真的出现了?"
- 若所有人同时卖股 → 是否有足够流动性承接?是否会触发熔断?
- 若资金都涌入房地产 → 房价是否会立即翻倍?银行能否承接贷款?
- 若汇率受冲击 → 央行是否会被迫干预?
判定:若叙事为真但未见系统反馈 → 叙事忽略了约束条件,可信度下降。
STEP 5:因果强度评分
对每条命题(P1/P2/P3/P4)按 5 个维度打分(0-5 分):
| 维度 | 问题 |
|---|
| 数据真实性 | 是否可被独立来源验证 |
| 因果直接性 | 是否直接导致结果(vs 相关/反向) |
| 变量完整性 | 是否遗漏关键变量 |
| 跨市场一致性 | 是否全球/跨市场存在同模式 |
| 历史一致性 | 是否曾在历史上发生过 |
单条命题满分 25:
| 总分 | 判级 | 行动 |
|---|
| 20-25 | 🟢 强因果 | 可作为决策依据 |
| 15-19 | 🟡 中等可信 | 仅供观察,加更多约束 |
| 10-14 | 🟠 弱因果 | 不可决策,仅作参考 |
| < 10 | 🔴 叙事驱动 | 拒绝采纳,警惕信息源 |
STEP 6:最终验收(必须出明确结论)
通过验收 = 同时满足以下 3 条:
- 数据可被独立来源验证(非二手新闻、非纯叙事媒体)
- 关键变量同步变化(股市 + 信贷 + 房地产 + 外资 方向一致)
- 跨国家或历史存在一致模式(至少 2 个以上类似案例)
❌ 任一条不满足 → 不可作为决策依据,必须在结论中明示。
输出模板(Markdown)
执行 SOP 后,按以下模板输出审计报告:
# 叙事真伪审计报告
## 0. 元信息
- 待审叙事来源:<URL / 文件 / 用户原话>
- 审计日期:<YYYY-MM-DD>
- 审计工具版本:narrative-truth-audit v1.0
## 1. 原文命题拆解(Step 1)
- P1(数据):……
- P2(行为):……
- P3(因果):……
- P4(推演):……
## 2. 事实层核查(Step 2)
| 命题 | 来源类型 | 链接/路径 | 核查结果 | 置信度 |
|---|---|---|---|---|
| P1 | 官方数据 | …… | ✅/⚠️/❌ | … |
## 3. 结构层分析(Step 3)
- Q1 更简单解释:…
- Q2 变量同步表:…
- Q3 遗漏变量:…
## 4. 反例集合(Step 4)
- 跨国反例:…
- 历史反例:…
- 微观行为反例:…
- 极端约束压力测试:…
## 5. 因果强度评分(Step 5)
| 命题 | 数据 | 因果 | 变量 | 跨市场 | 历史 | 合计 | 判级 |
|---|---|---|---|---|---|---|---|
| P1 | 5 | - | - | - | - | … | … |
| P3 | 4 | 2 | 1 | 0 | 1 | 8 | 🔴 |
## 6. 最终验收结论(Step 6)
- 数据可独立验证?✅/❌
- 关键变量同步?✅/❌
- 跨国/历史一致?✅/❌
- **是否通过验收**:✅ 可决策 / 🟡 观察 / ❌ 拒绝
## 7. 通过的点 vs 不通过的点
### ✔ 成立的部分
- ……
### ❌ 不成立的部分
- ……
## 8. 给用户的一句话结论
> ……
## 9. 反欺诈速判口诀回顾
1. 数据是真的吗?
2. 有没有更简单解释?
3. 其他国家发生了吗?
4. 有没有遗漏关键变量?
5. 如果是真的,系统会不会崩?
快速判断口诀(5 句)
任何叙事先问 5 句,能挡掉 80% 噪音:
- 数据是真的吗?(事实层)
- 有没有更简单的解释?(Occam)
- 其他国家发生了吗?(跨国反例)
- 有没有遗漏关键变量?(结构完整性)
- 如果是真的,系统会不会崩?(极端约束)
工具使用建议
- 数据核查:优先
WebSearch + 官方域名(site:krx.co.kr、site:imf.org、site:federalreserve.gov、site:stats.gov.cn)
- 原文抓取:
WebFetch 拉取报告/新闻原文,避免二手转述
- 跨视频对照:若需引用同目录其他视频的审计结论作对照基线,按 AGENTS.md §2.3 显式注明,禁止隐式跨 workspace 引用
- 结果落盘:
- 若审计对象是某视频的
report.md / note.md,审计报告追加到同 workspace 的 note.md(新增"§ 真伪审计"章节),或单独写到 out/<videoId>__<slug>/audit.md
- 若审计对象是独立研究素材,按用户指定路径或 inline 直出
- 严禁在
out/ 根新增审计文件
反模式(禁止行为)
- ❌ 跳过 Step 1 直接给结论
- ❌ 只验事实层就宣称"通过" / "不通过"(结构层和反例必须做)
- ❌ 反例只举一类(必须 ≥3 类)
- ❌ 评分没有依据(每个维度分数必须能指回 Step 2-4 的证据)
- ❌ 结论模糊("似乎有点问题" "可能不太对")—— 必须给出 🟢/🟡/🟠/🔴 之一
- ❌ 把"叙事驱动"等同于"作者撒谎"—— 区分"事实错 / 因果错 / 推演过度"三类瑕疵
进阶(Optional)
完成基础 SOP 后,可追加:
- 信息源画像:作者/媒体的历史命中率、立场偏好、利益相关
- 叙事生命周期定位:当前处于"早期信号 / 共识形成 / 拥挤交易 / 反转"哪一阶段
- 可交易性分级:即使叙事为真,是否已被价格充分定价(alpha 已被吃掉?)
这三项构成「金融信息反欺诈模型 v2」的扩展层,按需开启。