| name | minutes-quality-eval |
| description | 评估或对比会议纪要/访谈整理/深度纪要的质量:对照原始转录核查保真度,盘点覆盖度,输出多维度打分与失真清单。适用时机:(1) 用户问"这两份纪要哪份质量更高/写得更好",(2) AI 生成的纪要发布前验收(有没有幻觉、编造、立场写错),(3) 给纪要挑毛病/做质检/打分。触发语:评估纪要质量、对比纪要、纪要靠谱吗、纪要验收、纪要打分、哪份纪要好。 |
会议纪要质量评估(对照原文核查版)
核心原则
纪要质量的第一维度是保真度,而保真度只能对照原始记录(录音转录、逐字稿)验证。
铁律:绝不拿一份纪要当另一份纪要的 ground truth。 两份纪要对照互读只能发现"它们不一致",不能告诉你谁对——两份都错时你会跟着错,而"较好那份"自身的失真(它才是你要背书的文档)永远发现不了。实测中,跳过原文的评估漏掉了较好那份唯一的实质性错误(一处人物关系写反),却对它打出了最高保真分。
适用判断
- 适用:对比多份纪要优劣;单份纪要发布前验收;AI 生成纪要的幻觉检查
- 降级出口:找不到原始记录(用户没给、目录里没有、录音已删)→ 明确告知用户"只能评结构/合规/可读性,保真度无法评估",保真维度标注 N/A,不得用推断或互相对照代替核查
流程
第 0 步:找到原文(阻塞点)
用户没给原文就先找:同目录下的转录文件(常见名:转录、逐字稿、合并记录、transcript、录音转文字),或直接问用户。找不到 → 走降级出口,这一步不许跳过也不许绕过。
第 1 步:确认各文档定位
内部学习版、对外发布版(Chatham House 脱敏)、行动纪要等定位不同的文档,按各自定位评分:对外版因脱敏删除的内容不算遗漏(单独标【脱敏删除】),但脱敏不构成失真的豁免——匿名化可以删信息,不可以改立场、造共识。
第 2 步:三条证据线(相互独立;原文超长时各派一个并行子代理)
a. 保真度抽查:每份纪要抽 10-15 条高风险表述回原文核对。风险优先级从高到低(按这个顺序选样本,别把配额浪费在低危区):
- 席间共识/多人观点声明("大家一致认为""席间共识")——最高危:单人一句话最容易被升格
- 争论立场归属(谁主张、谁反驳、有没有收敛)
- 精确数字(百分比、金额、工期、人数)
- 原意方向("太难暂不做"会被写成"必须做")
- 直接引语与金句(相对低危,但查归属)
- 人物画像、一手/二手标注
每条给裁决:【忠实】/【有出入+差异说明】/【原文未见】,附原文引句或行号。
b. 覆盖度盘点:先从原文枚举实质讨论单元(有观点交锋、数据、案例、方法论的段落;寒暄闲聊剔除),通常 20-40 个;再对照每份纪要逐单元标【覆盖】【部分覆盖】【未覆盖】【脱敏删除】。产出:各自覆盖率、"只有 X 覆盖"清单、"都漏掉"清单。方向必须是原文→纪要,不是纪要→纪要。
c. 边界检查:纪要若含外部补充资料(论文、报道、benchmark 数据),检查它是否与会场观点分区呈现;重点扫"外部框架/术语混进席间观点"——会场没人提过的公式、行为经济学名词、方法论出现在"席间思维模型"里,就是冒充。
第 3 步:打分
八维度加权(默认权重,可按用途声明后调整):
| 维度 | 权重 | 要点 |
|---|
| 信息保真度 | 25% | 抽查裁决统计;实质性失真(立场写反、虚构共识)有一票否决性质——出现即不能作为合格发布物,不管其他维度多高 |
| 覆盖完整度 | 20% | 覆盖率 + 漏掉的是不是原文最有价值的部分(现场认知转折、未收敛分歧比一般观点值钱) |
| 洞见提炼深度 | 15% | 判断链、思维模型、认知转折是否保留,还是磨平成了正确的废话 |
| 分歧与共识忠实呈现 | 10% | 未收敛的争论是否如实标注,还是被写成了定论 |
| 外部核证质量与边界 | 10% | 引用可点击、分区清晰;有没有主动收录【矛盾】反例(只找支持项是负分项) |
| 可操作性 | 8% | 有没有可照做的 playbook、案例"带走"要点 |
| 敏感信息合规 | 7% | 按文档定位评:对外版查脱敏执行,内部版查是否附发布前脱敏指引 |
| 结构与信噪比 | 5% | 导航、分层阅读路径、篇幅与信息密度的平衡 |
第 4 步:输出
结论先行(谁更高、总分、一句话定性)→ 维度得分表(每格附关键证据)→ 失真清单(按严重度排序,每条带原文证据)→ 加分项对照 → 修复建议(区分"必须修的失真"和"值得补的遗漏")。
已知失真模式(抽查时按此清单扫)
来自实测的九种高发模式,纪要读起来越流畅越要警惕:
- 立场写反:把 A 反驳的观点写成 A 主张的(常发生在争论被压缩成单句结论时)
- 单人升格为共识:"某人说过一句"变成"席间共识""多人补充"
- 外部资料冒充会场观点:编纂者检索到的公式/名词/框架写进"席间思维模型"
- 数字虚构与精度漂移:原文"下降了一级"变成"85%→95%";几处不同口径的数字被糅合拔高
- 原意反转:"这个问题太难暂不考虑"变成"必须制度化"
- 引言拼接错位:两个人的话拼进一人名下;数字张冠李戴
- ASR 噪音词当概念:转录讹误(谐音错字)未修正反而被当成正式术语展开
- 人物画像拼凑:化名/角色描述与原文对不上,或把到场者的一手判断标成"二手转述"
- 虚构结构:把两个孤立片段拼装成"一场讨论/一个开放问题",原文并无此议程
加分项清单(有则加分,无不扣分)
- 转录噪音修正说明(谐音修正表 + 存疑句的取舍逻辑)
- 时间戳可回溯到原始录音
- 案例分档:已实践 / 失败受挫 / 仅想法未验证
- "待进一步探讨"开放问题清单(未收敛分歧如实留白)
- 内部版自带对外发布脱敏清单
- 外部核证主动收录对会场观点不利的反例
- 分层阅读导航(赶时间/深入/落地各一条路径)
常见错误
| 错误 | 后果 |
|---|
| "两份对照读就能看出好坏" | 循环验证。实测:跳过原文的评估给较好那份打了满分保真,漏掉了它唯一的实质错误 |
| "写得流畅、结构漂亮 = 质量高" | 文风与保真无关。实测中结构最工整的那份恰恰虚构了共识、写反了立场 |
| "抽查引语对得上就够了" | 引语是最不容易错的低危区;共识声明和立场归属才是失真高发区,配额要花在刀刃上 |
| "评估中自己发现的新问题直接写进报告" | 评估者也会幻觉。自己的新发现同样要回原文验证后才能落纸 |
| "对外版内容少,扣覆盖分" | 先区分【脱敏删除】与【真遗漏】,只有后者扣分 |
| "原文太长,读个开头结尾抽查一下" | 覆盖度盘点必须过全文;原文超长就切段派并行子代理,不是少读 |