| name | relay-verify |
| version | 1.0.0 |
| description | 验证AI中转站声称的模型是否真实。通过指纹题库、推理深度分析、延迟画像、
输出质量评分等多维度交叉验证,判断中转站是否用低端模型冒充高端模型。
Use when: "验证模型", "verify model", "模型真假", "是不是Opus", "中转站验真".
|
| allowed-tools | ["Bash","Read","Write","AskUserQuestion"] |
/relay-verify — 模型验真
核心问题
很多中转站声称提供 Claude Opus,实际使用:
- Claude Sonnet 冒充 Opus(最常见)
- Claude Haiku 冒充 Sonnet
- 国内模型冒充 Claude
- 蒸馏模型冒充原版
验证方法
1. 推理深度测试(权重最高)
发送需要深度思考的问题,Opus 的回答质量明显优于 Sonnet/Haiku:
测试题: "12个球称重问题" — 需要完整的决策树
- Opus: 详细的3步策略,覆盖所有情况 (>800字)
- Sonnet: 基本正确但可能不完整 (400-800字)
- Haiku: 简化或不完整 (<400字)
2. 经典思维陷阱
"球拍和球总共$1.10,球拍比球贵$1.00,球多少钱?"
正确答案: $0.05
- Opus: 几乎100%正确,会展示详细推导
- Sonnet: 95%正确
- Haiku: 容易回答$0.10(直觉陷阱)
3. 延迟画像
不同模型有固有的延迟特征:
- Opus TTFT: 800-5000ms(思考时间长)
- Sonnet TTFT: 300-2000ms
- Haiku TTFT: 100-800ms(最快)
如果声称Opus但TTFT<300ms,极可能是冒充。
4. 代码生成质量
"写一个验证IPv6地址的JavaScript函数"
- Opus: 处理所有边界情况,代码优雅
- Sonnet: 基本正确
- Haiku: 可能遗漏边界情况
5. 中文能力对比
"用中文解释量子纠缠,100字以内"
不同模型的中文表达流畅度和准确度有差异
使用流程
- 用户提供中转站信息
- 依次发送指纹题库中的问题
- 从多个维度评分
- 交叉验证得出结论
- 输出验证报告
置信度解读
| 置信度 | 含义 |
|---|
| 90-100% | 非常确定,多项证据一致 |
| 70-89% | 较确定,大部分证据一致 |
| 50-69% | 不确定,证据矛盾 |
| <50% | 无法判断,建议增加测试 |
判定结果
- ✅ authentic — 模型验证通过
- 🟡 likely_authentic — 可能真实但不确定
- ⚠️ suspicious — 可疑,多项指标不符
- ❌ fake — 确认造假
局限性
- 中转站可能在system prompt中指示模型伪装
- 延迟受网络环境影响
- 需要多次测试取平均值
- 模型更新后指纹可能变化