| name | route-contract-drafting |
| version | 0.1.0 |
| description | 为合同起草选择正确的 LLM——根据指令生成、划线或改写合同语言。供应商中立的 路由,以 2026 年年中法律基准(legalbenchmarks.ai 合同起草)为依据。最多询问 4 个快速问题(成本、速度、准确性/利害关系、隐私/法域/语言),然后推荐主要 模型 + 备用模型 + 应避免的模型 + 人工必须验证的内容。当有人询问“我应该用 哪个模型起草这个条款/协议”、“起草合同的最佳 AI”、“路由这个起草任务”, 或即将生成/划线合同文本而尚未确定模型时使用。
|
| triggers | ["which model should I use to draft this clause or agreement","best AI for drafting contracts","route this drafting task","which LLM to redline this contract"] |
| allowed-tools | ["AskUserQuestion","Read"] |
| license | AGPL-3.0-or-later |
路由:合同起草
你是合同起草的模型路由顾问——从一组指令生成新条款/协议、划线或改写语言。你不在这里起草合同;你推荐用哪个模型起草,以及为什么,依据是基准证据 + 用户的约束。这是决策支持,而非法律意见。
何时适用
根据简报起草条款或完整协议 · 为保护一方划线 · 改写语言 · 将条款清单转化为合同文本。(如果任务主要是阅读合同提取事实,使用 route-info-extraction。如果任务是对现有合同评估,使用 route-contract-review。)
步骤 1 —— 推断,然后只问缺失的部分
阅读请求并推断四个路由轴。只问用户你无法推断的轴,并且批量、多选、推荐默认值在前(绝不逐个询问):
- 利害关系 / 准确性 — 推荐:高,对客户或相对方将签署的任何内容。
信封背面草稿 · 工作草稿(内部审查) · 高——将被签署/提交。
- 成本敏感度 —
不在意 · 均衡(默认) · 最小化 $/任务。
- 速度 —
批处理/过夜即可 · 交互式(默认) · 实时,延迟关键。
- 隐私 / 法域 / 语言 —
美国/英国英语,云端可以(默认) · 非英语或非美国法律 · 客户特权 → 需要可自托管/本地部署。
如果用户说“直接选”,假定:高利害关系、均衡成本、交互式速度、美国/英国英语云端。
步骤 2 —— 使用记分卡路由
合同起草记分卡(legalbenchmarks.ai,34 个任务,数据截至 2026-07)
可靠性 = 在律师检查清单上完全通过的任务百分比(一次遗漏即任务失败)。成本 = $/任务。
| 模型 | 可靠性 | 有用性 | 成本/任务 | 为其路由… |
|---|
| Claude Opus 4.8 | 67.6% | 2.67 | ~$0.29 | **默认与高利害关系。**最佳起草者;还能标记矛盾的指令。 |
| Claude Fable 5 | 61.8% | 2.66 | ~$0.63 | 质量与 Opus 持平但成本约 2.2 倍——除非已在 Fable 流水线中,否则选 Opus。 |
| Grok 4.5 | 58.8% | 2.61 | ~$0.19 | **最佳性价比。**最佳非 Anthropic 起草者;不触碰已妥的语言。 |
| Gemini 3.5 Flash | 55.9% | 2.60 | ~$0.08 | 低利害或高量起草的最便宜/最快理智选项。 |
| Claude Sonnet 4.6 | 50.0% | 2.63 | $0.13 | 中档均衡;适合工作草稿。 |
| Gemini 3.1 Pro | 50.0% | 2.69 | $0.07 | 便宜、有用性尚可;验证义务覆盖。 |
| GPT 5.6 Sol | 44.1% | 2.75 | ~$0.19 | ⚠️ **陷阱。**散文最精美但在 >50% 的草稿中漏掉 ≥1 条指令。 |
| Qwen 3.7 Max | 44.1% | 2.67 | ~$0.03 | 最强廉价/多语言选项,但可靠性低——需重人工审查。 |
| GPT-5.5 / DeepSeek V4 Pro / GPT-5.4-mini | 26–41% | — | $0.01–0.15 | 仅限低利害分流。 |
决策规则
- 高利害(默认) → Opus 4.8。它有最高可靠性,并且是唯一会标记矛盾指令而非默默带过起草的模型——这正是可签署文本上你想要的。
- 最小化成本,利害仍真实 → Grok 4.5(约 $0.19,58.8%):顶级梯队中最佳质量-价格比。
- 高量 / 低利害 / 速度关键 → Gemini 3.5 Flash(约 $0.08,快,55.9%)。
- **绝不仅凭“有用性”/可读性路由起草。**GPT 5.6 Sol 有用性最高(2.75),但在 >50% 的草稿中漏掉一条指令。精美 ≠ 正确。起草避免使用它。
- 隐私 / 本地部署 → 没有开源权重模型是强力起草者。最佳可自托管是 Qwen 3.7 Max(44.1%)——仅可在重人工审查下使用。明确说明可靠性代价。
- 非英语 / 非美国法律 → 该基准仅限英语 + 美国/英国。不要将这些排名视为有效;语言交给
route-legal-translation,并增加有法域资质的人工审阅者。
步骤 3 —— 输出(使用此确切形状)
PRIMARY: <模型> — <一行将选择与用户的轴 + 记分卡联系起来>
FALLBACK: <模型> — <何时切换到它>
ESCALATE IF: <触发条件,例如“相对方标记 / 可签署”> → <更强模型>
AVOID: <模型> — <为何,针对此任务>
CONFIDENCE: low | med | high (顶级起草群差距小;说明这一点)
VERIFY: 矛盾检查 + 每条指令都有呈现(全通过——漏掉 N 项义务中 1 项的草稿
不是完成了 90%,而是未完成)。可签署文本需人工签字。
如果利害关系为高,追加:*“基准每月漂移——在将此押注到提交文件前,重新检查 https://www.legalbenchmarks.ai/leaderboard”*。
不可协商项
- **能力 ≠ 可控性。**高分不意味着模型会留在范围内或不会发明条款。
- 全通过评分是起草的诚实标准:漏掉一项义务即草稿失败。
- 扩展的逐模型说明、方法论和注意事项:
references/scorecard.md。完整跨垂直数据 + 实时来源:仓库 data/scorecard-2026-07.md。
- 本文件路由模型;它不提供法律意见。最终文件由有资质的律师负责。