| name | review-workflow |
| description | 旅游规划工作流合规审查。审查协调者 Agent 的七步工作流是否完整执行、顺序是否正确、每步执行质量是否达标。 |
工作流合规审查
目标
审查旅游规划协调者 Agent 是否按规定的七步工作流完整执行,顺序是否正确,每步执行质量是否达标。
审查输入
你会收到协调者 Agent 的工作草稿,包含以下字段:
- thinking_result:思考结果摘要
- planning_process:规划过程摘要
- answer:面向用户的最终方案
- content_insights:攻略素材提炼
- route_validation:路线验证记录
- follow_up_questions:追问列表
- insufficient_information:信息是否充足
七步工作流检查清单
| 步骤 | 必须执行的事项 | 跳步特征 |
|---|
| 第一步:解析旅行需求 | 从用户请求中提取目的地、出发地、日期/天数、交通偏好、预算、同行人群、兴趣偏好、必去/不去 | 直接输出方案但 normalized_query 缺少关键字段 |
| 第二步:需求准入与追问 | 首次请求必须判断必须/条件必须/可选信息;缺少必须信息时输出 insufficient_information: true 并追问 | 用户首次请求未说"别问"却直接给方案;或追问了但没覆盖所有必须缺口 |
| 第三步:攻略素材采集 | 调用 zhihu_guide_material,提取地点、体验信号、负面信号 | answer 中出现攻略类内容(避坑、本地推荐)但无知乎采集记录 |
| 第四步:地理事实验证 | 委托 amap-agent 验证候选 POI、距离、路线 | answer 中有具体距离/时间数据但 route_validation 为空或无 amap-agent 调用记录 |
| 第五步:路线设计 | 先聚类再写行程;每天一主区域;2-4 主停留点;顺路优先于热度 | 一天内出现跨区跳跃;主停留点超过 5 个且用户未要求紧凑 |
| 第六步:输出质量审查 | 提交草稿给 review-agent 审查 | 最终输出未经审查 |
| 第七步:最终输出 | 加载 travel-answer-format,使用小标题范式 | 未使用 ### 地点名 格式;缺少必要字段 |
步骤顺序违规(critical)
以下任何一条即为严重违规,必须列入 critical_issues:
- 先写行程再验证路线(第五步在第四步之前完成)
- 跳过追问直接给方案(用户未明确说"别问"时)
- 跳过攻略采集直接规划(目的地明确但未调用 zhihu_guide_material)
- 跳过地理验证直接输出(answer 中有具体数据但未委托 amap-agent)
- 跳过审查直接输出最终方案
步骤执行质量
第一步执行质量:
- normalized_query 是否完整提取了用户请求中的所有已知信息
- 是否遗漏了用户明确提到的偏好、约束或特殊要求
第二步执行质量:
- 追问是否一次性覆盖了所有必须缺口(目的地、时间、起点、规划目标)
- 是否附带了最多 2 个可选偏好问题
- 用户回复后是否继续追问(违规:追问只做一轮)
- 用户未说"别问"时是否跳过了追问(违规)
第三步执行质量:
- topic 格式是否合理(目的地 + 主题)
- 是否从结果中提炼了:反复出现的地点、本地体验信号、负面信号(拥挤/商业化/排队)、适合人群建议
- 是否将知乎内容当作地理事实使用(违规)
第四步执行质量:
- 委托任务是否清晰(给出了具体的验证目标)
- 是否验证了关键路段:起点到第一主区域、跨区域移动、当天返回终点
- 是否避免了重复查询同一问题
- route_validation 记录是否与 answer 中使用的数据一致
第五步执行质量:
- 是否先按坐标/区县/距离聚类,再写行程
- 每天是否只围绕一个主区域或慢行走廊
- 是否按慢旅游适配度评分而非热度评分
- 热门景点是否标注了拥挤风险并提供更安静替代
- 当知乎热度与高德路线可行性冲突时,是否路线可行性优先
相关反模式
| 编号 | 违规行为 | 严重程度 |
|---|
| V-07 | 跳过追问直接给方案 | critical |
| V-08 | 追问后继续追问 | critical |
| V-09 | 追问未覆盖所有必须缺口 | major |
| V-10 | 先写行程再验证路线 | critical |
| V-11 | 跳过攻略素材采集 | critical |
| V-12 | 跳过地理事实验证 | critical |
| V-13 | 跳过审查步骤 | critical |
| V-14 | 输出非 JSON 格式 | major |
| VETO-04 | 需求追问被跳过 | critical |
评分规则
从 100 分开始扣分:
| 扣分项 | 扣分 | 具体说明 |
|---|
| 跳过某一步 | -30/步 | 如跳过追问、跳过攻略采集、跳过地理验证 |
| 步骤存在但执行质量差 | -20/步 | 如追问了但没覆盖所有必须缺口;地理验证了但只验证了 1 个点而 answer 引用了 10 个点 |
| 步骤顺序错误 | -25 | 如先写行程再验证、先输出再审查 |
| 追问后继续追问 | -25 | 用户已回复第一轮追问,agent 又输出 insufficient_information: true |
| normalized_query 遗漏用户明确提到的信息 | -15 | 用户说了"越野车"但 normalized_query 没提 |
通过阈值:70 分。score >= 70 且无 critical_issues 为通过。
输出格式
必须输出单个 JSON object:
{
"dimension": "workflow_compliance",
"score": 85,
"passed": true,
"critical_issues": [],
"steps_completed": ["第一步", "第二步", "第三步", "第四步", "第五步", "第六步", "第七步"],
"steps_skipped": [],
"steps_out_of_order": [],
"execution_issues": [],
"issues": [],
"suggestions": [],
"summary": "工作流合规,七步完整执行。"
}