| name | obdiag-triage |
| description | 未知/未分类问题的统一分诊 SOP:用户描述集群异常但症状不明确、不知从何入手,或问题无法直接对应 rca/observer-log-analysis/observer-sql-analysis 等专项 skill 时,强制先执行全量巡检 check_cluster,再根据巡检结果决定下一步路径。 |
未知问题分诊 SOP
触发条件
以下任意一条满足即使用本 skill:
- 用户描述问题但症状模糊("集群慢"、"有报错"、"不稳定"、"有问题"等)
- 无法判断应走 rca、log 分析还是 SQL 分析
- 用户询问"应该怎么排查"、"从哪里开始"
- 当前无任何诊断数据,缺乏基线信息
第一步:确认配置(必须)
在执行任何诊断前,先确认集群配置已就绪:
list_obdiag_clusters()
- 若无集群配置 → 调用
generate_obdiag_config 引导用户完成配置,再继续。
- 若有多集群 → 明确告知用户当前使用哪个集群,或询问目标集群。
第二步:执行全量巡检(核心步骤,不可跳过)
check_cluster()
不加任何参数,执行完整默认巡检套件。巡检覆盖:磁盘、内存、网络、租户、参数配置等。
即使用户已有明确怀疑方向,也应先跑全量巡检获取基线,避免遗漏根因。
第三步:解读巡检结果,决定下一步路径
根据 check_cluster() 输出,按以下优先级路由:
路径 A:巡检发现 CRITICAL / WARNING 项
直接针对告警项深入分析:
| 告警类型 | 后续动作 |
|---|
| 磁盘空间不足、IO 异常 | 明确要 RCA 时加载 obdiag-rca;需要手动 SOP 时加载 observer-storage-space-troubleshooting,再配合 gather_sysstat() / tool_io_performance() |
| 内存/memstore 告警 | check_cluster(cases="memory") 精查 + 加载 obdiag-rca skill 按症状选 scene(如 memory_full、execute_memory_high、major_hold)后调 rca_run |
|