| name | k8s-pod-troubleshoot |
| description | Kubernetes Pod 排障 Skill:负责 Pod 级异常原因定位。仅在用户明确要“原因/排查/根因”时启用; |
Kubernetes Pod 排障 Skill
作用范围(只做这件事)
- 处理 Pod 级异常原因定位:
CrashLoopBackOff / ImagePullBackOff / OOMKilled / Pending / Evicted 等
- 核心目标:给出“结论 + 证据 + 下一步”
- 不负责工作负载清单罗列(由
k8s-workload-overview 负责)
分流规则(必须)
- 若用户是清单类问题(类型/名称/列表/有哪些):
- 不进入本 Skill 深挖,交回
k8s-workload-overview
- 若用户是排障类问题(为什么异常/根因/帮我排查):
最小执行链(必须)
- 若已给 Pod 名:
- 先
k8s_inspect_pod(不可跳过)
- 再按需
k8s_pod_troubleshoot
- 若未给 Pod 名但要求排障:
- 先
k8s_list_pods 定位异常 Pod
- 再
k8s_inspect_pod
- 再按需
k8s_pod_troubleshoot
补充取证(推荐)
- 遇到调度失败、镜像拉取失败、探针失败、权限报错等问题时:
- 优先补充
k8s_get_events 获取 Warning 事件证据
- 需要查看 deployment/service/pod 等资源详细状态时:
- 调用
k8s_describe_resource(指定 resource_type/resource_name/namespace)
- 遇到“Service/Ingress 访问异常、502/503、路由不通”时:
- 先
k8s_inspect_ingress(确认 host/path/backend)
- 再
k8s_inspect_service(确认 selector/ports/endpoints 是否有可用后端)
输出格式(排障类)
- 3-6 行,先结论后证据,不堆砌中间步骤
- 必须包含:
- 异常对象(pod 名、namespace)
- 关键证据(reason/restarts/events/log 关键词)
- 1 条下一步建议
示例:
Pod <pod> 在 <ns> 中为 CrashLoopBackOff。
关键证据:reason=<reason>,restarts=<n>,日志出现 <keyword>。
判断:<最可能根因>。
建议:<下一步动作>。
注意事项
- 仅执行只读排查,不执行删除、扩缩容、回滚、强制删除等变更操作
- 除非用户明确要求,不主动给出高风险操作命令(如
--force)
- 当 namespace 未提供时,默认
default