| name | spatial-clustering |
| description | 空间聚类与热点分析技能。运用全局Moran's I、局部LISA和Getis-Ord Gi*方法识别空间聚类模式和热点区域。 |
| metadata | {"domain":"gis","version":"2.0","intent_triggers":"cluster, hotspot, 聚类, 热点, Moran, LISA, 空间自相关, Getis-Ord"} |
空间聚类与热点分析技能
技能概述
空间聚类分析用于回答"空间现象是否存在聚集模式"这一核心问题。本技能
提供从全局检验到局部定位的完整分析链:先用全局 Moran's I 判断整体是否
存在空间自相关,再用局部 LISA 和 Getis-Ord Gi* 精确定位聚类区域。
全局空间自相关:Moran's I
指标含义
Moran's I 衡量空间数据的整体聚集程度:
| I 值范围 | 含义 | 解读 |
|---|
| I > 0 | 正空间自相关 | 相似值趋于聚集(高值靠近高值) |
| I ≈ 0 | 空间随机分布 | 无明显空间模式 |
| I < 0 | 负空间自相关 | 相异值趋于相邻(高低值交替分布) |
I 的理论范围为 [-1, 1],但实际值取决于空间权重矩阵结构。
统计显著性检验
- p 值 < 0.05:在 95% 置信水平下拒绝"空间随机"零假设
- p 值 < 0.01:在 99% 置信水平下显著
- p 值 ≥ 0.05:不能拒绝零假设,空间模式可能是随机的
推荐使用置换检验(permutation test, 999 次)而非正态近似,
因为空间数据通常不满足正态分布假设。
决策规则
如果 p < 0.05 且 I > 0 → 存在显著空间聚类,继续局部分析
如果 p < 0.05 且 I < 0 → 存在显著空间离散,检查数据特征
如果 p ≥ 0.05 → 无显著空间模式,聚类分析意义有限
局部空间自相关:LISA
四象限分类
局部 Moran's I(LISA)将每个空间单元分为四类:
| 象限 | 类型 | 含义 | 地图颜色 |
|---|
| HH | 热点聚类 | 高值被高值包围 | 红色 |
| LL | 冷点聚类 | 低值被低值包围 | 蓝色 |
| HL | 高值离群 | 高值被低值包围(空间异常点) | 浅红 |
| LH | 低值离群 | 低值被高值包围(空间异常点) | 浅蓝 |
只有通过显著性检验(p < 0.05)的单元才标记为聚类或离群。
LISA 聚类图解读
- HH 集中区域:需要重点关注的热点,如高污染聚集区、高房价片区
- LL 集中区域:冷点区域,如经济发展洼地、低密度区
- HL/LH 散点:空间异常值,可能是数据错误或特殊现象
热点分析:Getis-Ord Gi*
与 LISA 的区别
Gi* 专注于识别高值聚类(热点)和低值聚类(冷点),不区分离群类型。
适合回答"哪里是热点/冷点"的问题。
Z 值与置信水平
| Z 值范围 | 含义 | 置信水平 |
|---|
| Z > 2.58 | 热点 | 99% |
| 1.96 < Z ≤ 2.58 | 热点 | 95% |
| 1.65 < Z ≤ 1.96 | 热点 | 90% |
| -1.65 ≤ Z ≤ 1.65 | 不显著 | — |
| -2.58 ≤ Z < -1.65 | 冷点 | 90%-99% |
| Z < -2.58 | 冷点 | 99% |
通常采用 95% 置信水平(|Z| > 1.96)作为判断阈值。
空间权重矩阵
空间权重矩阵定义了"邻近"的含义,直接影响分析结果:
面要素权重
- Queen 邻接:共享边或顶点的面为邻居(8方向,推荐默认)
- Rook 邻接:仅共享边的面为邻居(4方向,更严格)
点要素权重
- KNN(K近邻):每个点取最近的 K 个点为邻居(K=4-8 常用)
- 距离阈值:距离小于阈值的点互为邻居(需选合适阈值)
- 距离衰减:权重随距离增大而减小(反距离加权)
选择建议
| 数据类型 | 推荐权重 | 理由 |
|---|
| 行政区面数据 | Queen 邻接 | 自然邻接关系,稳定可靠 |
| 规则格网 | Rook 邻接 | 避免对角线过度连接 |
| 离散点数据 | KNN (K=5-8) | 保证每个点都有邻居 |
| 密度不均的点 | 距离阈值 | 适应密度变化 |
标准工作流程
1. describe_geodataframe → 确认分析变量和几何类型
2. spatial_autocorrelation → 全局 Moran's I 检验
3. 判断显著性 → p < 0.05 则继续,否则报告无显著模式
4. local_moran → LISA 局部聚类分析
5. hotspot_analysis → Getis-Ord Gi* 热点识别
6. 综合解读 → 叠加 LISA 和 Gi* 结果,交叉验证
7. 可视化 → 生成聚类图和热点图
常见问题与陷阱
可变面积单元问题(MAUP)
分析结果会随空间单元的划分方式而变化。同一数据在街道级和区县级
可能呈现完全不同的聚类模式。应明确分析尺度并在报告中说明。
边缘效应
研究区边界附近的单元邻居不完整,可能导致统计偏差。边缘区域的
聚类结果应谨慎解读,必要时扩大研究区范围。
样本量要求
空间自相关检验需要足够的样本量。一般要求空间单元数 > 30,
低于此数量时统计检验的功效不足,结果不可靠。
权重矩阵敏感性
不同的权重矩阵可能产生不同结果。建议用 Queen 和 KNN 分别计算,
如果结论一致则结果稳健;如果不一致需进一步分析原因。
可用工具
describe_geodataframe — 数据画像,确认分析变量
spatial_autocorrelation — 全局 Moran's I 空间自相关检验
local_moran — 局部 LISA 聚类分析
hotspot_analysis — Getis-Ord Gi* 热点分析