| name | trajectory-geometry-transformer-representations |
| description | Transformer 表征轨迹几何分析方法论 - 将计算神经科学的几何工具应用于 Transformer 可解释性研究,无需探测即可分析表征动力学 |
| trigger_words | transformer, trajectory geometry, computational neuroscience, interpretability, representation dynamics, attractor, layerwise analysis |
| version | 1.0.0 |
| arxiv_id | 2606.09287 |
| authors | Vishal Pandey, Gopal Singh |
| published | 2026-06-08T00:00:00.000Z |
Trajectory Geometry of Transformer Representations Across Layers
概述
将 Transformer 前向传播重构为高维表征流形中的离散群体轨迹,借鉴计算神经科学的几何工具进行机制可解释性分析。核心创新:无需探测预定义特征,直接在原始表征空间计算五个几何指标分析轨迹动力学。
核心方法论
五个几何指标
-
轨迹长度 (Trajectory Length)
-
曲率 (Curvature)
- 编码计算复杂性
- 推理任务曲率 > 词法变化任务 (0.71-0.83 rad vs 0.27-0.31 rad)
-
语义收敛指数 (Semantic Convergence Index, CI)
- 中晚期层语义相关提示收敛 (峰值 CI 0.41-0.58, p<0.001)
- 吸引子动力学证据
-
层间余弦相似度 (Layerwise Cosine Similarity)
- 通用三阶段结构:编码 → 深化 → 输出准备
- 跨架构一致(GPT-2, TinyLlama, Qwen2.5)
-
表征稳定性 (Representational Stability)
- 模糊token轨迹分叉(最终层5.6倍分离)
- 清晰token无分叉
分析流程
步骤1: 提取层间表征
- 收集各层隐藏状态向量
- 构建轨迹序列 {h₁, h₂, ..., hₙ}
步骤2: 计算几何指标
- 轨迹长度: Σ||hₗ₊₁ - hₗ||₂
- 曲率: arccos(⟨hₗ₊₁-hₗ, hₗ-hₗ₋₁⟩ / ||...||²)
- 语义CI: 跨提示轨迹距离收敛率
- 层间相似度: cosine(hₗ, hₗ₊₁)
步骤3: 对比分析
- 不同任务类型轨迹差异
- 模糊 vs 清晰 token 行为
- 洗牌层/随机嵌入控制实验
步骤4: 解释动力学结构
- 三阶段结构识别
- 吸引子动力学验证
- 计算复杂性与曲率关联
关键发现
- 语义收敛现象:语义相关提示在中晚期层显著收敛,支持吸引子动力学假设
- 曲率编码复杂性:推理任务轨迹曲率显著高于词法变化,曲率作为计算复杂性的几何编码
- 轨迹分叉特征:模糊token在最终层产生5.6倍表征分离,清晰token无此现象
- 通用三阶段结构:所有测试架构呈现一致的三阶段层间动力学
应用场景
Transformer 可解释性研究
- 无需预定义探测任务
- 直接从表征几何分析信息流
- 跨模型、跨任务的动力学对比
计算神经科学跨界应用
- 将神经动力学工具应用于AI系统
- 神经表征轨迹分析类比
- 吸引子动力学验证方法
模型架构优化
技术要点
实现细节
- 表征提取: 各层隐藏状态或注意力输出
- 轨迹构建: 层序离散序列
- 指标计算: 在原始表征空间直接计算,无需降维
- 控制实验: 洗牌层序、随机嵌入基线
优势特点
- Probe-free: 无需预定义特征探测
- Model-agnostic: 跨模型通用
- Open-source: 完整开源管道
- Geometric lens: 几何视角替代功能探测
注意事项
- 表征选择: 不同层输出(隐藏状态/注意力)影响轨迹定义
- 任务控制: 需精心设计提示家族对比语义vs词法变化
- 架构差异: 三阶段结构通用,但具体指标值因架构而异
- 计算资源: 高维表征几何计算可能内存密集
- 尺度效应: 大模型层间变化幅度可能更显著
相关资源
核心概念
- 轨迹几何: 表征空间中的路径几何特征
- 吸引子动力学: 语义相关提示收敛现象
- 三阶段结构: 编码-深化-输出的通用层间模式
- 曲率编码: 轨迹曲率反映计算复杂性
- 轨迹分叉: 模糊token的多路径分离现象
方法论意义
开创性地将计算神经科学的几何分析工具应用于 Transformer 可解释性研究,无需功能探测即可分析表征动力学。五个几何指标提供系统化、probe-free 的机制解释框架,跨架构验证揭示通用动力学结构。