Identify dominant frequency components in RoPE embeddings to determine which attention dimensions are essential, reducing KV cache by 81% while maintaining performance. Training-free approach integrates with existing compression methods for 2.56x speedup on long-context reasoning.
Standardmäßig ist der Prompt ausgewählt, der zuerst die Quelle prüft. Sie können zu einem direkten Befehl wechseln oder eine lokale Kopie herunterladen.
Quelldateien prüfen
Lesen Sie SKILL.md und alle von SkillsMP angezeigten Begleitdateien, bevor Sie sich für eine Installation entscheiden.
Mit Codex oder Claude installieren Kopieren Sie diesen Prompt, fügen Sie ihn in Codex, Claude oder einen anderen Assistant ein und lassen Sie die Skill-Seite prüfen und installieren.
Ein direkter Befehl überspringt den Prüf-Prompt. Prüfen Sie die Quelle, bevor Sie ihn ausführen.
Identify dominant frequency components in RoPE embeddings to determine which attention dimensions are essential, reducing KV cache by 81% while maintaining performance. Training-free approach integrates with existing compression methods for 2.56x speedup on long-context reasoning.
FASA: Functional Sparsity in Attention via Frequency Analysis
Rotary Position Embeddings (RoPE) use multiple frequency components to encode position, but not all frequencies are equally important for each task. FASA discovers which frequency dimensions actually contribute to model performance, enabling aggressive KV cache reduction by computing attention only on critical frequencies. This training-free approach complements other compression methods and requires only one-time offline calibration.
The key insight is that high-frequency components (capturing fine-grained positional distinctions) often matter less than low-frequency components (capturing coarse relationships) for understanding context. By identifying task-dependent "dominant frequency chunks," FASA achieves near-oracle compression without task-specific training.
Core Concept
FASA operates in two stages:
Token Importance Prediction (TIP): Use pre-identified dominant frequency chunks to efficiently score token importance without full attention computation.
Focused Attention Computation (FAC): Perform full-precision attention only on selected critical tokens and dimensions, dramatically reducing KV cache memory requirements.
Unlike uniform sparsity, this approach exploits the structure of rotary embeddings to identify task-relevant dimensions.
Architecture Overview
Frequency Analyzer: Identifies dominant frequency components via one-time calibration
Dimension Selector: Maps tasks to critical frequency chunks
Token Scorer: Efficient importance prediction using only dominant frequencies
Attention Engine: Computes attention on selected dimensions/tokens
Cache Manager: Stores only critical KV pairs in reduced format
Integration Layer: Works with other compression methods (quantization, eviction)
Implementation
Step 1: Analyze RoPE Frequency Components
Create tools to identify which frequency dimensions matter for a given model/task.
"""
Analyze frequency importance in RoPE embeddings.
Args:
hidden_dim: Dimension of embeddings (must be even)
rope_theta: Base frequency (standard: 10000)
"""
"""
Rank frequency components by importance using activation variance.
Args:
activations: Model activations for calibration set
top_k: Number of top frequencies to return
Returns:
indices: Frequency indices (0 to hidden_dim//2)
scores: Importance scores for each frequency
"""
# Split activations into frequency pairs
# RoPE uses sin/cos pairs for each frequency
for
in
range
self
2
# Get pair of dimensions for this frequency
2
2
1
1
# Importance = variance across positions
# Sort by importance (descending)
sorted
lambda
1
True
# Return top-K
0
for
in
1
for
in
return
def
identify_dominant_frequency_chunks
model,
calibration_dataset,
num_chunks: int = 8,
compression_ratio: float = 0.25
List
List
int
"""
Identify dominant frequency chunks for a model via calibration.
Args:
model: Language model
calibration_dataset: Validation set for analysis
num_chunks: Number of frequency chunks to create
compression_ratio: Target fraction of dimensions to keep
Returns:
List of frequency chunk lists, each containing dimension indices
"""
Key results: 2.56× speedup with 18.9% KV cache retention; near-oracle accuracy with only 25% of attention dimensions. Training-free; composes with other compression methods. Code available at https://github.com/AMAP-ML/FASA-ICLR2026