| name | universal-object-representations-vision |
| description | Decomposition methodology for identifying universal vs model-specific dimensions in vision model representations across 162 diverse models. Universal dimensions are more interpretable, driven by conceptual image properties, and better predict macaque IT activity and human similarity judgments. arXiv:2605.13675.
|
| category | neuroscience |
| tags | ["universal-representations","vision-models","non-negative-decomposition","macaque-IT","representational-similarity","model-convergence","semantic-vision"] |
| related_skills | ["face-perception-inverse-generative","neuroscience-of-transformers","cross-modal-convergence-dispersion","neural-encoding-evaluation-ground-truth"] |
| activation_keywords | ["universal object representations vision","vision model convergence dimensions","non-negative dimension decomposition vision","macaque IT prediction vision models","model similarity structure vision","conceptual image properties universality"] |
Universal Object Representations Across Vision Models
Paper: Characterizing Universal Object Representations Across Vision Models
Authors: Florian P. Mahner, Johannes Roth, Ka Chun Lam, Michael F. Bonner, Francisco Pereira, Martin N. Hebart
arXiv: 2605.13675 (May 13, 2026)
Category: cs.CV, cs.LG, q-bio.NC
Overview
Decomposes object similarity structure of 162 diverse vision models into non-negative
dimensions, identifying which dimensions are universal (reappear across many models)
vs model-specific. Universal dimensions are more interpretable and better predict
biological vision.
Core Problem
DNNs trained with different architectures, objectives, and datasets converge on similar
visual representations. What properties do they converge on? What drives convergence?
Key Innovation: Non-Negative Dimension Decomposition
- Decompose each model's object similarity structure into non-negative dimensions
- Count how often each dimension reappears across the 162 models
- Universal dimensions = high cross-model frequency
- Model-specific dimensions = low frequency, unique to particular setups
Scale
- 162 diverse vision models across architectures, objectives, datasets
- Non-negative matrix factorization of similarity structures
- Frequency analysis of dimension recurrence
Key Findings
- Universal dimensions are more interpretable - driven by conceptual image properties
- Semantic content drives universality - interpretability is an implicit factor
- Not explained by training variables - architecture, objective, data, size, performance
do NOT explain universal dimension emergence
- Biological relevance: Models with more universal dimensions better predict:
- Macaque IT neural activity
- Human similarity judgments
- Universality = biological alignment
Core Principle
Convergent representations reflect fundamental computational constraints of vision,
not shared training procedures. More universal = more brain-like.
Implementation Pattern
Workflow for Agents
When to apply
- Analyzing convergence across multiple AI model architectures
- Evaluating how brain-like a vision model is
- Understanding universal vs idiosyncratic representations
- Designing model ensembles capturing diverse dimensions
Steps
- Collect diverse model representations on shared stimuli
- Compute RSA matrices per model
- Decompose into non-negative dimensions (NMF)
- Cross-model frequency analysis
- Validate universal dimensions against neural recordings
Pitfalls
- Dimension matching is non-trivial - may be permuted or rotated across models
- Non-negative constraint matters - standard PCA/SVD miss parts-based structure
- Stimulus set bias - must be diverse and representative
- Correlation not causation - universality correlates with but doesn't prove alignment
Applications
- Model selection - choose universal models for brain prediction
- Representation analysis - understand what makes representations good
- Neuroscience hypothesis generation - fundamental computational constraints
- AI interpretability - universal dimensions are more interpretable
References
- arXiv:2605.13675 (Mahner et al., 2026)
- Kriegeskorte et al. (2008): Representational Similarity Analysis
- Yamins & DiCarlo (2016): Goal-driven deep learning for sensory cortex