| name | rise-robot |
| title | RISE: Self-Improving Robot Policy with Compositional World Model |
| version | 0.0.2 |
| engine | skillxiv-v0.0.2-claude-opus-4.6 |
| license | MIT |
| url | https://arxiv.org/abs/2602.11075 |
| keywords | ["Robot Learning","World Models","Reinforcement Learning","Imagination","Policy Optimization","Compositional"] |
| description | Enable robot policies to self-improve through imagination using learned dynamics and value models without physical trial-and-error. Compositional world model separates concerns enabling 35-45% performance gains on contact-rich manipulation. |
RISE: Self-Improving Robot Policy with Compositional World Model
Problem Context
Vision-Language-Action (VLA) foundation models excel at semantic understanding but struggle with precise contact-rich manipulation requiring fine motor control. Physical trial-and-error RL is expensive and impractical for real robots. Standard world models struggle to balance action controllability with realistic prediction. The core challenge: learn manipulation policies efficiently without costly physical interaction.
Core Concept
RISE shifts robot learning from the physical world to imagination using a compositional world model with specialized dynamics and value components. Rather than joint training, the approach separates:
- Dynamics Model: Predicts future observations given actions (what happens)
- Value Model: Evaluates imagined states for progress signals (is this good)
This separation enables on-policy RL in imagination, where the policy iteratively improves by proposing actions, simulating consequences, evaluating outcomes, and updating based on advantage signals—all without touching a physical robot.
Architecture Overview
- Dynamics Model: Video diffusion architecture with Task-Centric Batching for action diversity
- Value Model: Dual-objective learning combining progress regression and Temporal-Difference signals
- Advantage Computation: Cumulative improvement across imagined trajectories
- Policy Warm-up: Offline initialization on real demonstrations
- Self-Improving Loop: Imagination-based RL for continuous refinement
- Multi-view Setup: Observations from multiple camera perspectives for robustness
Implementation
The compositional world model operates through two specialized components trained with different objectives:
class DynamicsModel(nn.Module):
"""Predicts future observations from current state and action."""
def __init__(self):
self.backbone = VideoDiffusion()
def forward(self, observations, actions):
state_action = torch.cat([observations, actions], dim=)
predictions = .backbone.sample(state_action, steps=)
predictions