| name | computer-vision-robotics-research |
| description | Compétence professionnelle en recherche en vision par ordinateur et robotique suivie sur arXiv sous cs.CV, cs.RO et les domaines cross-listés. Couvre la vision 3D, l'IA incarnée, les modèles VLA, la perception, la compréhension de scène, la génération d'images/vidéos, la manipulation robotique, la navigation et l'interaction homme-robot. |
| category | research |
Compétence en Recherche en Vision par Ordinateur et Robotique (cs.CV, cs.RO)
Présentation
La vision par ordinateur (cs.CV) et la robotique (cs.RO) sur arXiv reçoivent un volume substantiel de soumissions hebdomadaires avec des connexions profondes avec l'IA et le ML. Cette compétence fournit une structure pour naviguer dans la recherche en vision et robotique pertinente pour les agents intelligents et l'IA incarnée.
Domaines de Recherche Principaux
1. Vision 3D et Compréhension de Scène (cs.CV)
- Représentation 3D : Neural radiance fields (NeRF), Gaussian splatting 3D, champs de distance signés
- Ancrage sémantique : Ancrage sémantique élastique pour la compréhension et génération 3D unifiée (ELSA3D)
- Reconstruction 3D : Stéréo multi-vue, structure par mouvement, estimation de profondeur
- Traitement de nuages de points : PointNet++, transformers pour nuages de points
- Estimation de pose 6-DoF : Pose d'objet, de caméra, de main
- Génération de graphes de scène : Représentations structurées de scène
- Raisonnement spatial : Relations spatiales 3D, estimation de disposition
2. Modèles Vision-Langage-Action (VLA)
Domaine émergent : Connexion entre CV, TALN et Robotique
- Architectures VLA : Grands modèles vision-langage avec têtes d'action
- Lift3D-VLA : Élévation des VLA vers la géométrie 3D pour la manipulation
- Alignement des résultats d'action visuelle : VAORA pour l'alignement du raisonnement physique
- Planification de tâches incarnée : Génération d'actions conditionnées par le langage
- Détection d'échecs : Surveillance visuelle des résultats d'action
3. IA Incarnée et Modèles du Monde (cs.RO, cs.CV)
- Modèles du monde incarnés : Modèles 4D pour la manipulation robotique (RynnWorld-4D)
- Modèles conditionnés par l'action : Téléopération numérique (RynnWorld-Teleop)
- Interaction homme-robot incarnée : Interaction acoustique, MARL pour données spatiales
- Navigation visuelle : Navigation orientée objectif, exploration, cartographie
- Planification de manipulation : Manipulation dextre, planification de trajectoire
- Apprentissage par imitation : Clonage comportemental, apprentissage par observation
4. Modèles Vision-Langage (cs.CV)
- Génération unifiée : Vision comme génération multimodale unifiée
- Apprentissage contrastif vision-langage : Modèles de type CLIP, SigLIP
- Compréhension par région : Ancrage, expression référentielle, segmentation
- Compréhension vidéo : Raisonnement temporel, reconnaissance d'actions
5. Génération d'Images et Vidéos (cs.CV)
- Modèles de diffusion pour la vision : Texte-à-image, texte-à-vidéo
- Génération conditionnée par contrôle : ControlNet, T2I-Adapter, IP-Adapter
- Génération 3D : Texte-à-3D, image-à-3D, vidéo-à-3D
- Génération vidéo : Stable Video Diffusion, modèles de type Sora
6. Systèmes Robotiques et Contrôle (cs.RO)
- Apprentissage robotique : RL pour la robotique, apprentissage par démonstration, sim-à-réel
- Téléopération : Téléopération numérique, modèles conditionnés par l'action
- Systèmes multi-robots : Coordination, contrôle de formation, allocation de tâches
- Interaction homme-robot : Communication acoustique, navigation sociale
- Navigation autonome : SLAM, planification de chemin, évitement d'obstacles
7. Détection d'Objets et Segmentation (cs.CV)
- Architectures de détection : DETR, YOLO, Faster R-CNN
- Segmentation : SAM, SAM2, Mask2Former, segmentation panoptique
- Détection vocabulaire ouvert : Détection de catégories non vues
- Suivi (tracking) : Suivi multi-objets, suivi d'instances
- Estimation de profondeur : Profondeur monoculaire, stéréo
Articles Notables Récents (Mi-2026)
- ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation — cs.CV/cs.AI/cs.LG
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation — cs.RO/cs.CV
- Vision as Unified Multimodal Generation — cs.CV
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation — cs.RO
- RynnWorld-Teleop: Action-Conditioned World Model for Digital Teleoperation — cs.RO
- Embodied Human-Robot Interaction via Acoustics: A MARL Approach with AcoustoBots — cs.RO
Capteurs et Matériel
- Systèmes de caméra : RGB-D, stéréo, caméras d'événement, omnidirectionnelles
- LIDAR : Scan 3D, SLAM, conduite autonome
- IMU : Mesure inertielle pour la navigation
- Toucher haptique : Retour haptique, mesure de force
- Microphones : Détection acoustique, localisation sonore (AcoustoBot)
Conférences Clés
- CVPR, ICCV, ECCV : Meilleures conférences en vision
- ICRA, IROS, CoRL, RSS : Meilleures conférences en robotique
- RLC : Conférence sur l'apprentissage par renforcement (robotique + RL)
Comment Effectuer la Veille
- Vision par ordinateur :
/list/cs.CV/recent
- Robotique :
/list/cs.RO/recent
- Cross-list : cs.CV ⇄ cs.AI, cs.LG ; cs.RO ⇄ cs.MA, cs.AI, cs.CV
- Mots-clés : "vision-language-action", "VLA", "world model", "embodied", "3D scene", "manipulation"