LeRobot v0.6.0 : les robots apprennent à imaginer avant d'agir
Pourquoi ça compte pour toi
Si tu travailles sur la robotique ou l'IA de contrôle, cette version ferme une boucle critique : les robots peuvent maintenant anticiper avant d'agir, évaluer leur succès via des reward models, et déployer en prod avec apprentissage humain continu. C'est pas juste du outillage, c'est une architecture.
Ce qu'il faut retenir
- 1.3 world models (VLA-JEPA, LingBot-VA, FastWAM) qui imaginent le futur en espace latent → supervision gratuite à l'inférence
- 2.6 nouveaux VLAs (GR00T N1.7, MolmoAct2, EO1, EVO1...) + reward models à interface unifiée (Robometer, TOPReward)
- 3.Déploiement simplifié : lerobot-rollout CLI avec correction humaine style DAgger, 6 benchmarks d'éval, profondeur + annotations VLM auto
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Le vrai tournant : les world models en prod
Le débat dans la robotique était simple : est-ce que laisser un robot imaginer le futur avant d'agir, ça change vraiment quelque chose ?
LeRobot v0.6.0 répond avec trois approches différentes. VLA-JEPA entraîne un VLA compact (Qwen3-VL-2B) à prédire les frames futurs en espace latent. L'astuce : le monde imaginé disparaît à l'inférence. Tu gagnes la supervision du world model sans surcoût à l'exécution.
LingBot-VA va plus loin : elle prédit vidéo et actions ensemble, morceau par morceau, et réinjecte l'observation réelle pour rester ancrée. Tu peux même sauvegarder ce que le robot a imaginé et comparer avec la réalité.
FastWAM pose la question inverse : faut-il vraiment rêver à l'inférence ? Elle associe un expert en génération vidéo (~5B) avec un expert action compact. À l'inférence : oublie le rêve, dénoise directement les séquences d'action.
L'écosystème VLA explose
GR00T N1.7 (NVIDIA), MolmoAct2 (Allen Institute), EO-1, EVO1... chacun a une niche : fondations multi-embodiments, petits modèles pour GPU modestes (EVO1 = 0,77B paramètres), modèles spécialisés par tâche.
MolmoAct2 se déploie en zéro-shot sur robot réel SO-100/101 avec ~12 Go de VRAM. C'est du concret, pas du labo.
Reward models : fermer la boucle
La grande absence jusqu'à présent : comment sait-on que le robot a réussi ? Robometer (4B, pré-entraîné sur 1M+ trajectoires) évalue le progrès et le succès sur n'importe quel jeu de données LeRobot, sans affinage spécifique à la tâche.
TOPReward fonctionne en zéro-shot pur : prend n'importe quel VLM capable, lit la log-proba du token "True" sur la vidéo + instruction. N'importe quel VLM devient fonction de récompense.
Les deux génèrent des courbes par frame que tu réinjectes dans du behavior cloning conscient des récompenses ou pour inspecter la qualité du jeu de données.
Le reste : déploiement et données
lerobot-rollout CLI : déploie les modèles, capture les échecs humains (style DAgger), les reconvertit en données d'entraînement. C'est la boucle fermée.
Jeux de données : codecs vidéo custom, prise en charge de la profondeur, annotation langage auto via VLM, chargement 2x plus rapide. La plomberie s'améliore.
Entraînement : FSDP (entraîner plus gros que ta GPU), entraînement cloud sur Hugging Face Jobs.
À retenir
Cette version ne promet pas des robots "intelligents". Elle ferme une chaîne : imaginer → agir → évaluer → améliorer → déployer. C'est de l'ingénierie, pas de la magie.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, pense à LeRobot comme un cerveau qui teste mentalement avant d'agir physiquement, comme toi quand tu imagines une conversation avant de l'avoir. C'est la première génération de robots vraiment anticipatoires, pas juste réactifs.
Essayer maintenant
Accéder à LeRobot v0.6.0 sur Hugging Face →Source
📊 Cours en bourse
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :