GPT-6 Astra maîtrise les bras robotisés mieux que Claude

Pourquoi ça compte pour toi
Pour la première fois, on mesure concrètement comment les modèles d'IA se débrouillent quand il faut vraiment manipuler le monde physique, pas juste générer du texte. Astra l'emporte sur les tâches grossières (placer un objet simple) mais échoue aux tâches fines, comme ses concurrents. C'est un signal sur les véritables limites de la robotique IA.
Ce qu'il faut retenir
- 1.Tâche simple (bloc dans bol) : Astra 95%, Claude 5.1 à 40%, coût divisé par 2
- 2.Tâche précise (puzzle) : Astra et Claude bloquent au même endroit, 10% de réussite chacun
- 3.Astra utilise 10x moins de tokens, plus rapide, moins cher — mais pas plus intelligent
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Le test : deux tâches simples, deux résultats diamétralement opposés
OpenAI et l'équipe derrière ce benchmark ont donné à GPT-6 Astra et aux modèles Claude (Fable) le contrôle d'un bras robotisé YAM. Vingt essais chacun, deux missions :
- ▸Prendre un bloc rouge sur une table et le placer dans un bol.
- ▸Attraper une pièce de puzzle ronde par son ergot et l'insérer dans sa rainure.
Le bloc dans le bol : Astra domine
Astra réussit 19 fois sur 20 (95%). Claude 5.1 en sort 8 (40%), Claude 5 n'en sort qu'une (5%). Sur le plan du coût unitaire, Astra tourne autour de 0,94 $ là où Claude dépense 2,12 $. Plus rapide aussi : 2,5 minutes contre 6,8 pour Claude 5.1.
C'est du simple : atteindre l'objet, le lever, le placer. Astra l'enchaîne presque parfaitement.
Le puzzle : tout le monde galère
Là, c'est l'égalité des perdants. Astra complète l'insertion 2 fois sur 20. Claude 5.1 aussi : 2 sur 20. Les vidéos montrent le même problème : ils atteignent la rainure, puis se figent. L'ajustement microscopique final ? Hors de portée des deux.
Astra reste moins cher (1,36 $ vs 2,18 $), mais ça ne change rien au résultat.
Pourquoi c'est révélateur
Cette comparaison illustre une fracture claire en robotique IA :
- ▸Les tâches « grossières » (attraper, placer dans un contenant large) ? Déjà maîtrisées. C'est de la reconnaissance de formes appliquée au monde physique.
- ▸Les tâches de précision fine (insérer, ajuster, calibrer) ? Bloquer systématiquement au même point montre que ni Astra ni Claude ne possèdent encore la boucle de rétroaction sensorimotrice fine.
En d'autres termes : GPT-6 Astra est meilleur, mais pas pour les raisons qu'on croyait. Il est plus efficace (moins de tokens gaspillés, moins cher), pas plus intelligent sur les tâches intrinsèquement difficiles.
À retenir
Le nombre de tokens raconte l'histoire : Astra produit 2 100 tokens en moyenne pour le bloc, quand Claude 5.1 en produit 12 900. C'est de l'optimisation brute : moins de calcul, même résultat — ou mieux sur les cas simples. Mais sur les vrais défis, l'intelligence du modèle, pas son efficacité, devient le goulot.
Pour qui bâtit en robotique, le message est clair : les LLM peuvent gérer les 70% de tâches triviales. Les 30% qui restent nécessitent une architecture différente — probabilités de capteurs, retour de force, ou simplement des mains plus intelligentes que le cerveau.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, retiens que l'IA peut placer un bloc mais pas assembler un puzzle. C'est l'écart réel entre la hype et la réalité : l'IA progresse sur le bête, stagne sur le subtil. Regarde où ça s'accélère (tâches simples, volume) et où ça ralentit (précision, contexte rare).
Source
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :