📑 Table des matières

Homebody : Stanford pilote un humanoïde avec GPT-6 Astra et zéro policy apprise — 7/100 sur le benchmark desks

Skynet Watch 🟢 Débutant ⏱️ 15 min de lecture 📅 2026-10-01

Homebody : Stanford pilote un humanoïde avec GPT-6 Astra et zéro policy apprise — 7/100 sur le benchmark desks

🔎 Un humanoïde sans policy apprise, et pourquoi septembre 2026 compte

Un Unitree G1 vient de ranger une cuisine qu'il découvrait pour la première fois. Pas de téléopération préalable, pas de policy entraînée pendant des semaines sur des milliers de démonstrations : GPT-6 Astra, le VLM frontier d'OpenAI, appelle directement les compétences du robot comme un développeur appelle des fonctions. Le projet s'appelle HomeBody, il émane du Movement Lab de Stanford et de Caltech, et il a été publié fin septembre 2026.

Ce qui saute, c'est la couche VLA (Vision-Language-Action) : le standard de la robotique « foundation » qui imposait de collecter des démonstrations, d'entraîner un contrôleur spécialisé, puis d'espérer qu'il généralise. HomeBody remplace cette couche entraînée par un dialogue direct entre le modèle et une bibliothèque de skills. La démo est publique sur YouTube — et difficile à renvoyer au rang de vaporware : on y voit le robot naviguer, ouvrir des tiroirs, saisir et replacer des objets.

Le timing dit tout. Le 12 septembre 2026, UBTECH inaugurait son usine de Liuzhou, capable d'assembler un humanoïde toutes les dix minutes. Trois semaines plus tard, Stanford démontrait qu'un LLM pouvait piloter ces machines sans aucun entraînement spécifique à l'environnement. Le corps s'industrialise pendant que le logiciel change de paradigme. Reste un chiffre qui refroidit : 7/100 sur le benchmark de tâches de bureau. Les deux nouvelles sont vraies en même temps — et c'est précisément cette tension qu'il faut décoder.


L'essentiel

  • Zéro policy apprise : HomeBody (Stanford TML + Caltech, fin septembre 2026) supprime la couche VLA. GPT-6 Astra pilote un Unitree G1 en appelant directement 5 skills composables : navigation, pick, place, ouverture de tiroir, pick dans tiroir.
  • Mémoire spatiale avant action : le robot explore d'abord la pièce, construit un jumeau numérique Real2Sim dans Nvidia Isaac Sim à partir des flux caméra, SLAM et articulations, puis journalise objets et localisations.
  • Stack de perception sérieuse : SAM 2.1 pour la segmentation, Samurai pour le suivi, fast foundation stereo pour la profondeur — et des commandes de bras à 250 Hz.
  • Résultats à double face : une cuisine jamais vue nettoyée de bout en bout, mais 7/100 sur Stationary Bench (100 tâches de bureau, 200 essais) contre 0 pour le spécialiste Malmo Act 2 — avec une médiane de progression de 46/100.
  • Contexte industriel : le corps Unitree G1 se produit en série (~13 500 $, septembre 2026, vérifiez sur unitree.com), et l'usine UBTECH de Liuzhou vise plus de 10 000 humanoïdes par an.

Outils recommandés

Outil Usage principal Prix (septembre 2026) Idéal pour
HomeBody (Stanford TML) Page projet : architecture, démos, résultats Gratuit (recherche) Suivre et comprendre le projet
GPT-6 Astra (OpenAI) VLM pilote, tool calls structurés API, tarif n.d. Orchestrer des skills robotiques
Unitree G1 Corps humanoïde de la démo ~13 500 $ (vérifiez sur unitree.com) Reproduire un setup humanoïde
Nvidia Isaac Sim Jumeau numérique Real2Sim Gratuit (téléchargement) Simulation et mémoire spatiale
SAM 2.1 (Meta) Segmentation d'objets en flux Open source, gratuit Perception de scène

Un VLM à la place d'une policy : l'architecture HomeBody en clair

HomeBody supprime le contrôleur entraîné qui séparait traditionnellement le modèle de langage du robot. À sa place, GPT-6 Astra tourne à distance et sélectionne les skills via des tool calls structurés, en s'appuyant sur la vue ego, la carte, l'état du gripper et les observations rappelées de la mémoire spatiale.

Rappel du standard à l'ancienne. Un système VLA se fabrique en trois temps : collecter des démonstrations — souvent téléopérées à la main —, entraîner une policy qui mappe la perception vers l'action, puis déployer en croisant les doigts. Chaque nouveau domaine de tâches relance la machine à collecter des données.

C'est lent, coûteux, et la généralisation reste le point faible chronique du paradigme. Comme le résume The Decoder (27 septembre 2026), HomeBody supprime purement et simplement cette couche de contrôle entraînée entre le modèle et le robot.

L'approche inverse la logique. Les 5 skills — navigation, pick, place, ouverture de tiroir, pick dans tiroir — sont des primitives fiables, écrites et testées une fois pour toutes. La généralisation ne vient plus d'une policy : elle vient du VLM, qui raisonne sur une scène nouvelle et compose les primitives. Le modèle est swappable : remplacez GPT-6 Astra par un autre VLM frontier, l'architecture tient toujours.

Le pipeline : explorer, mémoriser, agir

Première phase, l'exploration. Déposé dans une cuisine inconnue, le robot arpente la pièce et construit un jumeau numérique Real2Sim dans Nvidia Isaac Sim, à partir des données caméra, SLAM et articulations. Objets et localisations sont journalisés dans une mémoire spatiale — le robot se fabrique littéralement sa propre carte mentale.

Deuxième phase, l'exécution. Le prompt est volontairement sous-spécifié — « range la cuisine » — et c'est le modèle qui le décompose en longues séquences de tool calls. Aucun entraînement spécifique à l'environnement : c'est le point que souligne AI Weekly dans son analyse du 27 septembre 2026.

Concrètement, la boucle de décision ressemble à celle d'un agent de code. Le modèle reçoit un contexte structuré — vue ego, carte, état du gripper, observations rappelées — et renvoie un appel : naviguer vers X, saisir Y, ouvrir le tiroir Z. Le skill s'exécute en local, puis rend compte. Le VLM ne pilote pas les moteurs : il pilote des intentions.

Côté capteurs, la stack est classique mais sérieuse : SAM 2.1 segmente les objets, Samurai assure leur suivi dans le flux vidéo, fast foundation stereo fournit la profondeur. Les commandes de bras descendent à 250 Hz — la fréquence qui rend les saisies stables sur un humanoïde.

Mon avis, après plusieurs visionnages de la démo : le génie du projet n'est pas dans le prompt, il est dans l'interface. Une bibliothèque de skills propre, documentée, avec des états retournés au modèle — c'est exactement la discipline qu'on exige d'une bonne API. La robotique vient de devenir un problème d'intégration logicielle.


Cuisine nettoyée, bureau à 7/100 : les résultats, sans maquillage

Sur la démo phare, HomeBody a nettoyé une cuisine jamais vue, tiroirs compris, à partir de prompts sous-spécifiés. Sur le benchmark de bureau, il plafonne à 7/100. Les deux chiffres racontent la même histoire : le paradigme fonctionne, la fiabilité ne suit pas encore.

Ce que « nettoyer une cuisine » veut dire

Naviguer dans une pièce jamais vue, identifier les objets égarés, ouvrir des tiroirs, en extraire le contenu, replacer chaque chose — le tout enchaîné sur une longue horizontale de tâches, sans entraînement préalable sur cette cuisine. Developments Today confirme le montage : autonomie complète sur l'environnement inconnu, récupération d'objets dans les tiroirs comprise.

Stationary Bench est le test qui pique : 100 tâches de bureau, 200 essais. GPT-6 Astra via HomeBody marque 7/100. Le spécialiste Malmo Act 2, une policy entraînée pour ce type de tâches, marque 0. Et la médiane de progression s'établit à 46/100 : sur la moitié des tâches, le robot va à mi-chemin avant d'échouer.

Modèle Approche Score (100 tâches, 200 essais) Médiane de progression
GPT-6 Astra (via HomeBody) VLM frontier + bibliothèque de skills 7/100 46/100
Malmo Act 2 Policy spécialiste entraînée 0/100 —

Lire ces chiffres demande de la rigueur. Un 7/100 contre un 0/100, ce n'est pas « GPT-6 Astra est mauvais » : c'est « le spécialiste ne produit rien de pertinent hors de son domaine d'entraînement, le généraliste fait au moins quelque chose ». C'est le même schéma qu'en code, où FrontierCode, le benchmark de Cognition qui enterre SWE-Bench, a montré que les modèles frontier écrasent les spécialistes dès qu'on mesure la qualité réelle des pull requests.

Mais 93 % d'échec sur des tâches triviales — poser un objet, ouvrir un tiroir — reste un plateau assumé. La médiane de progression à 46/100 suggère des échecs en fin de chaîne : perception fine, précision du contact, gestion des imprévus. Le paradigme a gagné le match des architectures ; il n'a pas encore gagné le match de la fiabilité.


Pourquoi supprimer la couche VLA est le vrai sujet

Parce que cette couche cumulait deux verrous : un goulot d'étranglement de données et un plafond de généralisation. HomeBody ne l'améliore pas — il la contourne, et c'est ce contournement qui est stratégique.

Pipeline VLA classique HomeBody
Données Démonstrations téléopérées à collecter Aucune collecte spécifique
Entraînement Policy par domaine de tâches Aucun
Généralisation Limitée au domaine vu Cuisine jamais vue, d'emblée
Mise à jour Réentraînement complet Swap du VLM
Coût marginal d'une nouvelle tâche Semaines Un prompt + skills existants

Le point clé, c'est le caractère swappable du VLM. La robotique hérite ainsi directement de la courbe de progression des LLM — celle-là même qui voit GPT-5.5 trôner à 98,2 sur notre index agentique depuis juin 2025, et qui a permis à Claude de battre le record de calcul en physique théorique : l'amplitude de Yang-Mills à 9 boucles pour 2 000 $ de compute. Chaque saut de modèle frontal se répercute sur le robot sans toucher une ligne du stack de contrôle.

Nuance importante : le VLA n'est pas mort. Il redevient un composant parmi d'autres — éventuellement un skill de plus dans la bibliothèque. Ce que HomeBody tue, c'est le monopole de la policy entraînée comme unique chemin vers l'action. Les équipes qui ont investi des mois en collecte de démonstrations ont intérêt à réévaluer leur feuille de route.


Le corps ne coûte presque plus rien : le logiciel devient le front

Le matériel n'est plus le verrou. Le Unitree G1 de la démo se produit en série à environ 13 500 $ (septembre 2026, vérifiez sur unitree.com) — le prix d'une bonne voiture d'occasion pour un humanoïde bi-bras.

Le 12 septembre 2026, UBTECH a ouvert son usine de Liuzhou : une cadence d'un humanoïde toutes les dix minutes, soit plus de 10 000 unités par an. Comme on le détaillait dans notre article sur Automate 2026 et le reality check de la robotique humanoïde, la Chine est déjà passée à la production de masse pendant que l'Occident reste au stade du pilote.

La conjonction des deux événements de septembre est le vrai signal. Quand le corps tombe à 13 500 $ et que le cerveau devient un appel d'API, la barrière d'entrée de la recherche robotique s'effondre : un labo universitaire, voire une équipe de trois personnes, peut reproduire un HomeBody. Le monopole des grands laboratoires de robotique sur ce type de résultat est terminé.


Ce que ça change pour les développeurs

Pour un développeur, HomeBody ressemble furieusement à ce qu'on connaît déjà : un agent qui appelle des outils. La robotique rejoint le code — on écrit des primitives fiables, on documente leurs entrées-sorties, et on laisse un modèle frontier orchestrer.

C'est exactement la thèse de Feather, la startup qui construit l'Android de la robotique pour les développeurs : une couche d'abstraction commune au-dessus de matériels hétérogènes, où les skills s'écrivent comme des modules réutilisables. HomeBody en est la preuve académique, Feather la tentative commerciale.

Deuxième parallèle, les benchmarks. En code, FrontierCode a remplacé SWE-Bench parce qu'il mesure la qualité réelle des pull requests mergées, pas des patches de synthèse. En robotique, Stationary Bench joue le même rôle : 100 tâches réelles, 200 essais, zéro indulgence. Les deux mouvements disent la même chose — l'ère des benchmarks synthétiques est finie.

L'économie du secteur se déplace avec. Quand la valeur migre de la policy vers les skills, une primitive « ouverture de tiroir » bien écrite devient un actif réutilisable sur des dizaines de tâches et plusieurs générations de modèles. Bonne nouvelle pour les développeurs ; moins bonne pour ceux qui pariaient leur valorisation sur des données de démonstration propriétaires.

Si vous voulez vous lancer, l'ordre des priorités est clair : d'abord des skills robustes, ensuite un modèle d'orchestration solide. Notre guide des meilleurs LLM pour coder sert de point de départ pour choisir ce dernier — les capacités agentiques comptent désormais plus que le score de chat brut.


Les limites : 93 % d'échec, latence cloud et benchmarks à lire avec des pincettes

Le chiffre à ne pas noyer sous l'enthousiasme : 7 réussites sur 100 tâches de bureau. Le plateau de performance des LLM frontier en robotique reste à 93 % d'échec sur des tâches qu'un enfant de cinq ans enchaîne sans réfléchir.

Première limite technique : GPT-6 Astra tourne à distance. Chaque décision traverse le cloud, ce qui impose une latence, une dépendance réseau et des questions de confidentialité — vos cuisines deviennent des scènes 3D envoyées chez votre fournisseur de modèles. Les skills, eux, s'exécutent en local : d'où l'importance de primitives robustes, capables de sécuriser l'état du robot si la connexion lâche.

Deuxième limite méthodologique : la prudence sur les scores. GPT-5.6 Sol sur Cerebras à 750 tokens/seconde — et le piège du benchmark gaming que METR vient de découvrir rappelle qu'un chiffre isolé peut être optimisé pour lui-même. Stationary Bench a le mérite d'être filmé — les essais sont publics sur YouTube — mais la robotique n'a pas encore sa METR pour auditer les benchmarks.

Troisième limite, la sécurité. Un modèle qui sélectionne des actions physiques à partir d'observations rappelées doit prouver qu'il ne rappelle pas n'importe quoi. Une mémoire spatiale périmée — un objet déplacé entre deux sessions — devient un risque physique, pas un simple bug d'affichage. C'est un chantier de recherche entier, et il n'a pas de réponse standard aujourd'hui.


❌ Erreurs courantes

Erreur 1 : croire que le LLM « voit » le monde

Le VLM ne remplace pas la perception : SAM 2.1, Samurai et la stéréo font le travail de segmentation, de suivi et de profondeur. Sans cette stack, le modèle reçoit des pixels bruts et échoue. Solution : traiter la perception comme un investissement de premier rang, pas comme un détail d'implémentation.

Erreur 2 : sous-estimer la bibliothèque de skills

Les 5 skills de HomeBody sont des primitives ingénierées, testées, avec des états exploitables par le modèle. Retirer cette rigueur et « brancher un GPT sur un bras » ne produit rien d'utilisable. Solution : traiter chaque skill comme un produit — tests, documentation, modes d'échec explicites.

Erreur 3 : lire 7/100 comme un échec du modèle

Le spécialiste Malmo Act 2 marque 0, et la médiane de progression est à 46/100. Le score absolu dit moins que l'écart relatif et la progression partielle. Solution : lire un benchmark robotique en comparaison et en vidéo — les essais sont filmés — jamais en chiffre isolé.

Erreur 4 : ignorer que le cerveau est dans le cloud

L'inférence distante ajoute latence et dépendance réseau sur une boucle de contrôle physique. Solution : prévoir des skills locaux capables de mettre le robot en sécurité si la connexion tombe, et tester cette dégradation explicitement — pas seulement le cas nominal.


❓ Questions fréquentes

Qu'est-ce que HomeBody, exactement ?

Un projet de recherche du Movement Lab de Stanford et de Caltech, publié fin septembre 2026. Il branche un VLM frontier — GPT-6 Astra — directement sur une bibliothèque de 5 skills robotiques, sans la couche de contrôle VLA entraînée habituelle. Le robot explore d'abord la pièce, construit un jumeau numérique, puis agit.

Pourquoi supprimer la couche VLA ?

Parce qu'elle impose de collecter des démonstrations et d'entraîner une policy pour chaque domaine de tâches. HomeBody déplace la généralisation vers le VLM, qui compose des primitives fiables via des tool calls structurés. Résultat : zéro entraînement spécifique à l'environnement, et un modèle swappable qui profite directement de la progression des LLM frontier.

Combien coûte le robot de la démo ?

Le Unitree G1 se vend autour de 13 500 $ (septembre 2026, vérifiez sur unitree.com). C'est un humanoïde produit en série, avec bras préhensiles. S'ajoutent les coûts d'inférence du VLM, qui tourne à distance, et surtout le temps d'ingénierie de la bibliothèque de skills — le poste de coût principal en pratique.

Peut-on remplacer GPT-6 Astra par un autre modèle ?

Oui, c'est prévu par conception : le VLM est swappable. Le modèle reçoit la vue ego, la carte, l'état du gripper et les observations rappelées, et renvoie des tool calls structurés. Tout VLM frontier solide en agentic peut prétendre au rôle — Gemini 3.1 Pro ou Claude Opus 4.7 inclus.

Faut-il encore des démonstrations téléopérées ?

Pour les skills, l'ingénierie humaine reste nécessaire : les primitives de HomeBody sont écrites et testées, pas apprises par imitation. Ce qui disparaît, c'est la collecte massive de démonstrations par tâche. Le rapport coût/valeur s'inverse : quelques semaines d'ingénierie par skill, contre des mois de téléopération par domaine.

HomeBody peut-il ranger votre cuisine demain ?

Non. 7/100 sur des tâches de bureau triviales, une inférence cloud obligatoire et aucune certification sécurité : c'est un prototype de recherche. Ce qui change, c'est la direction — la généralisation sans entraînement existe désormais. La fiabilité industrielle reste devant, probablement à quelques générations de modèles de distance.


✅ Conclusion

HomeBody fait sauter la couche VLA et prouve qu'un VLM frontier peut piloter un humanoïde de série sans entraînement spécifique — mais ses 7/100 sur Stationary Bench rappellent que le plateau de fiabilité reste à 93 % d'échec sur des tâches triviales. Le paradigme a basculé ce mois-ci ; la fiabilité basculera à coups d'itérations de modèles. Pour aller plus loin, la page projet HomeBody concentre architecture, démos et résultats — et la vidéo YouTube en dit plus long que tous les schémas.