📑 Table des matières

Figure Index : Figure AI transforme les vidéos humaines en données d'entraînement — 264 000 téléchargements, 16 millions de vidéos et 15 M$ versés aux contributeurs

Skynet Watch 🟢 Débutant ⏱️ 13 min de lecture 📅 2026-10-05

Figure Index : Figure AI transforme les vidéos humaines en données d'entraînement — 264 000 téléchargements, 16 millions de vidéos et 15 M$ versés aux contributeurs

🔎 Le data flywheel des humanoïdes passe à l'échelle industrielle

Figure AI ne construit pas seulement des robots. L'entreprise achète du geste humain à grande échelle via Index, une application mobile qui rémunère les contributeurs pour filmer leurs tâches quotidiennes. En quelques mois : 264 000 téléchargements dans 108 pays, 16 millions de vidéos uploadées, 44 000 utilisateurs actifs hebdomadaires et 15 millions de dollars versés. Derrière ces chiffres company-reported, une infrastructure qui ingère l'équivalent de 4,9 années de travail humain par jour. L'objectif : entraîner Helix, le modèle de contrôle visuomoteur qui doit permettre aux humanoïdes Figure 02 de manipuler n'importe quel objet dans n'importe quel environnement. Le pari est clair : celui qui possède le plus gros dataset de manipulation réelle gagne la course à l'autonomie.


L'essentiel

  • Index n'est pas une app de crowdsourcing classique : c'est une usine à données propriétaires pour l'entraînement de Helix, le modèle visuomoteur de Figure AI.
  • Chiffres clés (company-reported, mai 2026) : 264k téléchargements, 108 pays, 16M+ vidéos, 44k+ WAU (puis 69k+), 15M$ payés aux créateurs, engagement de 1Md$+ sur 12 mois pour data + compute.
  • Infrastructure critique : l'app traite ~30 minutes de vidéo par seconde (≈4,9 années humaines/jour), exigeant une refonte complète de la pile data (disponibilité 24/7, compute continu, feedback temps réel, déduplication par embedding).
  • Modèle économique : Figure achète la donnée brute au lieu de la scraper — une différence juridique et éthique majeure face aux pratiques du LLM training.

Outils recommandés

Outil Usage principal Prix (mai 2026) Idéal pour
Figure Index (iOS/Android) Collecte de vidéos de manipulation humaine rémunérée Gratuit (rémunération par vidéo validée) Contributeurs souhaitant monétiser leurs gestes quotidiens
Hostinger Hébergement d'infrastructure data / sites vitrines robotique À partir de 2,99€/mois (mai 2026, vérifiez sur hostinger.com) Startups robotiques construisant leur pipeline d'ingestion vidéo
Roboflow Annotation, gestion de datasets vision, pipelines ML Gratuit jusqu'à 10k images ; payant au-delà (mai 2026) Équipes ML curatant les vidéos Index pour l'entraînement Helix
Weights & Biases Suivi d'expériences, versioning modèles, visualisation Gratuit pour usage personnel ; équipes dès 200$/mois (mai 2026) Recherche sur modèles visuomoteurs type Helix

L'architecture d'Index : une usine à données pas une simple app

Index n'est pas une application grand public comme les autres. Sortie du stealth (ex-Project Go-Big) avec un rollout public iOS/Android, elle a été conçue dès le premier jour comme un système d'acquisition de données à haut débit pour l'entraînement de Helix. Le flux est brutal : un contributeur porte un casque à capteurs, filme une tâche domestique — faire un lit, plier du linge, ranger la vaisselle — et l'upload est ingéré, dédupliqué, audité par des analystes humains au niveau utilisateur, puis stocké pour l'entraînement continu.

L'infrastructure doit absorber 30 minutes de vidéo par seconde. Cela représente environ 4,9 années de travail humain uploadées chaque jour. Figure AI a dû refondre toute sa pile data : disponibilité 24/7, compute continu, feedback temps réel aux contributeurs, déduplication par embedding avec seuil de similarité pour éviter la redondance. Ce n'est pas de l'ingénierie d'application mobile classique, c'est de l'ingénierie de plateforme de données à l'échelle du web.

La distinction est cruciale : les 16 millions de vidéos annoncées sont des uploads bruts. La fraction réellement retenue pour l'entraînement de Helix — après déduplication, contrôle qualité, audit humain — est significativement plus faible. Figure ne communique pas ce taux de rétention. En journalisme tech, on sépare les métriques de vanité (uploads totaux) des métriques d'utilité (heures de données uniques, diversifiées, annotées qui améliorent le modèle).


Helix : le modèle visuomoteur qui justifie l'investissement

Helix est le "cerveau" que Figure AI entraîne pour ses humanoïdes Figure 02. C'est un modèle de contrôle visuomoteur — il prend en entrée de la vidéo (caméras embarquées) et de la proprioception, et sort des commandes moteurs continues pour la manipulation. Pas de pipeline modulaire perception → planification → contrôle : Helix apprend l'ensemble en end-to-end, du pixel au couple moteur.

C'est là que le dataset Index devient critique. Les modèles visuomoteurs ont faim de diversité : milliers d'objets, textures, éclairages, configurations spatiales, stratégies de préhension. Le scraping web ne fournit pas ça. Les datasets académiques (EPIC-KITCHENS, Something-Something) sont trop petits, trop scriptés, trop propres. Figure a besoin de données sales, réelles, diverses — exactement ce que produisent des humains ordinaires dans leurs cuisines, salons, garages.

L'engagement de 1 milliard de dollars sur 12 mois pour l'acquisition de données et le compute Helix signale la priorité absolue. Ce n'est pas du R&D exploratoire. C'est un pari industriel : le data flywheel (plus de robots → plus de données → meilleur modèle → robots plus utiles → plus de robots) ne démarre que si le dataset initial est assez massif pour franchir le seuil d'utilité généraliste.


La rémunération des contributeurs : une économie du geste

15 millions de dollars versés aux créateurs. La mécanique est simple : vous filmez, vous uploadez, des analystes humains valident la qualité et la pertinence, vous êtes payé. Le montant par vidéo n'est pas public, mais l'ordre de grandeur suggère quelques dollars par tâche validée — bien au-dessus du micro-travail type Amazon Mechanical Turk.

Cette approche tranche avec l'entraînement des LLM. OpenAI, Anthropic, Google ont scanné le web, les livres, le code sans payer les auteurs. Figure achète la donnée. Pourquoi ? Trois raisons. Première : la donnée de manipulation n'existe pas sur le web en quantité suffisante. Deuxième : la qualité et la diversité requises exigent un contrôle du processus de collecte (capteurs, instructions, validation). Troisième : la position juridique — payer crée un contrat clair, évite les procès sur le droit d'auteur et le RGPD.

Le modèle économique tient si la valeur vie d'un humanoïde autonome (ventes, location, services) dépasse largement le coût d'acquisition du dataset. À 15M$ pour 16M vidéos brutes, le coût marginal est dérisoire comparé aux budgets compute (GPU H100 à ~30k$/unité, clusters de milliers de cartes). Le vrai coût n'est pas la rémunération des contributeurs, c'est l'infrastructure d'ingestion, de curation, d'entraînement continu.


Infrastructure data : le goulot d'étranglement invisible

Figure AI l'admet explicitement : l'ingestion massive a exigé une refonte de l'infrastructure data. Trois défis techniques majeurs :

Disponibilité 24/7 et compute continu. Les uploads arrivent en continu depuis 108 pays. Pas de fenêtre de maintenance. L'infrastructure doit scaler horizontalement, absorber les pics (soirées, week-ends), garantir l'intégrité des fichiers vidéo lourds (plusieurs Go par session capteur).

Feedback temps réel aux contributeurs. Un utilisateur filme, upload, et doit savoir rapidement si sa vidéo est acceptée et rémunérée. Cela implique une pipeline de validation quasi-temps-réel : détection de corruption, vérification format, première passe de qualité automatisée, puis file d'attente pour audit humain. La latence de ce feedback conditionne la rétention des 44k-69k WAU.

Déduplication par embedding. 16M vidéos contiennent une redondance massive. Filmer "faire son lit" produit des séquences quasi-identiques entre utilisateurs. Figure utilise des embeddings visuels pour calculer la similarité et ne retenir que les échantillons diversifiés. Le seuil de similarité est un hyperparamètre critique : trop bas → dataset redondant, gaspillage compute ; trop haut → perte de variations utiles (différents draps, matelas, morphologies).

Cette infrastructure est un actif stratégique. Elle permet à Figure d'itérer sur Helix plus vite que quiconque. Les concurrents (Tesla Optimus, 1X, Apptronik, Agility) collectent aussi de la donnée, mais peu ont déployé une app grand public à cette échelle avec paiement direct.


Métriques company-reported vs réalité technique : lire entre les lignes

Les 264k téléchargements, 16M vidéos, 44k+ WAU, 15M$ payés viennent de communications officielles Figure AI et de reprises presse (Humanoids Daily, Spatial Insiders). Ce sont des métriques company-reported — non auditées par un tiers indépendant. En tech journalism, on les traite comme des bornes supérieures.

Points de vigilance :
- WAU ≠ contributeurs actifs productifs. 69k WAU (chiffre ultérieur cité par Humanoids Daily) inclut probablement des utilisateurs qui ouvrent l'app par curiosité sans uploader de vidéo validée.
- Vidéos ≠ heures de données uniques. 16M vidéos de 30 secondes = ~133k heures brutes. Après déduplication, contrôle qualité, élimination des échecs (caméra bougée, tâche incomplète, objet non visible), le dataset utile pour Helix est peut-être 10-20x plus petit.
- 15M$ payés ≠ coût total d'acquisition. Il faut ajouter l'infrastructure, les analystes humains, le compute d'entraînement, l'ingénierie. Le coût réel par heure de donnée retenue est bien plus élevé.
- Engagement 1Md$ sur 12 mois : engagement ≠ dépense effective. C'est une intention budgétaire, conditionnée aux résultats d'Helix.

Cela ne diminue pas l'exploit. Figure a déployé à une vitesse rare une pipeline complète : app → ingestion → curation → entraînement → déploiement sur robot. Mais l'analyse rigoureuse sépare le signal (pipeline opérationnelle à l'échelle) du bruit (chiffres ronds communiqués).


La concurrence : Tesla, 1X, Google — qui a le meilleur dataset ?

Tesla Optimus s'appuie sur la flotte de véhicules (caméras, FSD) et commence à collecter de la manipulation en usine et en labo. Avantage : infrastructure compute massive (Dojo), données de conduite qui transfèrent vers la navigation. Inconvénient : la manipulation fine n'est pas le cœur de métier.

1X Technologies (ex-Halodi) déploie des humanoïdes en environnements réels (bureaux, hôpitaux) et collecte en continu. Leur approche "androids as a service" génère de la donnée d'exploitation, pas seulement de démonstration. Mais le volume reste confidentiel.

Google DeepMind avec RT-2, RT-X, Open X-Embodiment mise sur la mutualisation : 22 datasets robotiques, 1M+ trajectoires, modèles généralistes. C'est l'approche "Android de la robotique" — fournir le cerveau, pas le corps. Google joue son Android de la robotique : fournir le cerveau des humanoïdes pas le corps

Apptronik, Agility, Figure : course au dataset propriétaire. Figure a l'avantage de l'app grand public (Index) qui échelle la collecte hors labo, dans des environnements non structurés (maisons réelles). C'est une différenciation forte : la diversité domestique > la propreté industrielle.


Enjeux juridiques, éthiques, sociaux : le précédent Index

Payer pour la donnée crée un précédent. Si Figure réussit, d'autres suivront. Trois questions ouvertes :

Propriété du geste. Quand vous filmez "plier une serviette", qui possède ce mouvement ? Vous (créateur), Figure (acheteur), ou personne (fait naturel) ? Le contrat Index tranche : Figure obtient une licence mondiale, perpétuelle, pour l'entraînement de modèles. Le contributeur garde la propriété de la vidéo mais cède l'exploitation ML. C'est plus clair que le scraping web, mais pose la question de la valeur du savoir-faire corporel.

Biais de collecte. 108 pays, mais quelle répartition ? Probablement surreprésentation Amérique du Nord / Europe, utilisateurs tech-early-adopters, logements types occidentaux. Les gestes, objets, configurations spatiales d'un foyer à Lagos, Mumbai ou São Paulo seront sous-représentés. Helix risque d'être moins performant hors contexte occidental. Figure devra diversifier activement (campagnes ciblées, partenariats locaux).

Travail invisible. Le contributeur porte un casque capteur, répète des tâches, attend la validation. C'est du travail — précaire, à la tâche, sans protection sociale. 15M$ répartis sur des dizaines de milliers de contributeurs = quelques centaines de dollars par an par contributeur actif. Pas un revenu, un complément. La qualification juridique (travailleur indépendant ? micro-entrepreneur ?) varie selon les juridictions. Figure n'a pas communiqué sur la conformité droit du travail dans 108 pays.


Le data flywheel en action : de l'app au robot déployé

Le schéma cible de Figure :
1. Index collecte des millions de démonstrations humaines diverses (maisons réelles, objets réels, bruit réel).
2. Curation : déduplication, annotation semi-automatisée, sélection des trajectoires à haute valeur d'information.
3. Entraînement Helix : scaling laws visuomoteurs — plus de données + plus de compute = meilleure généralisation zero-shot.
4. Déploiement Figure 02 : robots en usine (BMW Spartanburg), puis logistique, puis domicile.
5. Données d'exploitation : robots en production génèrent leurs propres données (téléopération, corrections, autonomie partielle) → réinjectées dans Helix.
6. Boucle fermée : meilleur modèle → robots plus utiles → plus de déploiements → plus de données d'exploitation → meilleur modèle.

Index est l'amorce (bootstrapping). La vraie valeur viendra de l'étape 5 : données d'exploitation réelles, pas données de démonstration. Mais sans l'amorce massive, le modèle n'est pas assez bon pour être déployé utilement, et la boucle ne démarre pas. C'est le cold start problem de la robotique générale. Figure le résout en achetant le cold start.


❌ Erreurs courantes

Erreur 1 : Confondre uploads bruts et dataset d'entraînement

Ce qui ne va pas : Citer "16 millions de vidéos" comme taille du dataset Helix.
La solution : Préciser "16 millions de vidéos uploadées (données brutes, company-reported). Le dataset entraînement effectif est significativement plus petit après déduplication et contrôle qualité."

Erreur 2 : Assimiler Index au crowdsourcing type Mechanical Turk

Ce qui ne va pas : Traiter les contributeurs comme des travailleurs à la tâche interchangeables, sans considérer la dimension capteur + geste + validation experte.
La solution : Index collecte de la donnée multimodale capteurisée (vidéo + IMU + éventuellement force/tactile via le casque), validée par des analystes formés. C'est de la curation experte, pas du micro-travail non qualifié.

Erreur 3 : Ignorer le coût compute derrière l'acquisition data

Ce qui ne va pas : Présenter les 15M$ versés aux créateurs comme le coût principal.
La solution : Le compute d'entraînement Helix (clusters H100, semaines d'entraînement, itérations continues) représente probablement 10x-100x ce montant. L'engagement 1Md$ sur 12 mois couvre data + compute.

Erreur 4 : Croire que le data flywheel est déjà bouclé

Ce qui ne va pas : Écrire que les robots Figure s'améliorent déjà en production grâce à leurs propres données.
La solution : Au stade Index (mai 2026), la boucle n'est pas fermée. Les robots en test (BMW) génèrent des données, mais l'échelle n'est pas encore celle d'une flotte déployée. Le flywheel est conçu, pas opérationnel à régime.


❓ Questions fréquentes

Combien gagne un contributeur Index par vidéo validée ?

Figure ne publie pas la grille tarifaire exacte. Sur la base de 15M$ pour ~16M uploads bruts (taux de validation inconnu), l'ordre de grandeur est de quelques dollars par vidéo acceptée. Le revenu mensuel typique reste un complément (dizaines à centaines de dollars), pas un salaire.

Les vidéos Index servent-elles seulement à Helix ou aussi à d'autres modèles ?

Communication officielle : données propriétaires pour l'entraînement des modèles Figure (Helix et successeurs). Pas de revente, pas de dataset public. La valorisation est interne.

Quel matériel faut-il pour contribuer ? Un smartphone suffit-il ?

L'app Index guide l'utilisateur, mais la collecte de qualité pour Helix utilise un casque à capteurs (caméras stéréo, IMU, éventuellement capteurs tactiles) fourni ou spécifié par Figure. Un smartphone seul ne capture pas la proprioception ni la géométrie 3D nécessaire au contrôle visuomoteur.

Helix est-il open source ou accessible via API ?

Non. Helix est un modèle propriétaire, cœur de l'avantage concurrentiel de Figure. Aucune release open weight n'est annoncée. L'accès se fait via l'achat/location des robots Figure 02.

Comment Figure gère-t-elle le RGPD et la vie privée dans 108 pays ?

Les contributeurs acceptent des conditions d'utilisation cédant les droits d'exploitation ML. Les visages, plaques d'immatriculation, informations personnelles visibles dans les vidéos sont floutés automatiquement avant stockage/entraînement (pipeline de privacy by design). La conformité juridique par juridiction n'est pas détaillée publiquement.

Quel est le lien entre Index et les 1M$ versés aux créateurs mentionnés dans d'autres articles ?

Les 15M$ (mai 2026) remplacent/supersèdent les chiffres antérieurs. La progression rapide (1M$ → 15M$ en quelques mois) reflète l'accélération du programme post-stealth.


✅ Conclusion

Figure Index n'est pas une app, c'est l'amorce industrielle du data flywheel humanoïde. 264k téléchargements, 16M vidéos brutes, 15M$ payés : les métriques company-reported impressionnent, mais l'essentiel est ailleurs. Figure a construit une pipeline d'ingestion, curation, entraînement continu qui tourne 24/7 à l'échelle du web. Helix, le modèle visuomoteur qui en sort, déterminera si les Figure 02 tiennent la promesse d'autonomie générale. La course au dataset propriétaire est lancée — Tesla, 1X, Google, Apptronik ont leurs stratégies. Figure a choisi d'acheter le geste humain à la source, dans la diversité des foyers réels. C'est un pari coûteux, juridiquement plus propre, techniquement ambitieux. Le prochain jalon n'est pas le nombre d'uploads, mais la démonstration zero-shot : un Figure 02 qui manipule un objet jamais vu, dans un environnement jamais vu, sans téléopération. Homebody : Stanford pilote un humanoïde avec GPT-6, Astra et Zero Policy apprise à 71%