Claude bat le record de calcul en physique théorique : l'amplitude de Yang-Mills à 9 boucles pour 2 000 $ de compute
🔎 Un record de physique tombé pour le prix d'un bon PC
Le 7 août 2026, le physicien Matt von Hippel lance un défi public sur son blog 4gravitons : résolvez un problème d'amplitudes de diffusion réputé hors de portée — l'amplitude à neuf boucles en N=4 super Yang-Mills, ou celle à sept boucles en supergravité N=8 — avec un budget de compute accessible à un académique. Un mois plus tard, le défi est relevé. Pas par une collaboration internationale de cinquante chercheurs : par deux physiciens, un modèle et une phrase de prompt.
Liam Fitzpatrick et Siddharth Mishra-Sharma, tous deux physiciens chez Anthropic, ont confié la cible à Fable 5.1 dans Claude Science, le harness de recherche payant de l'entreprise. Le modèle a travaillé des jours quasiment sans supervision, écrit l'intégralité de son code Python from scratch, et calculé l'amplitude à six particules à neuf boucles — une boucle de plus que le record humain établi en 2023 à SLAC/Stanford.
Le détail qui sépare l'anecdote de l'histoire : Lance Dixon, co-détenteur du précédent record, a passé deux semaines à valider le résultat par une voie indépendante avant de le confirmer — « quite a triumph », selon le billet publié par Anthropic le 25 septembre. Facture totale : 1 000 à 2 000 $. Ce protocole — un prompt, des jours d'autonomie, un résultat vérifiable par un expert de premier plan — voilà la vraie nouvelle.
L'essentiel
- Le résultat : l'amplitude MHV à six gluons à neuf boucles en N=4 super Yang-Mills planaire — 107 053 coefficients non nuls, soit une boucle de plus que le record humain de 2023 (huit boucles, Dixon et Liu).
- Le protocole : une seule phrase de prompt, puis des jours d'exécution autonome avec points d'étape toutes les 4 à 6 heures et aucune correction scientifique en cours de route.
- La redondance interne : deux dérivations indépendantes — bootstrap direct et voie form factor — aboutissent aux mêmes 107 053 coefficients.
- La validation externe : deux semaines de vérification par Lance Dixon (SLAC/Stanford), via le calcul d'un form factor apparenté.
- La facture : ~1 000-2 000 $ par approche, dont ~100 $ de compute brut (bootstrap Python/SymPy sur 96 CPU pendant une semaine) et le reste en temps d'inférence du modèle.
- Le contre-point : l'équipe de Song He (Académie chinoise des sciences) a publié le 17 septembre sur Zenodo un symbole à neuf boucles obtenu avec l'assistance de GPT-6, par une approche menée par les humains.
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026) | Idéal pour |
|---|---|---|---|
| Claude Science | Harness de recherche agentique : sessions longues, exécution de code, points d'étape | Offre payante (tarifs à vérifier sur anthropic.com) | Laboratoires voulant déléguer des dérivations de plusieurs jours |
| SymPy | Algèbre symbolique exacte en Python | Gratuit, open source | Calculs exacts sans dérive numérique — le socle du bootstrap |
| Zenodo | Dépôt public de préprints et de données | Gratuit | Publier des résultats vérifiables par la communauté, vite |
Le défi du 7 août : neuf boucles avec un budget d'académicien
Le défi de von Hippel ne portait pas sur la faisabilité du calcul, mais sur son coût : peut-on repousser un record mondial avec les moyens d'un chercheur isolé, sans superordinateur ni équipe de vingt personnes ?
Pour mesurer l'audace, il faut comprendre ce que « boucle » veut dire. En théorie quantique des champs, une amplitude de diffusion — la quantité qui prédit les probabilités de collision entre particules — se calcule comme une série perturbative. Chaque ordre de la série, chaque « boucle », ajoute une correction quantique. Et la complexité explose à chaque cran : passer de huit boucles, le record établi en 2023 par Dixon et son collègue Liu, à neuf boucles, ce n'est pas 12 % d'effort en plus. C'est un saut combinatoire qui avait résisté à toutes les équipes humaines.
Von Hippel, physicien devenu vulgarisateur, avait calibré les règles en conséquence : chaque approche devait rester sous environ 1 000 à 2 000 $ de compute, essentiellement du temps d'exécution de Claude, comme le rapporte Unite.AI. Deux cibles étaient admises : le N=4 super Yang-Mills à neuf boucles, ou la supergravité N=8 à sept boucles. Un mois plus tard, la première est tombée.
Ce que Fable 5.1 a réellement calculé
La cible était l'amplitude MHV (maximally helicity-violating) à six gluons, à neuf boucles, en N=4 super Yang-Mills planaire — un objet que décrypte bien kingy.ai. Derrière le jargon, trois précisions utiles.
D'abord, la théorie. Le N=4 super Yang-Mills n'est pas notre univers : c'est la drosophile de la physique des amplitudes, une théorie maximalement supersymétrique où les symétries contraignent si fortement les réponses qu'elles deviennent presque calculables à la main. « Planaire » désigne la limite où la théorie se simplifie encore, et où les méthodes les plus puissantes s'appliquent. « MHV », c'est la configuration d'hélicité la plus simple qui ne soit pas triviale.
Ensuite, la méthode. Sommer des diagrammes de Feynman à neuf boucles est hors de portée de toute machine sur Terre. Le bootstrap fait l'inverse : on écrit une forme générale de la réponse, paramétrée par des inconnues, puis on impose les contraintes de consistance — symétries, analyticité — jusqu'à ce que la solution soit unique. Le produit final est un « symbole » : une structure algébrique exacte, pas une simulation numérique approchée.
Enfin, l'exécution. Fable 5.1 a écrit tout son code Python from scratch, en s'appuyant sur SymPy pour de l'algèbre exacte — donc sans dérive d'arrondi sur 107 053 coefficients, un détail crucial rapporté par GPTS24. Et surtout : deux dérivations indépendantes, le bootstrap direct d'un côté, la voie form factor de l'autre, convergent vers les mêmes coefficients. Sur un objet de cette taille, cet accord interne est déjà une vérification en soi.
Le protocole : une phrase de prompt, des jours d'autonomie
Fitzpatrick et Mishra-Sharma n'ont pas enchaîné des dizaines de prompts d'ingénierie. Une seule phrase, une consigne de continuer à travailler pendant la nuit, puis des points d'étape toutes les 4 à 6 heures — et aucune correction scientifique en cours de route, selon Dataconomy.
Pendant des jours, le modèle a planifié, codé, exécuté, échoué, corrigé. La supervision humaine s'est réduite à des prompts de continuation périodiques, résume AlphaSignal. Personne n'a touché à la physique entre le lancement et l'arrivée.
Ce niveau d'autonomie n'a rien d'automatique. Tenir un agent sur la rampe pendant des jours suppose une gestion de contexte rigoureuse : consignes persistantes, fichiers de contexte, points de reprise exploitables par la machine. C'est précisément le chantier que nous détailions dans Fichiers de contexte : CLAUDE.md, AGENTS.md et au-delà — et ce cas d'usage le valide a posteriori. La différence entre un agent qui décroche au bout de vingt minutes et un qui tient des jours tient souvent au contexte, pas au modèle.
La validation : deux semaines de Dixon, « quite a triumph »
Le résultat n'a été ni publié ni célébré avant d'avoir survécu à un examen indépendant — et pas par n'importe qui. Lance Dixon, professeur à SLAC/Stanford et co-détenteur du record à huit boucles, a consacré deux semaines à vérifier l'amplitude via le calcul d'un form factor apparenté, avant de confirmer.
« Quite a triumph » : le qualificatif a du poids venant de celui dont le propre record vient d'être dépassé d'une boucle. Et il faut lire la validation pour ce qu'elle est : un contrôle par une troisième voie, sur un résultat produit par une machine en quelques jours de travail autonome.
Un mot sur la transparence, parce qu'elle compte. Le billet d'Anthropic est un post invité écrit par von Hippel, rémunéré par l'entreprise, et Dixon a reçu des crédits d'usage Claude en contrepartie de sa vérification. Ces liens d'intérêt sont déclarés noir sur blanc ; la vérification scientifique, elle, n'en dépend pas. C'est exactement le niveau de diligence qu'on est en droit d'exiger avant d'empiler les superlatifs — et que des reprises comme techbriefly ou cellcog ont globalement respecté.
La facture : 100 $ de CPU, 1 900 $ de réflexion
Le poste dominant de cette prouesse n'est pas le matériel : c'est le temps d'inférence du modèle.
| Poste de coût | Montant | Détail |
|---|---|---|
| Compute bootstrap | ~100 $ | 96 cœurs CPU pendant une semaine, Python/SymPy |
| Inférence du modèle | ~900-1 900 $ | Jours de raisonnement de Fable 5.1, relances toutes les 4-6 h |
| Total par approche | ~1 000-2 000 $ | Estimation pour un utilisateur final |
La lecture d'AINvest est la bonne : quand l'essentiel de la facture est du temps de modèle, le signal économique est limpide. La ressource rare de ce type de calcul n'est plus le FLOP, c'est le raisonnement soutenu sur de longues durées. Pour l'industrie, c'est un argument de plus en faveur d'une demande d'inférence soutenue plutôt que d'entraînement.
Mettez le chiffre en perspective : deux ans d'un doctorant, ou 2 000 $ et un mois. Le rapport est absurde — à une condition près. Il faut un Dixon pour vérifier derrière. Le vrai goulot d'étranglement du protocole n'est pas la génération, qui coûte presque rien ; c'est la validation, qui coûte deux semaines d'un expert de classe mondiale.
La réponse chinoise : Song He, GPT-6 et l'approche « humains d'abord »
Anthropic n'a pas le monopole des neuf boucles. Quelques jours après le solve de Claude, l'équipe de Song He (Académie chinoise des sciences) a publié sur Zenodo, le 17 septembre, un symbole à neuf boucles obtenu avec l'assistance de GPT-6 — mais par une approche menée par les humains.
Les deux résultats se répondent en miroir. D'un côté, un agent autonome à qui l'on donne une cible et un budget, et qui organise seul son travail. De l'autre, des physiciens qui gardent la main et utilisent le modèle comme un instrument de calcul. Que les deux voies aboutissent à quelques jours d'écart suggère que le problème était devenu atteignable — et surtout que la division du travail humain-IA reste un choix de méthode, pas une fatalité.
| Claude Science (Fable 5.1) | Équipe de Song He (GPT-6) | |
|---|---|---|
| Pilotage | Agent-led : un prompt, jours d'autonomie | Human-led : les physiciens dirigent |
| Livrable | Amplitude MHV à 6 particules, 9 boucles, 107 053 coefficients | Symbole à 9 boucles |
| Validation | Dixon, 2 semaines, voie indépendante | Publication Zenodo (17 septembre) |
| Coût annoncé | ~1 000-2 000 $ | Non détaillé publiquement |
Ce n'est pas un accident de calendrier : notre veille du 17 septembre montrait déjà les chiffres qui dessinent ce basculement de l'IA vers la physique. Et côté OpenAI, le résultat s'inscrit dans une série de performances scientifiques, dont nous avons rendu compte dans GPT-6 Astra : 64,6 % sur Terminal-Bench science, ARC-AGI-3 quasi bouclé. La compétition sur les longues tâches scientifiques autonomes est ouverte — et elle ne se joue plus sur des quiz de raisonnement de cinq minutes.
Ce que ça change : un protocole, pas seulement un record
La vraie nouveauté n'est pas le nombre de boucles. C'est le triptyque : un prompt, plusieurs jours d'autonomie, un résultat vérifiable par un expert de premier plan. Ce triptyque a désormais un précédent, un record et une facture — autrement dit, un statut de méthode.
Deuxième occurrence du pattern, d'ailleurs : Anthropic avait annoncé peu avant que Claude avait découvert un système enzymatique inconnu en 21 heures (notre article). Avec les neuf boucles, on tient un deuxième point de données. Un coup d'éclat isolé s'appelle une anecdote ; deux, à quelques semaines d'écart, commencent à s'appeler une méthode.
Trois conséquences concrètes.
Le goulot d'étranglement se déplace vers la vérification. Produire 107 053 coefficients corrects : quelques jours et ~2 000 $. Les confirmer : deux semaines de Lance Dixon. Les laboratoires qui voudront adopter ce protocole devront investir dans la vérification — humaine et automatisée — autant que dans la génération.
L'accès se démocratise, pour les équipes entraînées. 2 000 $, c'est une ligne de budget de laboratoire, pas une allocation sur superordinateur national. Mais gardons la tête froide : les deux auteurs du prompt sont des physiciens, et le solve a mobilisé des méthodes bootstrap connues, sans physique nouvelle revendiquée. Le modèle a exécuté à l'échelle une stratégie que la communauté a forgée en vingt ans.
L'économie du compute bascule côté inférence. ~100 $ de CPU contre ~900-1 900 $ de temps de modèle : pour cette classe de charges, le coût dominant est le raisonnement, pas le calcul brut. Les fournisseurs qui optimisent l'inférence longue durée — pas seulement l'entraînement — sont du bon côté de la bascule.
Mon avis, pour être tout à fait clair : la prochaine étape décisive ne sera pas une boucle de plus. Ce sera le jour où un modèle apportera une méthode nouvelle, pas seulement un résultat de plus avec des méthodes existantes. Le défi de von Hippel avait d'ailleurs une deuxième cible, la supergravité N=8 à sept boucles, où la boîte à outils bootstrap est nettement plus mince. Rien n'indique qu'elle soit tombée. C'est là que se jugera la suite.
❌ Erreurs courantes
Erreur 1 : « L'IA a fait une découverte physique »
Non. Le solve a utilisé des méthodes bootstrap connues et ne revendique aucune physique nouvelle. La prouesse est d'exécution et d'autonomie, pas de conceptualisation. La bonne lecture : une avancée d'automatisation de la recherche, pas une révolution théorique.
Erreur 2 : « 100 $ de compute, donc tout labo peut le refaire »
Les ~100 $ ne couvrent que le CPU du bootstrap. Le poste dominant, c'est l'inférence : 900 à 1 900 $. Et il faut surtout un expert capable de valider — Dixon y a passé deux semaines. Budgétez la vérification, pas seulement la génération.
Erreur 3 : « Les théoriciens sont remplacés »
Les deux instigateurs sont des physiciens d'Anthropic ; le validateur est l'un des meilleurs spécialistes mondiaux du domaine. L'outil compresse le temps de dérivation, pas le jugement scientifique. Traitez ces agents comme des multiplicateurs de force pour équipes formées, pas comme des remplaçants.
Erreur 4 : « Fable 5.1 a battu GPT-6 »
Les deux résultats ne sont pas comparables : l'un est agent-led avec validation par Dixon, l'autre human-led et publié sur Zenodo. Réduire l'épisode à un duel de scores est une erreur de catégorie. Pour situer les modèles sur des bases saines, voir notre comparatif Claude, GPT, Gemini, Llama 2026 et notre comparatif honnête Claude 4 vs GPT-5 vs Gemini 3.
❓ Questions fréquentes
Qu'est-ce qu'une amplitude « à neuf boucles » ?
En théorie quantique des champs, c'est l'ordre de la correction quantique calculée dans le développement perturbatif. Chaque boucle ajoute de la précision — et une explosion combinatoire de complexité. À neuf boucles et six particules, le calcul dépassait tout ce qu'une équipe humaine avait produit : le record était à huit boucles, établi en 2023.
Le résultat est-il validé scientifiquement ?
À deux niveaux, oui. En interne, deux dérivations indépendantes (bootstrap direct et form factor) concordent sur les 107 053 coefficients. En externe, Lance Dixon l'a vérifié pendant deux semaines par une voie tierce. La publication avec comité de lecture reste à venir, mais ce niveau de recoupement est rare pour une annonce de ce type.
Combien coûterait une reproduction ?
Entre 1 000 et 2 000 $ par approche, dont l'essentiel en temps d'inférence du modèle ; le compute brut du bootstrap ne pèse que ~100 $ (96 CPU pendant une semaine). S'y ajoute le vrai coût caché : l'accès à un expert capable de valider le résultat.
Pourquoi le N=4 super Yang-Mills plutôt que le monde réel ?
Parce que c'est le laboratoire théorique idéal : sa supersymétrie maximale fournit des contraintes exactes qui rendent le bootstrap possible. Les résultats ne décrivent pas directement notre univers, mais les outils — désormais automatisés — irriguent la physique des amplitudes au sens large.
Fable 5.1 ou GPT-6 : lequel choisir pour la science ?
Les deux ont atteint les neuf boucles, dans des rôles opposés : Fable 5.1 en agent autonome dans Claude Science, GPT-6 en assistant d'une équipe humaine. Le bon choix dépend de votre protocole plus que d'un classement — notre comparatif 2026 détaille les forces de chaque famille.
Les physiciens théoriciens vont-ils disparaître ?
Non, et cet épisode le prouve : les instigateurs sont des physiciens, la validation a exigé deux semaines d'un expert de premier plan, et la méthode bootstrap elle-même est un héritage humain. Ce qui disparaît, c'est le monopole des très grandes équipes sur les calculs les plus lourds.
✅ Conclusion
Pour 2 000 $, une phrase de prompt et quelques jours d'autonomie, la frontière de la physique des amplitudes a reculé d'une boucle — et c'est le protocole, plus que le record, que les laboratoires vont retenir. Si vous devez choisir un modèle pour ce type de travail de longue haleine, commencez par notre sélection des meilleurs LLM pour coder : écrire du code exact, comme le bootstrap SymPy de cet épisode, reste le premier filtre à passer.