27,5% du web est déjà généré par IA : la preprint qui chiffre l'empoissonnement des données d'entraînement
🔎 Le web bascule silencieusement
Une prépublication arXiv du 30 septembre 2026 vient de poser un chiffre sur la table : 27,5% des tokens des crawls web de qualité (FineWeb, juin 2026) sont générés par IA. Deux mois plus tard, en août 2026, la proportion grimpe à 31,1%. Pour mémoire, elle n'était que de 10,1% en juin 2024 et de 0,1% en juin 2021. L'accélération est exponentielle.
Les chercheurs ont entraîné 800 modèles de langue (de 19,9 millions à 973 millions de paramètres) en variant systématiquement le ratio de tokens IA injectés dans les données d'entraînement. Le verdict : un léger bénéfice pour les modèles en sous-données humaines, puis une inversion nette en territoire négatif dès qu'on dépasse un seuil de satiation. Entraîner sur le web non filtré au taux d'août 2026 coûte déjà 1,6x plus de compute qu'un sous-ensemble purement humain. D'ici 2028, la facture monte à 3,0x.
Ce n'est plus une spéculation. C'est une loi d'échelle à deux termes — bénéfice puis nuisance — mesurée expérimentalement. Et elle change la donne pour quiconque entraîne, fine-tune ou déploie des modèles aujourd'hui.
L'essentiel
- 27,5% des tokens web de qualité (juin 2026) sont IA — 31,1% en août 2026, contre 10,1% en juin 2024 (source : arXiv 2609.40295).
- Loi d'échelle en U inversé : les tokens IA aident les modèles "data-starved", puis dégradent les performances au-delà d'un point de satiation.
- Coût compute : +60% pour entraîner sur le web non filtré actuel, +200% projeté pour 2028.
- Filtres qualité complices : FineWeb et DCLM favorisent le texte IA au lieu de le filtrer.
- Conflit d'intérêt à signaler : 4 des 7 auteurs sont de Pangram Labs, vendeur du détecteur utilisé pour labelliser.
Outils recommandés
| Outil | Usage principal | Prix (octobre 2026) | Idéal pour |
|---|---|---|---|
| Pangram Detector | Détection IA à grande échelle | Sur devis | Équipes data curation, labs LLM |
| FineWeb | Corpus web filtré qualité | Gratuit (open) | Pré-entraînement, recherche |
| DCLM Baseline | Pipeline filtrage données | Gratuit (open) | Construction datasets custom |
| Hostinger | Hébergement sites IA-ready | 2,99€/mois (oct 2026, vérifiez sur hostinger.fr) | Déploiement apps LLM légères |
La mesure : comment on arrive à 27,5%
Un échantillon de 310 000 documents sur 5 ans
L'étude couvre 310 000 documents échantillonnés de janvier 2021 à août 2026, passés au crible du classifieur Pangram 4 (AUROC 0,9916, faux positifs 0,0041%, faux négatifs 0,3396%). Le corpus source : les crawls FineWeb, déjà filtrés pour la qualité — ce qui rend le chiffre d'autant plus inquiétueux. Ce ne sont pas les égouts du web. C'est le "bon" web.
L'explosion par format et sujet
La contamination n'est pas uniforme. Selon le rapport technique Pangram 4 (arXiv 2607.27183), plus d'un tiers des nouveaux contenus internet seraient IA. Les posts longs sur réseaux sociaux : 26%. Les articles de presse : 9%. Les reviews de conférences ML : 21%. Certains sujets techniques (programmation, SEO, marketing) saturent plus vite que d'autres.
Pourquoi les filtres qualité laissent passer
C'est le point le plus contre-intuitif. FineWeb et DCLM favorisent le texte IA. Leurs heuristiques (longueur, cohérence, absence de bruit, structure HTML propre) sélectionnent préférentiellement la sortie des LLM — qui est par construction fluide, structurée, sans fautes. Le texte humain brut, lui, est chaotique. Les filtres "qualité" deviennent des aimants à synthétique.
L'expérience : 800 modèles, une loi d'échelle à deux termes
Le protocole : ratio IA variable, compute constant
Les auteurs ont entraîné 800 modèles (19,9M à 973M paramètres) en injectant du texte "sauvage" (WildAI, 83 milliards de tokens labellisés par sujet, format, source) dans des proportions contrôlées. Budget de tokens humains fixé, compute identique. Seule variable : le pourcentage de tokens IA.
Résultat : bénéfice marginal, puis effondrement
Pour les modèles sous-alimentés en données humaines (régime "data-starved"), ajouter 10-20% de tokens IA améliore légèrement la perplexité. Le texte synthétique apporte de la diversité lexicale, comble des trous de couverture. Mais dès qu'on dépasse le point de satiation — variable selon la taille du modèle et la qualité du texte humain disponible — la courbe s'inverse. Chaque token IA ajouté dégrade les performances.
La loi d'échelle à deux termes
Les chercheurs formalisent : Performance = f(tokens_humains) + g(tokens_IA, tokens_humains). Le second terme est positif puis négatif. Ce n'est pas une loi de puissance simple. C'est une fonction non-monotone. Répéter du texte humain (data augmentation) bat systématiquement l'ajout de texte IA, même de haute qualité.
Coût compute : 1,6x aujourd'hui, 3x en 2028
À taux de contamination d'août 2026 (31,1%), atteindre la performance d'un modèle entraîné sur données purement humaines demande 1,6x le compute (au ratio standard ~20 tokens/paramètre). En extrapolant la croissance exponentielle observée (0,1% → 10,1% → 31,1% en 5 ans), le facteur passe à 3,0x d'ici 2028. Soit tripler le budget GPU pour le même résultat.
Le biais d'intérêt : Pangram juge et partie
4 auteurs sur 7 affiliés à Pangram Labs
Quatre des sept signataires de la preprint (arXiv 2609.40295) sont employés de Pangram Labs, l'entreprise qui commercialise le détecteur utilisé pour produire les labels "IA vs humain" de l'étude. Le détecteur Pangram 4 (arXiv 2607.27183) affiche des métriques impressionnantes (AUROC 0,9916), mais l'éditeur a un intérêt direct à ce que le problème paraisse massif et mesurable.
Le détecteur comme produit
Pangram vend l'API de détection. Plus le "problème IA sur le web" est quantifié, plus la solution (leur classifieur) a de la valeur. L'étude publie le corpus WildAI (83B tokens) et le code — ce qui est louable — mais la chaîne de mesure entière dépend d'une boîte noire commerciale. Aucun détecteur tiers indépendant n'a validé les 27,5% / 31,1%.
Faux positifs / faux négatifs : l'impact sur les chiffres
Avec un taux de faux négatifs de 0,3396%, le détecteur sous-estime légèrement la part IA. Mais le taux de faux positifs (0,0041%), bien que minuscule, appliqué à des milliards de tokens humains, peut créer du bruit. Surtout : la calibration du seuil de décision (binaire IA/humain) n'est pas discutée dans la preprint. Un seuil plus conservateur ferait chuter le pourcentage.
Ce qu'il faut en retenir
Les chiffres sont probablement dans la bonne fourchette d'ordre de grandeur — la trajectoire 0,1% → 10% → 30% en 5 ans est cohérente avec l'adoption massive des LLM. Mais la précision à la virgule près (27,5% vs 28,1%) doit être prise avec des pincettes. La transparence des auteurs sur leur affiliation est présente dans le papier, mais absente de la plupart des reprises médiatiques.
Conséquences pratiques pour l'entraînement et le déploiement
La curation de données devient critique
Si les filtres qualité (FineWeb, DCLM) sélectionnent le texte IA, la réponse n'est pas "plus de filtrage qualité". C'est filtrage provenance + détection IA + seuils adaptatifs. Les pipelines de pré-entraînement doivent intégrer une étape de détection avant le scoring qualité. Coût additionnel : non négligeable, mais inférieur au 1,6x compute.
Le "human data" devient actif stratégique
Les acteurs qui possèdent des corpus humains vérifiés, datés, pré-2023 (Common Crawl ancien, Wikipedia snapshots, livres, code open source pré-Copilot) détiennent une ressource qui s'apprécie. La rareté de la donnée humaine propre devient le goulot d'étranglement n°1, devant le compute.
Fine-tuning et RAG : même problème
Ce n'est pas qu'une histoire de pré-entraînement. Fine-tuner sur des datasets synthétiques (générés par GPT-5.5, Claude Opus 4.7, Gemini 3 Pro) reproduit le même phénomène : bénéfice initial, puis saturation. Pour le RAG, l'indexation de contenu web "fraîchement" généré par IA injecte du bruit dans la base de connaissances. Voir notre guide sur comment entraîner son avatar IA avec ses propres données pour les garde-fous.
Search et SEO : la boucle se referme
Google Search est désormais 100% généré par l'IA (AIO, AI Overviews). Les réponses synthétiques sont réinjectées dans le web, recrawlées, redétectées comme IA, et le cycle continue. L'article Google Search est désormais 100% généré par l'IA : la fin des « ten blue links » et le séisme pour tout le web détaille ce basculement. Pour les éditeurs, un site sans IA est déjà obsolète en 2026 — mais l'IA doit être maîtrisée, pas subie.
Réponses de l'écosystème : détecteurs, watermarking, paiement
Détecteurs : course à l'armement
Pangram, GPTZero, Originality.ai, Turnitin — le marché de la détection explose. Mais aucun détecteur n'est robuste face à l'adversarial (paraphrase, température élevée, fine-tuning sur style humain). La détection reste un signal probabiliste, pas une vérité binaire.
Watermarking : promesse non tenue
Google (SynthID), OpenAI, Meta ont annoncé du watermarking statistique. En octobre 2026, aucun déploiement massif n'est effectif sur les modèles grand public. Les modèles open-weights (Llama, Mistral, DeepSeek, Qwen) n'en ont pas. Le watermarking ne couvre que les API propriétaires — une minorité du volume généré.
Cloudflare et la monétisation du scraping
Cloudflare propose désormais de faire payer l'IA pour scraper le web. Les bots sont devenus la majorité du trafic internet. Cela ne résout pas la contamination des données déjà crawlés, mais change l'économie de la collecte future.
NeurIPS 2026 : 28 soumissions rejetées pour IA générée
La conférence NeurIPS 2026 a rejeté 28 soumissions détectées comme générées par IA. Le monde académique commence à sévir — mais les détecteurs utilisés (souvent Pangram ou GPTZero) héritent des mêmes limites.
❌ Erreurs courantes
Erreur 1 : Croire que "plus de données = mieux" sans distinguer la provenance
Injecter du Common Crawl brut dans son pipeline d'entraînement aujourd'hui dégrade le modèle. Le ratio IA/humain a basculé. Solution : auditer son corpus avec un détecteur (même imparfait), fixer un seuil max (ex: <5% tokens IA), compléter par des sources humaines vérifiées.
Erreur 2 : Faire confiance aux filtres qualité standards (FineWeb, DCLM) pour nettoyer
Ces filtres amplifient la part IA. Ils sélectionnent la fluidité, l'IA en produit à l'échelle industrielle. Solution : ajouter une étape de détection IA avant le scoring qualité, ou utiliser des corpus "gelés" pré-2023 comme ancre.
Erreur 3 : Ignorer le conflit d'intérêt Pangram dans sa veille
Citer "27,5% du web est IA" sans mentionner que le chiffre vient d'un détecteur commercial vendu par 4 des 7 auteurs, c'est de la reprise de communiqué, pas du journalisme. Solution : toujours croiser avec une estimation indépendante, ou présenter la fourchette avec la réserve méthodologique.
Erreur 4 : Penser que le watermarking va résoudre le problème
Il n'y a pas de watermarking universel déployé en octobre 2026. Les modèles open-weights (qui génèrent une part massive du volume) n'en ont pas. Solution : ne pas attendre la solution technique magique, construire sa propre chaîne de traçabilité données.
❓ Questions fréquentes
Le chiffre de 27,5% concerne-t-il tout internet ou seulement le web "de qualité" ?
Uniquement les crawls FineWeb (filtrés qualité). Le web brut (Common Crawl non filtré) a probablement un taux plus élevé, mais l'étude ne le chiffre pas. Le 27,5% est donc une borne inférieure sur le web exploitable pour l'entraînement.
Pourquoi répéter du texte humain bat-il l'ajout de texte IA ?
Le texte humain, même répété, conserve la distribution naturelle du langage (idiosyncrasies, erreurs cohérentes, style personnel). Le texte IA, même de haute qualité, introduit une distribution synthétique qui biaise le modèle vers la "moyenne LLM" — perte de diversité, mode collapse latent.
Le point de satiation est-il le même pour tous les modèles ?
Non. Il dépend de : (1) la taille du modèle (plus grand = satiation plus tardive), (2) la quantité de données humaines disponibles (moins de données humaines = satiation plus précoce), (3) la qualité relative du texte IA vs humain. L'étude cartographie cette surface pour 800 configurations.
Faut-il arrêter d'utiliser du web crawl pour entraîner ?
Pas nécessairement. Mais il faut le curer activement. Les labs qui continuent sur du Common Crawl brut sans détection IA paient déjà la taxe du 1,6x compute. D'ici 2028, ce sera 3x. La curation devient rentable bien avant.
Les modèles actuels (GPT-5.5, Gemini 3 Pro, Claude Opus 4.7) sont-ils affectés ?
Oui. Ils ont été entraînés sur des données coupées avant l'explosion 2024-2026 (cutoff généralement fin 2023 / début 2024). Les prochains cycles d'entraînement (GPT-6, Gemini 4, Claude 5) devront gérer ce problème frontalement. C'est pour cela que la preprint importe maintenant.
✅ Conclusion
Le web a basculé. Près d'un tiers des tokens "de qualité" sont maintenant synthétiques, et les filtres qu'on utilise pour nettoyer les données aggravent le problème. La loi d'échelle mesurée sur 800 modèles est sans appel : au-delà d'un seuil, chaque token IA ajouté coûte de la performance. Le compute nécessaire pour compenser double tous les 18 mois.
Le chiffre exact (27,5% vs 31,1%) mérite réserve — le détecteur est commercial, les auteurs sont juges et parties. Mais la trajectoire est indéniable. Qui n'a pas de stratégie de curation données humaines vérifiées pour ses prochains entraînements paiera la taxe exponentielle. La rareté n'est plus le compute. C'est l'humain.