📑 Table des matières

ScholarCatalyst : le benchmark CMU/Stanford qui mesure la capacité d'une IA à trouver les papiers qui inspirent de vraies recherches

Deep Tech 🟢 Débutant ⏱️ 13 min de lecture 📅 2026-10-05

ScholarCatalyst : le benchmark CMU/Stanford qui mesure la capacité d'une IA à trouver les papiers qui inspirent de vraies recherches

🔎 Vos agents de recherche trouvent des papiers pertinents. Pas forcément les bons.

Les agents de recherche IA se sont multipliés en 2026. Ils lisent, synthétisent, rédigent des revues de littérature, proposent des hypothèses. Mais posez la question qui fâche : comment sait-on qu'ils trouvent les bons papiers — ceux qui font réellement avancer un projet ? Jusqu'ici, la réponse tenait en trois proxys datés : pertinence, QA, citations.

Le 2 octobre 2026, une équipe issue de Stanford, CMU, UW, SNU, AI2 et MIT — signée entre autres par Chelsea Finn, Omar Khattab, Yejin Choi, Pang Wei Koh et Graham Neubig — publie ScholarCatalyst (arXiv 2610.02202, 57 pages). Le premier benchmark qui mesure l'« inspiration scientifique » jugée par les auteurs eux-mêmes. Pas les citations. Pas la pertinence. L'inspiration.

Le constat est cinglant : la recherche agentique ne fait pas mieux qu'un retrieval par embeddings (0,42 contre 0,48 de Recall@20). Le maillon manquant des agents de recherche n'est ni le LLM, ni le harness. C'est le signal d'évaluation.


L'essentiel

  • 184 auteurs principaux de 207 papiers récents en informatique ont étiqueté eux-mêmes les publications antérieures qui ont fait — ou auraient pu faire — avancer leur travail, avec justifications détaillées.
  • 894 requêtes (207 CoreQ + 687 SubQ) sur un corpus de 191 000 papiers, restreint temporellement pour exclure toute contamination.
  • La recherche agentique perd contre les embeddings : 0,42 contre 0,48 de Recall@20, alors qu'elle utilise le même retriever en outil.
  • Un agent basé sur Claude Fable 5.1, possiblement exposé aux papiers en entraînement, plafonne à 0,51 R@20 : il rate encore près d'un papier d'inspiration sur deux.
  • Les retrievers scientifiques (SPECTER2, OpenScholar) perdent 16 à 27 points face aux denses généralistes, qui placent 39 % des papiers d'inspiration dans le top 20 (CoreQ) et 51 % (SubQ).
  • Premier benchmark fondé sur l'inspiration jugée par les auteurs, avec requêtes pré-découverte et corpus temporellement restreint.
  • Pipeline automatisé : un arXiv ID suffit pour générer de nouvelles données annotables par les auteurs. Le benchmark croît avec la littérature.

Outils recommandés

Outil Usage principal Prix (octobre 2026) Idéal pour
ScholarCatalyst Évaluer un retriever ou un agent sur l'inspiration scientifique Gratuit (benchmark ouvert) Équipes qui construisent des agents de recherche
OpenScholar (AI2) QA scientifique avec sources Gratuit (open source) Baseline documentaire — en sachant qu'il perd 16 à 27 points sur l'inspiration
SPECTER2 (AI2) Embeddings de papiers scientifiques Gratuit (open source) Recherche sémantique sur un corpus interne
Hostinger Héberger un portail de veille ou un blog d'analyse IA Dès ~3 €/mois (octobre 2026, vérifiez sur hostinger.com) Publier votre veille et vos résultats d'évaluation

Les chiffres SPECTER2 et OpenScholar proviennent de l'évaluation publiée dans ScholarCatalyst. Si vous ne retenez qu'une chose de ce tableau : testez vos embeddings d'abord, le reste ensuite.


Qu'est-ce que ScholarCatalyst, et pourquoi les citations ne suffisaient plus

ScholarCatalyst est un benchmark de retrieval scientifique dont la vérité terrain vient des auteurs des papiers eux-mêmes — pas des citations, pas d'annotateurs externes.

Le protocole tient en une phrase : demander à 184 auteurs principaux de 207 papiers récents en informatique quels papiers antérieurs ont fait avancer leur projet — ou auraient pu le faire — et pourquoi. Chaque étiquetage s'accompagne d'une justification détaillée. On ne demande pas « ce papier est-il pertinent ? » mais « sans lui, votre projet aurait-il été le même ? ».

De ces annotations découlent 894 requêtes :

  • 207 CoreQ : la question centrale du projet de recherche ;
  • 687 SubQ : les sous-questions décomposées, qui élargissent la surface d'évaluation.

Le corpus compte 191 000 papiers, et c'est le détail qui change tout : il est restreint temporellement. Pour chaque requête, le corpus s'arrête avant le début du projet source — et avant le knowledge cutoff des modèles antérieurs aux papiers sources. Un modèle ne peut pas « se souvenir » de la réponse : il doit la trouver.

Pourquoi l'inspiration plutôt que la pertinence ? Parce que la promesse vendue depuis deux ans, c'est l'« AI co-scientist » : une machine qui trouve l'idée manquante. Cette promesse n'avait jamais été testée sur une tâche réaliste — retrouver, avant la découverte, les travaux qui la rendent possible.

Le problème des citations

Compter les citations, c'est mesurer la visibilité d'un papier, pas son influence réelle. Une citation peut être de politesse, d'obligation méthodologique ou d'auto-promotion. Et surtout : il faut des années pour qu'elle existe.

ScholarCatalyst inverse la logique. Le benchmark ne demande pas aux IA de retrouver ce qui a été cité, mais de retrouver ce qui aurait dû être trouvé. C'est une tâche contrefactuelle — et c'est précisément ce qui la rend proche du vrai travail de recherche.

Un benchmark qui grandit avec la littérature

Dernier point technique, et non le moindre : le pipeline est automatisé. Un arXiv ID suffit pour produire des données annotables par les auteurs. ScholarCatalyst n'est donc pas un snapshot figé : il peut croître au rythme de la littérature, avec des requêtes toujours pré-découverte et un corpus toujours restreint.


Les chiffres : l'agentique perd contre les embeddings

La recherche agentique ne fait pas mieux que le retrieval par embeddings : 0,42 contre 0,48 de Recall@20. Et l'agent utilisait le même retriever en outil.

Autrement dit, toute la machinerie — décomposition de requêtes, itérations, raisonnement multi-étapes — n'apporte pas une seule information que le retriever n'avait pas. Pire : elle dégrade le résultat.

Approche Recall@20 Ce qu'on retient
Retrieval par embeddings (denses généralistes) 0,48 Le plancher à battre
Recherche agentique (même retriever en outil) 0,42 L'orchestration dégrade
Agent basé sur Claude Fable 5.1 0,51 Même avec contamination possible, l'écart reste mince

Un agent qui enchaîne trente appels de LLM pour perdre six points de Recall, ce n'est pas une innovation. C'est une facture.

Claude Fable 5.1 à 0,51 : la contamination en question

L'agent le plus performant du benchmark repose sur Claude Fable 5.1 — un modèle qui a pu voir les papiers en entraînement, précisent les auteurs. Même dans ce cas favorable, il atteint 0,51 R@20 : il rate encore près d'un papier d'inspiration sur deux dans le top 20.

C'est le chiffre à opposer à quiconque vous vend un « agent de recherche autonome ». Sur les questions centrales (CoreQ), les retrievers denses généralistes ne placent que 39 % des papiers d'inspiration dans le top 20 — 51 % sur les sous-questions (SubQ). Six papiers capitaux sur dix manquent à l'appel.

Ce n'est pas un cas isolé

Le résultat converge avec SciNet (arXiv 2601.03260), un benchmark relation-aware publié en janvier 2026 : 269 millions de papiers, 8 940 tâches, et une précision d'agents souvent inférieure à 20 % sur les tâches relationnelles. Deux benchmarks indépendants, deux méthodologies, même diagnostic.

Ma lecture : le goulot d'étranglement est informationnel, pas procédural. Un agent peut raisonner autant qu'il veut — s'il n'a pas le bon document dans son contexte, il raisonne dans le vide.


Pourquoi les retrievers « scientifiques » perdent 16 à 27 points

Les retrievers spécialisés pour la science perdent 16 à 27 points face aux retrievers denses généralistes sur les requêtes d'inspiration.

Les généralistes placent donc 39 % des papiers d'inspiration dans le top 20 (CoreQ) et 51 % (SubQ), quand SPECTER2 et OpenScholar — conçus précisément pour la littérature scientifique — font nettement moins bien.

L'hypothèse la plus plausible : ces retrievers sont entraînés sur des signaux de citation. Ils apprennent donc les biais des citations — popularité, récence, effet de communauté — et non l'inspiration. Or une requête du type « qu'est-ce qui aurait débloqué ce projet ? » n'a aucune signature statistique de citation. Le spécialiste est entraîné sur la mauvaise cible.

La leçon dépasse le cas scientifique : la spécialisation par domaine n'est pas une stratégie d'évaluation. Sur des requêtes d'inspiration, la qualité du signal d'entraînement compte plus que le vocabulaire du domaine.


Le maillon manquant des agents de recherche

ScholarCatalyst comble le vide entre « trouver des papiers pertinents » et « trouver des papiers utiles à une découverte ». C'est exactement le trou que personne ne mesurait.

Les benchmarks existants — SciFact, DORIS-MAE, ScholarQABench, LitSearch, MIR — évaluent la vérification d'affirmations, le QA de littérature ou la pertinence du retrieval. Aucun, soulignent les auteurs dans le papier, ne repose sur l'inspiration jugée par les auteurs, avec requêtes pré-découverte et corpus temporellement restreint. On testait la lecture, pas l'impact.

ScholarCatalyst s'inscrit d'ailleurs dans une vague 2026 de benchmarks qui mesurent des dynamiques réelles plutôt que des scores de façade : OmniGameArena évalue la dynamique d'apprentissage d'agents VLM dans des jeux sous Unreal Engine 5, FutureSim fait rejouer trois mois d'événements réels aux agents, et Homebody montre un humanoïde de Stanford piloté sans policy apprise — 7/100 sur le benchmark desks, et ce chiffre brut fait justement partie de la valeur. ScholarCatalyst applique la même exigence à la science : juger l'impact réel, pas la performance déclarée.

Pourquoi est-ce le maillon manquant ? Parce que sans ce signal, les équipes optimisent ce qui est mesurable — pertinence, latence, coût — pas ce qui compte. On obtient des agents qui trouvent 50 papiers moyennement pertinents au lieu des 3 qui auraient tout changé.


Trois leçons si vous construisez un agent de recherche

Le papier se lit en une soirée et change trois décisions de conception. Voici les leçons, dans l'ordre où je les prioriserais.

1. Benchmarkez le retriever seul, avant le harness

0,42 contre 0,48 : si votre pipeline agentique n'améliore pas le Recall@20 de votre retriever de base, il n'apporte rien — il coûte. Mesurez d'abord les embeddings seuls, puis n'ajoutez l'orchestration que si elle dépasse ce plancher. C'est le même constat que dans notre analyse sur la couche harness, devenue une infrastructure à part entière : l'orchestration est un produit, pas une correction de retrieval.

2. Traquez la contamination systématiquement

Un agent qui a pu ingérer le corpus en pré-entraînement n'est pas évalué : il se souvient. Restreignez temporellement vos jeux d'évaluation, comme le fait ScholarCatalyst avec ses 191 000 papiers arrêtés avant le début de chaque projet. Toute métrique obtenue sur un corpus postérieur au cutoff du modèle doit être traitée comme suspecte.

3. Faites juger l'utilité par des humains qui savent

La pertinence se mesure automatiquement ; l'utilité, non. Les 184 auteurs de ScholarCatalyst ont justifié chaque étiquetage — c'est ce qui donne au benchmark sa valeur. Dans votre contexte, l'équivalent : faites juger vos résultats par les personnes qui mènent réellement les projets. La mémoire des agents devient par ailleurs un produit à part entière — voir Hindsight — et elle aide à accumuler le contexte au fil des sessions. Mais aucune mémoire ne crée le signal : il faut un jugement humain sur ce qui a été utile.

Notez au passage : quel que soit le moteur de raisonnement choisi — Gemini 3.1 Pro, GPT-5.5, Claude Opus 4.7 — le goulot d'étranglement identifié ici se situe en amont du LLM. Changer de modèle ne répare pas un retriever qui rate.


Les limites qu'il faut connaître

ScholarCatalyst est le benchmark le plus rigoureux du genre, mais trois limites méritent d'être posées à plat.

Le jugement reste humain et a posteriori. 184 auteurs avec justifications détaillées, c'est solide — mais l'inspiration se juge après coup. Les requêtes pré-découverte et le corpus restreint limitent la fuite d'information, pas la subjectivité du jugement.

L'informatique seulement, pour l'instant. Les 207 papiers sources viennent de l'informatique. La généralisation à la biologie, la médecine ou la physique reste à démontrer. Le pipeline automatisé (un arXiv ID suffit) est la réponse des auteurs — à confirmer en pratique.

Le contrefactuel dilue peut-être le signal. Les 687 SubQ portent sur des papiers qui « auraient pu » faire avancer le projet. C'est utile — la recherche avance aussi par les papiers manqués — mais moins tranché que le « a fait avancer » des CoreQ.

Aucune de ces limites n'invalide le benchmark. Elles en définissent le périmètre : l'informatique, l'inspiration, le jugement d'auteur.


❌ Erreurs courantes

Erreur 1 : Prendre les citations pour une mesure d'impact

Une citation mesure la visibilité, pas l'influence : citations de politesse, auto-citations, obligations méthodologiques. La solution : dans vos évaluations internes, faites juger l'utilité réelle par les utilisateurs finaux — ou appuyez-vous sur un benchmark fondé sur des jugements d'auteurs comme ScholarCatalyst.

Erreur 2 : Empiler de l'agentic sur un retriever médiocre

0,42 contre 0,48 : le raisonnement itératif ne rattrape pas un retriever qui rate les bons papiers. La solution : benchmarkez le retriever seul (Recall@20), et n'ajoutez l'orchestration que si elle bat ce score. Sinon, vous n'avez pas construit un agent — vous avez construit un coût.

Erreur 3 : Évaluer sur un corpus que le modèle a pu voir

Un score flatteur sur un corpus postérieur au knowledge cutoff ne prouve rien : le modèle a pu mémoriser. La solution : restreignez temporellement vos jeux d'évaluation, avant le cutoff de chaque modèle testé — la méthode des 191 000 papiers de ScholarCatalyst.


❓ Questions fréquentes

Qu'est-ce que ScholarCatalyst ?

Un benchmark de retrieval scientifique publié le 2 octobre 2026 (arXiv 2610.02202, 57 pages) par des équipes de Stanford, CMU, UW, SNU, AI2 et MIT. 184 auteurs de 207 papiers y étiquettent les publications antérieures qui ont fait ou auraient pu faire avancer leur recherche : 894 requêtes, corpus de 191 000 papiers restreint temporellement.

Pourquoi la recherche agentique perd-elle contre les embeddings ?

Parce que l'agent utilise le même retriever en outil : le raisonnement en plusieurs étapes n'ajoute aucune information que le retriever n'a pas. Résultat : 0,42 contre 0,48 de Recall@20. Même l'agent basé sur Claude Fable 5.1, avantagé par une possible exposition en entraînement, plafonne à 0,51.

Quels modèles et retrievers ont été testés ?

Le papier compare le retrieval par embeddings (0,48 R@20), la recherche agentique avec le même retriever en outil (0,42) et un agent fondé sur Claude Fable 5.1 (0,51), ainsi que les retrievers scientifiques SPECTER2 et OpenScholar, qui perdent 16 à 27 points face aux denses généralistes. Le détail complet tient dans les 57 pages du papier.

Quelle différence avec SciNet ?

SciNet (arXiv 2601.03260) évalue les agents sur 269 millions de papiers et 8 940 tâches relationnelles, avec une précision souvent inférieure à 20 %. ScholarCatalyst mesure autre chose : l'inspiration jugée par les auteurs, sur 894 requêtes et 191 000 papiers. Les deux se complètent plus qu'ils ne se remplacent.

Comment utiliser ScholarCatalyst pour mon projet ?

Le pipeline est automatisé : un arXiv ID suffit pour produire des données annotables par les auteurs. Vous pouvez évaluer votre retriever ou votre agent sur les 894 requêtes existantes, ou contribuer de nouvelles tâches à mesure que la littérature avance. Point de départ : le papier.


✅ Conclusion

ScholarCatalyst ne dit pas que les agents de recherche sont mauvais : il prouve, chiffres à l'appui, qu'on les évaluait jusqu'ici sur la mauvaise question — et que sur la bonne, même les meilleurs systèmes ratent un papier d'inspiration sur deux. Lisez le papier complet, puis benchmarkez votre retriever. Et si vous documentez vos évaluations en ligne, Hostinger fait tourner votre portail de veille pour quelques euros par mois (octobre 2026, vérifiez sur hostinger.com).