TypeSafe AI sort du stealth avec 40 M$ : Diogo Almeida (co-inventeur de ChatGPT) veut remplacer les LLM par des modèles composables pour que des machines, pas des humains, les utilisent
🔎 Le co-inventeur de ChatGPT vient de déclarer la guerre au chat
Pendant que toute l'industrie s'entasse sur la même équation — des modèles toujours plus gros, entraînés à parler comme des humains, revendus au token via API — Diogo Almeida vient de rompre les rangs. Le 16 septembre 2026, sa startup TypeSafe AI sort du stealth avec 40 M$ de seed mené par DCVC (Business Wire via Yahoo Finance, 15 septembre 2026).
Sa thèse tient en une phrase, et elle dérange : les modèles devenus excellents pour parler aux humains ne sont pas les bons modèles pour faire tourner du logiciel. Derrière ce constat, une société fondée en 2024 à San Francisco avec Erik Gafni et Sasha Sheng, et un premier produit au nom étrangement austère : Jev.
Ce qui rend l'histoire intéressante, c'est le CV. Chez OpenAI, Almeida a co-inventé RLHF et travaillé sur InstructGPT, ChatGPT et GPT-4. Autrement dit : il a contribué à bâtir le paradigme qu'il attaque aujourd'hui. Et DCVC a mis 40 M$ sur la table — un seed au 99e percentile de tous les seeds IA de l'histoire selon Dealroom (échantillon de 28 473 deals, septembre 2026).
Voici ce qu'il faut retenir, et ce qu'il faut vérifier avant de réécrire votre architecture.
L'essentiel
- TypeSafe AI sort du stealth le 16 septembre 2026 avec un seed de 40 M$ mené par DCVC — au 99e percentile des seeds IA de l'histoire (Dealroom, sept. 2026).
- Fondée en 2024 à San Francisco par Diogo Almeida (ex-OpenAI : RLHF, InstructGPT, ChatGPT, GPT-4), Erik Gafni et Sasha Sheng.
- Premier modèle : Jev, une « intelligence machine-native composable » qui renvoie des décisions structurées avec des scores de confiance calibrés — pas du texte conversationnel, avec une latence annoncée inférieure à 100 ms et la capacité de traiter des centaines d'outputs en parallèle depuis un seul prompt.
- Tarifs publiés : 0,39 $ pour 1 000 workflows, contre 3,31 $ pour GPT-5.6 Luna (OpenAI) et 19,49 $ pour Claude Haiku 4.5 (Anthropic) (SiliconANGLE, sept. 2026).
- Prudence obligatoire : les multiples spectaculaires (194x plus rapide, 445x moins cher) sont auto-déclarés, mesurés sur des workflows conçus par TypeSafe elle-même (TS2.tech, sept. 2026).
Outils recommandés
| Outil | Usage principal | Prix (septembre 2026) | Idéal pour |
|---|---|---|---|
| Jev (TypeSafe AI) | Décisions structurées pour logiciels | 0,39 $ / 1 000 workflows | classification, triage, revue de sorties d'agents |
| GPT-5.6 Luna (OpenAI) | LLM conversationnel et agentique | 3,31 $ / 1 000 workflows | raisonnement complexe, génération de texte |
| Claude Haiku 4.5 (Anthropic) | LLM rapide multitâche | 19,49 $ / 1 000 workflows | production conversationnelle, pipelines agents |
| Modèles locaux (Ollama) | Classification simple en local | Gratuit (hors matériel) | données sensibles, coûts marginaux nuls |
Prix relevés par SiliconANGLE le 16 septembre 2026. Les grilles tarifaires des startups bougent vite : vérifiez sur le site de TypeSafe avant toute décision d'architecture.
Qui est Diogo Almeida, et pourquoi son CV change tout
Ce n'est pas un énième ex-OpenAI qui cherche un prétexte pour lever : c'est l'un des artisans du paradigme qu'il veut remplacer. Chez OpenAI, Almeida a co-inventé RLHF — la technique qui a rendu ChatGPT utilisable — puis travaillé sur InstructGPT, ChatGPT et GPT-4 (TechStartups, 16 septembre 2026).
Sa question de départ, postée sur X le 15 septembre 2026, mérite d'être lue telle quelle :
« After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI? »
Traduisez : pourquoi des modèles surhumains en conversation n'ont-ils pas produit d'AGI ? Sa réponse implicite fâche — parce que la conversation n'est probablement pas la bonne interface pour l'intelligence. On peut ne pas être d'accord avec cette conclusion ; on ne peut pas accuser l'homme de méconnaître le sujet.
Pendant ce temps, la course frontière continue de son côté : OpenAI empile les records avec GPT-6 Astra sur Terminal-Bench, la science et l'ARC-AGI-3. Deux visions cohabitent donc désormais ouvertement dans l'industrie : repousser les limites des modèles pour humains et agents, ou construire une autre catégorie de modèles pour le logiciel. Mon avis ? Les deux courants sont nécessaires, mais le second est structurellement sous-financé — d'où l'importance réelle de ce seed.
La thèse : l'intelligence doit vivre dans le logiciel, pas dans le chat
Pour TypeSafe, le problème n'est pas la capacité des modèles, c'est leur interface. Un chatbot optimise la production de texte pour un humain ; un logiciel, lui, a besoin de décisions typées, prévisibles et évaluables par une machine.
Almeida le formule sans détour : « most intelligence should eventually live inside software, running quietly in the background » — l'essentiel de l'intelligence devrait finir à l'intérieur du logiciel, en silence, en arrière-plan (TechStartups, sept. 2026).
Concrètement, Jev ne dialogue pas : il produit des décisions structurées, pas du texte conversationnel (SiliconANGLE, 16 sept. 2026). Il peut traiter des centaines d'outputs en parallèle depuis un seul prompt, et chaque décision arrive avec un score de confiance calibré. Le logiciel sait alors quoi faire : agir en autonomie au-dessus d'un seuil, déférer à un humain en dessous.
Pour y parvenir, TypeSafe ne se contente pas d'affiner un LLM existant : l'entreprise annonce une nouvelle méthode d'entraînement, le RLCD (TechStartups, sept. 2026). Les détails techniques restent minces à ce stade, mais l'intention est limpide : entraîner un modèle pour des utilisateurs machines dès le départ, plutôt que d'arracher la conversation d'un chatbot après coup.
Et ce n'est pas un cas isolé : le consensus « un LLM de chat pour tout » se fissure sur plusieurs fronts simultanément. Subquadratic s'attaque à l'attention quadratique avec 12 millions de tokens de contexte, Alibaba débarque avec la famille de modèles Qwen3.6, et TypeSafe attaque le front de l'usage. Trois angles d'attaque différents, une même conclusion : le monolithe chatbot n'est plus intouchable.
Jev en pratique : à quoi ressemble un modèle « pour machines »
Un modèle pour machines, ça ressemble à un composant : vous envoyez une entrée, Jev renvoie une décision typée accompagnée d'une probabilité, en moins de 100 ms annoncées. Pas de paragraphe à parser, pas de JSON à arracher à un modèle qui préfère bavarder.
Prenons un exemple concret. Un ticket arrive : « je n'arrive plus à me connecter depuis hier ». Aujourd'hui, vous appelez un LLM conversationnel, vous attendez une réponse en langage naturel, vous parsemez, vous espérez. Avec une approche machine-native, Jev renvoie directement quelque chose comme facturation.expiration → confiance 0,94. Votre routeur agit, ou ne le fait pas.
Les marchés visés par TypeSafe sont d'ailleurs volontairement prosaïques (SiliconANGLE, sept. 2026) :
- classification de requêtes support — router un ticket sans payer un appel LLM complet ;
- évaluation de factures — extraire un verdict et un niveau de confiance ;
- triage d'alertes sécurité — filtrer le bruit avant intervention humaine ;
- revue des sorties d'agents IA — un garde-fou programmatique sur ce que font vos agents.
Ce dernier point mérite qu'on s'y attarde. Si vous faites tourner des agents — avec les outils comparés dans notre sélection de LLM pour les agents IA comme OpenClaw ou Hermes — vous savez que le maillon faible, c'est la validation de leurs sorties. Un modèle spécialisé qui évalue chaque action d'agent avec une confiance calibrée, c'est exactement la brique qui manque à la plupart des pipelines agentiques actuels.
Nuance importante sur la latence : les 100 ms des communiqués sont un plafond marketing. TS2.tech relève des latences mesurées de 70 à 500 ms selon les workloads testés (sept. 2026). Ça reste un à deux ordres de grandeur sous un aller-retour LLM classique — mais mesurez sur vos données avant de promettre du temps réel à vos utilisateurs.
0,39 $ contre 19,49 $ : que valent vraiment les promesses chiffrées de Jev ?
Sur le prix, l'avantage est public et vérifiable. Sur la performance, restez prudent : les chiffres spectaculaires sont auto-déclarés.
Commençons par le solide. TypeSafe a publié ses tarifs : 0,39 $ pour 1 000 workflows, contre 3,31 $ pour GPT-5.6 Luna et 19,49 $ pour Claude Haiku 4.5 (SiliconANGLE, 16 sept. 2026). Même en retenant les quatre workflows de référence de l'entreprise, l'écart va de 8,5x à 50x. Et ça, aucun benchmark indépendant n'est nécessaire pour le constater : c'est une grille tarifaire, pas une promesse.
| Modèle | Coût pour 1 000 workflows | Écart vs Jev |
|---|---|---|
| Jev (TypeSafe) | 0,39 $ | — |
| GPT-5.6 Luna (OpenAI) | 3,31 $ | 8,5x |
| Claude Haiku 4.5 (Anthropic) | 19,49 $ | 50x |
TS2.tech traduit ce pricing en 0,042 $ par million de tokens, sans surcoût sur les tokens de sortie (sept. 2026). Pour un pipeline de classification qui en traite des millions par jour, la différence se chiffre en milliers d'euros mensuels — un million de décisions coûterait environ 390 $ avec Jev, 3 310 $ avec Luna et 19 490 $ avec Haiku 4.5, à partir des tarifs publiés.
Passons aux réserves. Les promesses « 20-200x plus rapide, 40-400x moins cher » et les tests internes affichant ~194x et ~445x reposent sur quatre workflows de référence… conçus par l'équipe model-capabilities de TypeSafe, sans réponse objective de référence — la mesure se fait contre la moyenne de probabilités de deux gros modèles externes (TS2.tech, sept. 2026). La société reconnaît elle-même un biais possible et situe ses gains « au haut de la fourchette ». Le « jusqu'à 100x » des communiqués ? Un plafond marketing, pas une médiane.
Ce débat tombe en plein dans la guerre des tokens qui fait rage côté open source : des outils comme Caveman, RTK ou Omniroute optimisent la dépense de tokens à la couche application ; TypeSafe prétend la diviser à la couche modèle. Si les deux approches se combinent, l'économie des pipelines LLM change d'échelle.
Dernier détail révélateur : même entre géants, l'écart de prix est vertigineux — 3,31 $ contre 19,49 $ pour des usages proches. C'est tout le paradoxe du marché que décortique notre comparatif Claude vs ChatGPT. Dans ce contexte, un entrant qui publie ses prix au dixième de dollar force au moins la transparence.
40 M$ en seed : ce que DCVC achète vraiment
DCVC n'achète pas une startup qui emballe les API d'OpenAI, d'Anthropic ou de Google : le fonds finance explicitement une thèse de couche modèle — ce que doivent être les modèles quand leurs utilisateurs sont des machines (TechStartups, sept. 2026). C'est rare, et c'est ce qui rend ce tour intéressant au-delà du montant.
Le montant, justement : 40 M$ en seed, soit le 99e percentile de tous les seeds IA de l'histoire sur un échantillon de 28 473 deals (Dealroom, sept. 2026). On est très loin des 2 ou 3 M$ standards de l'amorçage.
La justification de James Hardiman, General Partner de DCVC, résume le pari :
« TypeSafe is approaching one of the biggest remaining challenges in AI: turning increasingly capable models into technology that developers can reliably build into products at scale. »
Traduisez : le vrai défi n'est plus la capacité des modèles, mais leur fiabilité une fois intégrés dans des produits à grande échelle. C'est exactement la douleur de quiconque a déjà mis un appel LLM en production.
Le risque existe, et il est double. D'abord technique : prouver qu'un modèle non conversationnel couvre suffisamment de cas pour justifier un changement de primitive chez les développeurs. Ensuite contextuel : alors que la Maison Blanche veut désormais vérifier les modèles IA avant leur sortie, un modèle qui auto-déclare sa confiance calibrée devra tôt ou tard se soumettre à des évaluations indépendantes — les benchmarks maison ne suffiront pas. Mon avis : c'est sain. Une startup qui vend de la fiabilité doit accepter d'être mesurée par d'autres qu'elle-même.
Faut-il revoir votre architecture LLM dès aujourd'hui ?
Non — mais si votre produit repose sur de la classification, du routage ou du triage à haut volume, mettez Jev sur votre liste de tests, et gardez un modèle frontier pour tout le reste.
L'architecture qui se dessine est hybride. Un modèle frontier — à choisir dans notre comparatif mensuel des meilleurs LLM — pour le raisonnement complexe et la génération ; un modèle machine-native comme Jev pour les décisions répétitives à fort volume. C'est exactement la même logique qui prévaut pour le code : on ne confie pas toutes les tâches au même modèle.
Deux précautions avant de migrer quoi que ce soit :
Validez la calibration sur vos propres données. SiliconANGLE le rappelle explicitement : les scores de probabilité de Jev réduisent le risque d'hallucination, mais ne le suppriment pas. À vous de vérifier que « confiance 0,97 » signifie réellement 97 % d'exactitude sur vos cas d'usage — c'est un travail d'évaluation, pas une case à cocher.
Mesurez le coût réel de vos décisions. Le bon indicateur n'est pas le prix du token, c'est le coût pour 1 000 décisions correctes, latence p99 incluse. Sur ce terrain, un modèle local bien choisi peut encore gagner : notre guide des meilleurs LLM à exécuter en local et le tutoriel d'installation avec Ollama ou LM Studio restent la référence pour un traitement privé à coût marginal quasi nul. Et si vous voulez prototyper votre propre couche de routage et de monitoring sans dépendre de qui que ce soit, un VPS chez Hostinger suffit largement pour démarrer.
Entre les familles de modèles ouverts, les architectures post-attention et les modèles machine-native, une chose est sûre : choisir un modèle en 2026 n'est plus un choix de logo, c'est un choix d'architecture.
❌ Erreurs courantes
Erreur 1 : croire les multiples 194x et 445x sur parole
Ces chiffres proviennent de tests internes menés sur des workflows conçus par TypeSafe elle-même, sans réponse objective de référence (TS2.tech, sept. 2026). La solution : construisez votre propre mini-benchmark — 100 à 500 échantillons réels de votre workload, coût et exactitude mesurés — avant tout engagement.
Erreur 2 : confondre confiance calibrée et exactitude
Un score de 0,97 dit que le modèle « croit » sa décision à 97 %, pas qu'elle est correcte 97 fois sur 100. SiliconANGLE alerte précisément sur cette confusion. La solution : tracez la courbe de calibration (confiance annoncée vs exactitude observée) sur vos données avant de laisser le logiciel agir en autonomie.
Erreur 3 : vouloir tout migrer vers un modèle spécialisé
Jev est taillé pour des décisions structurées à haut volume — classification, triage, évaluation. Il ne rédigera pas vos e-mails ni votre code. La solution : gardez une architecture hybride, avec un LLM frontier pour la génération et le raisonnement, et un modèle machine-native pour le volume.
Erreur 4 : confondre latence marketing et latence mesurée
Les « moins de 100 ms » des communiqués coexistent avec des mesures de 70 à 500 ms selon les workloads (TS2.tech, sept. 2026). Les deux peuvent être vrais : tout dépend du cas. La solution : mesurez la p99 sur vos requêtes réelles, pas sur la démo du vendeur.
❓ Questions fréquentes
TypeSafe AI, c'est quoi exactement ?
Une startup fondée en 2024 à San Francisco par Diogo Almeida (ex-OpenAI), Erik Gafni et Sasha Sheng. Elle sort de stealth le 16 septembre 2026 avec 40 M$ de seed mené par DCVC. Sa spécialité : l'« intelligence machine-native composable » — des modèles conçus pour des utilisateurs machines, dont le premier se nomme Jev.
Qui est Diogo Almeida ?
Un vétéran d'OpenAI qui a co-inventé RLHF et travaillé sur InstructGPT, ChatGPT et GPT-4. Il a quitté le labo avec une question : pourquoi les modèles surhumains en conversation n'ont-ils pas mené à l'AGI ? Sa réponse : il faut des modèles pour les machines, pas seulement pour les humains.
Jev va-t-il remplacer ChatGPT et les LLM conversationnels ?
Non, et ce n'est pas le but. Jev ne dialogue pas : il renvoie des décisions structurées destinées à être consommées par du logiciel. Les LLM de chat gardent la main pour l'humain. En revanche, pour les appels LLM à haut volume cachés dans vos produits, Jev prétend les remplacer pour une fraction du coût.
Combien coûte Jev ?
TypeSafe affiche 0,39 $ pour 1 000 workflows, contre 3,31 $ pour GPT-5.6 Luna et 19,49 $ pour Claude Haiku 4.5 (SiliconANGLE, septembre 2026). TS2.tech y lit 0,042 $ par million de tokens, sans surcoût de sortie. Prix startup oblige : vérifiez la grille actuelle avant de chiffrer une migration.
Qu'est-ce que le RLCD ?
Une nouvelle méthode d'entraînement annoncée par Almeida en même temps que Jev (TechStartups, septembre 2026). Les détails publics restent minces et aucun papier vérifiable n'a été publié à ce stade. L'idée : entraîner un modèle pour des utilisateurs machines dès le départ, là où RLHF optimise des réponses pour des humains.
Quand Jev sera-t-il disponible ?
Aucune date de disponibilité générale n'était communiquée au 16 septembre 2026. La publication d'une grille tarifaire suggère une ouverture commerciale proche, mais rien n'est confirmé. Le plus fiable : surveiller les annonces de TypeSafe et demander un accès si votre cas d'usage correspond aux workloads cibles.
✅ Conclusion
Avec 40 M$ et le co-inventeur de ChatGPT à sa tête, TypeSafe AI vient d'acheter le droit de prouver qu'il existe un marché des modèles pour machines — des prix publics et vérifiables, des benchmarks encore auto-déclarés : la charge de la preuve est désormais chez Almeida, et c'est exactement comme ça que l'industrie avance. En attendant les évaluations indépendantes, gardez vos pipelines hybrides et comparez les meilleurs LLM du moment avant de migrer quoi que ce soit.