📑 Table des matières

Cohere North Small Translate : un MoE open-weight de traduction qui bat DeepL et Google Translate sur WMT26 — la traduction souveraine devient gratuite

Outils IA 🟢 Débutant ⏱️ 14 min de lecture 📅 2026-09-14

North Small Translate : le MoE open-weight de Cohere qui bat DeepL et Google Translate sur WMT26 (et ce que sa licence ne dit pas d'emblée)

🔎 La traduction automatique n'était pas « résolue »

On nous le répète depuis dix ans : la traduction automatique est une marchandise. Google Translate en 2006, DeepL en 2017, puis les LLM polyglottes — quoi de neuf sous le soleil ? Le 10 septembre 2026, Cohere Labs a répondu en publiant North Small Translate 1.0, un modèle mixture-of-experts open-weight qui affiche 83,60 sur WMT26 toutes langues confondues, devant DeepL NextGen (81,37) et très loin devant Google Translate (68,20).

Le détail qui change l'équation : les poids sont téléchargeables sur Hugging Face. Sur le papier, la traduction souveraine — hébergée chez vous, sans envoyer vos données à une API américaine — devient gratuite.

Sur le papier seulement. La licence CC BY-NC 4.0 interdit tout usage commercial sans accord de Cohere, qui louera volontiers son inférence managée Model Vault. Décortiquons ce que ce lancement change vraiment : les chiffres, l'architecture, la licence — et pourquoi la traduction redevient un champ de bataille entre labs.


L'essentiel

  • North Small Translate 1.0 (Cohere Labs, 10 septembre 2026) : MoE sparse de 218 milliards de paramètres dont 25 milliards actifs, fenêtre de contexte 16K input / 16K output.
  • WMT26 All Languages : 83,60 (84,36 en mode agentic), devant Qwen 3.5 397B A17B (81,56), DeepL NextGen (81,37) et loin devant Google Translate (68,20). Juge des évaluations : GPT-5.6-Sol.
  • 50+ langues et variantes locales, avec une constance régionale inédite : 82,2 en Europe contre 73,9 pour Gemma 4 31B (on), et parité en Asie du Sud.
  • Poids téléchargeables (BF16, FP8, NVFP4) sous CC BY-NC 4.0 : gratuit pour la recherche et le non-commercial, payant en production via licence commerciale et la plateforme Model Vault de Cohere.
  • Le point à surveiller : un modèle vendu comme « souverain » qui verrouille l'usage commercial — alors que le North Mini Code précédent sortait en Apache 2.0.

Outils recommandés

Outil Usage principal Prix (septembre 2026) Idéal pour
North Small Translate 1.0 Traduction open-weight self-hostée Gratuit (non-commercial) ; licence commerciale sur devis via Model Vault Recherche, confidentialité, langues européennes
API Cohere, tier gratuit Tester via l'API Chat V2 sans GPU Gratuit (quotas) ; payant au-delà Développeurs, évaluation rapide
DeepL (API NextGen) Traduction propriétaire Offre gratuite limitée + plans payants (vérifiez sur deepl.com) PME, écosystème mature
Google Cloud Translation API à l'usage ~20 $ par million de caractères (vérifiez sur cloud.google.com) Intégrations produit à fort volume
Gemma 4 31B Traduction généraliste open-weight Gratuit (poids téléchargeables) Usage local, budget GPU limité

📊 WMT26 : les chiffres qui font mal à Google

North Small Translate termine à 83,60 sur WMT26 All Languages, mieux que tous les modèles de taille comparable sous 1T de paramètres et que les API de traduction en moyenne — le tout mesuré avec GPT-5.6-Sol comme juge, selon le blog de lancement de Cohere.

Modèle Score WMT26 All Languages
North Small Translate (mode agentic) 84,36
North Small Translate 83,60
Qwen 3.5 397B A17B 81,56
DeepL NextGen 81,37
Gemma 4 31B (on) 79,46
GLM 5.2 FP8 76,50
Google Translate 68,20

Deux lectures s'imposent. D'abord, l'écart avec Google Translate : 15,4 points. Un gouffre pour un produit utilisé par plus d'un milliard de personnes, qui rappelle que Google a longtemps traité la traduction comme une fonctionnalité, pas comme un produit à repousser.

Ensuite, la constance régionale. North Small Translate atteint 82,2 en Europe contre 73,9 pour Gemma 4 31B (on), et reste à parité en Asie du Sud (86,2 contre 86,7). Autrement dit : pas d'effondrement régional, ce mal chronique des modèles de sa taille. C'est exactement ce qu'on attend d'un modèle qui revendique la souveraineté pour tous, pas seulement pour l'anglais et le mandarin.

Le mode agentic mérite un mot : le modèle trouve et corrige ses propres erreurs de traduction, ce qui porte le score à 84,36. Ce bouclage qualité sans humain dans la boucle est peut-être la vraie innovation du lancement.

Nuance honnête : un seul benchmark, un seul juge — et ce juge est un modèle OpenAI. Ironique quand on parle d'IA souveraine. Le chiffre est sérieux, WMT est la référence du domaine, mais votre palette de langues et votre domaine métier resteront le juge final.


⚙️ 218 milliards de paramètres, 25 milliards actifs : la mécanique

Ce qui permet à North Small Translate de battre des géants, c'est son architecture MoE sparse : 218 milliards de paramètres au total, mais seulement 25 milliards activés par token. La capacité de connaissance d'un mastodonte, la latence et le coût d'inférence d'un modèle 25B.

Ce n'est pas un choix isolé. La tendance MoE « gros mais économe » s'accélère partout dans l'open-weight, comme avec Qwen3-Coder-Next, 80B MoE à 3B actifs, qui rivalise avec les modèles propriétaires en code. Cohere applique la même recette à la traduction, avec un rapport capacités/coûts qui devient imbattable à qualité égale.

Deuxième choix technique assumé : pas de raisonnement. Dans un entretien accordé à The New Stack, l'équipe explique avoir construit un modèle de traduction volontairement non raisonneur. Logique : la chaîne de pensée allonge la latence et multiplie le coût pour une tâche où la vitesse et le volume comptent plus qu'une délibération en plusieurs étapes.

Côté généalogie, ce modèle s'inscrit dans la lignée de Tiny Aya et Command A Translate — Cohere creuse depuis des années le sillon multilingue, contre-intuitivement pour un lab de Toronto qui vend plutôt aux banques et aux assurances. Avec 50+ langues et variantes locales, dont 32 à hauts ressources et 18 additionnelles, et une fenêtre de 16K tokens en entrée comme en sortie, le produit est taillé pour des documents réels, pas des phrases de démo.


🔒 CC BY-NC 4.0 : « souverain », mais pas gratuit pour les entreprises

Non, vous ne pouvez pas brancher North Small Translate sur votre produit commercial sans payer Cohere. La licence CC BY-NC 4.0, accompagnée de l'Acceptable Use Policy de Cohere Labs, autorise le téléchargement, l'évaluation et l'étude des poids — pas leur exploitation en production.

Pour passer en production, il faut acheter une licence commerciale et déployer via Model Vault, la plateforme d'inférence managée de Cohere. Le choix est savoureux : l'entreprise qui vend l'IA souveraine aux industries régulées restreint l'usage commercial de son propre modèle souverain. Interrogé, Cohere reste muet sur ses raisons, note The New Stack.

Ma lecture : le non-commercial est un garde-fou de monétisation déguisé en geste d'ouverture. Et cette pratique se généralise. La licence de GLM-5.3 impose elle aussi des conditions — une revue de sécurité par Z.ai au-delà de 10 milliards USD de revenus sur 12 mois pour quiconque héberge le modèle commercialement. À l'inverse, le North Mini Code précédent était sorti en Apache 2.0, sans restriction comparable. La fenêtre de l'open-weight vraiment libre se referme à mesure que les labs comprennent que « open » se monétise mieux en freemium qu'en donation.

Pour être précis : l'accès commercial existe dès aujourd'hui via le tier gratuit de Cohere, l'API Chat V2 servant le modèle en production. De quoi tester sérieusement avant de parler licence. Mais répétons-le, parce que beaucoup s'emberlificoteront : open-weight ne veut pas dire open source, et « les poids sont sur Hugging Face » ne veut pas dire « c'est pour mon SaaS ».


🖥️ Self-hosting : les GPU d'abord, la gratuité ensuite

Pour héberger les poids chez vous, comptez au minimum 2x B200 ou 4x H100 en FP8 — le modèle « gratuit » a un ticket d'entrée élevé. La fiche du modèle sur Hugging Face détaille trois checkpoints, présentés comme ceux-là mêmes servis en production par Cohere :

Checkpoint GPU minimum Cas d'usage
BF16 4x B200 ou 8x H100 Référence, qualité maximale
FP8 W8A8 2x B200 ou 4x H100 Compromis recommandé
NVFP4 W4A16 1x B200 ou 2x H100 Budget serré

Ces quants sont décrits comme quasi sans perte — ce ne sont pas des conversions communautaires approximatives, mais les artefacts officiels. Le téléchargement du checkpoint FP8 tient en une commande :

huggingface-cli download CohereLabs/North-Small-Translate-1.0-fp8

Une fois le modèle chargé, les 25 milliards de paramètres actifs contiennent le coût d'inférence : c'est tout l'intérêt du MoE. Le poste de dépense se déplace vers le capital GPU et l'exploitation — monitoring, mise à l'échelle, disponibilité. Cohere fournit des guides d'implémentation et une démo HF Space pour juger avant d'investir.

Soyons lucides sur les profils : pour un laboratoire ou une équipe ML, c'est jouable. Pour une PME, le calcul penchera presque toujours vers le tier gratuit en évaluation, puis une licence. Et si votre besoin est simplement d'explorer des modèles sans hardware, les APIs IA gratuites de Groq, Google ou OpenRouter restent le chemin le plus court.


🇪🇺 Le vrai enjeu : la souveraineté (et ses limites)

La traduction reste l'une des dernières briques critiques de l'entreprise encore verrouillée derrière des API américaines fermées — et un open-weight qui bat les propriétaires change l'équation d'hébergement. C'est tout l'argument du modèle : Cohere revendique la mission de « rendre l'IA souveraine une réalité technologique ».

Pour les industries régulées — juridique, santé, finance, secteur public — les bénéfices d'un déploiement maîtrisé sont concrets : les données sensibles ne quittent pas l'infrastructure, les flux se conforment au RGPD par construction, et la facturation au caractère envoyé à un tiers disparaît. Les langues européennes sont justement le point fort du modèle, avec 82,2 sur WMT26 en Europe, meilleur score régional devant tout open-weight de taille comparable.

Mais gardons la tête froide : pour un usage commercial, la « souveraineté » passe par une licence achetée à Cohere, société américaine, et idéalement une inférence sur sa plateforme Model Vault. On a le contrôle opérationnel de ses données, pas l'indépendance stratégique vis-à-vis du fournisseur. La souveraineté proposée est réelle mais partielle — technique plutôt que contractuelle. En Europe, la vraie alternative à long terme reste de bâtir des compétences d'hébergement locales sur des poids ouverts, ce que ce modèle rend enfin possible à l'état de l'art pour la traduction.


⚔️ La traduction redevient un champ de bataille

Le score de 68,20 de Google Translate raconte le vrai contexte : les géants ont délaissé un produit jugé « résolu », pendant que leurs investissements IA partaient ailleurs. Google construit aujourd'hui Gemini Intelligence et Googlebooks, transformant Android en « système d'intelligence » — la traduction grand public n'est clairement plus la priorité maison.

Dans le même temps, les labs open-weight s'y remettent sérieusement. Qwen 3.5 397B A17B tient 81,56, Gemma 4 et GLM suivent, et Cohere Labs met un modèle dédié dans la course. Cette dynamique s'inscrit dans une vague plus large où Moonshot AI lève 2 milliards de dollars et voit Kimi K2.6 dominer l'open-weight, la Chine accélérant dans la course à l'IA. La traduction, tâche en apparence mûre, redevient un territoire à conquérir — parce que la couverture réelle reste mauvaise.

C'est le message de l'entretien The New Stack : la traduction automatique est toujours cassée pour la plupart des langues du monde. Les 32 langues à hauts ressources et les 18 langues additionnelles de North Small Translate sont un progrès, mais la queue longue reste le front ouvert du domaine. Le mode agentic — le modèle qui relit et corrige ses propres traductions à 84,36 — dessine la prochaine étape : la qualité par auto-vérification plutôt que par grossissement du modèle.

Ma prédiction : DeepL NextGen, qui défend honorablement 81,37, ne restera pas deux ans sans réponse. Quand un open-weight gratuit en recherche bat votre produit phare de plus de deux points, la pression concurrentielle devient intolérable — même les généralistes les plus puissants, de Gemini 3.1 Pro à Claude Sonnet 4.6, ont un intérêt direct à verrouiller le multilingue.


🧪 Comment tester North Small Translate dès aujourd'hui

Trois options, aucune installation requise. La démo HF Space hébergée par Cohere Labs pour un essai manuel immédiat ; le tier gratuit de Cohere via l'API Chat V2 pour des tests d'intégration réels ; et les poids sur Hugging Face pour qui veut évaluer sérieusement, avec les checkpoints BF16, FP8 et NVFP4 et les guides d'implémentation fournis.

Les chercheurs et équipes académiques ont le chemin le plus balisé : la licence CC BY-NC 4.0 couvre exactement leur cas d'usage, et les quants quasi sans perte évitent la dégradation mesurée des conversions communautaires. Pour explorer d'autres modèles sans dépenser un centime, notre sélection des meilleurs outils IA gratuits reste le bon point de départ, et ce lancement figure déjà parmi les nouveautés IA à suivre de près.


❌ Erreurs courantes

Erreur 1 : confondre open-weight et open source

Les poids sont téléchargeables, pas la liberté d'en faire ce que vous voulez. CC BY-NC 4.0 interdit l'usage commercial, et l'Acceptable Use Policy de Cohere Labs ajoute ses propres contraintes. La solution : lire la licence avant de planifier une intégration produit, et chiffrer le coût de la licence commerciale dès l'étude d'opportunité.

Erreur 2 : croire que « gratuit » veut dire sans coût

Le self-hosting exige 4x H100 en FP8 au minimum, avec l'exploitation qui va avec : monitoring, montée en charge, disponibilité. Le modèle est gratuit, l'infrastructure non. La solution : calculer le coût total sur trois ans — hardware, énergie, équipe — et le comparer au tier gratuit puis à la licence Model Vault.

Erreur 3 : prendre 83,60 pour une promesse contractuelle

C'est un score sur un benchmark public, avec un seul juge (GPT-5.6-Sol). Vos paires de langues, votre terminologie métier et vos formats peuvent raconter une autre histoire. La solution : évaluer sur vos propres données avant toute décision, en comparant avec DeepL NextGen et votre solution actuelle.

Erreur 4 : supposer une qualité uniforme sur les 50+ langues

Le modèle couvre 32 langues à hauts ressources et 18 langues additionnelles — l'excellence européenne ne garantit rien sur la queue longue, et même en Asie du Sud, la parité reste relative (86,2 contre 86,7). La solution : vérifier explicitement vos langues cibles avec des locuteurs natifs, pas seulement le leaderboard agrégé.


❓ Questions fréquentes

Peut-on utiliser North Small Translate en entreprise ?

Pas sans licence. L'usage non-commercial est libre, y compris l'évaluation via le tier gratuit de l'API Chat V2. Pour la production commerciale, il faut une licence auprès de Cohere et un déploiement via sa plateforme Model Vault. Le montant n'est pas publié (septembre 2026) : il faut passer par un devis.

Quelles sont les caractéristiques techniques du modèle ?

Un MoE sparse de 218 milliards de paramètres dont 25 milliards actifs, une fenêtre de 16K tokens en entrée comme en sortie, et la couverture de plus de 50 langues et variantes locales. C'est un modèle volontairement non raisonneur, optimisé pour la vitesse et le volume. Trois checkpoints officiels existent : BF16, FP8 et NVFP4.

Est-il vraiment meilleur que DeepL ?

Sur WMT26 All Languages, oui : 83,60 contre 81,37 pour DeepL NextGen, et 84,36 en mode agentic. Mais un benchmark agrégé ne remplace pas vos cas d'usage. DeepL conserve un écosystème mature et des intégrations éprouvées. Testez les deux sur vos documents réels avant de migrer quoi que ce soit.

Pourquoi une licence non-commercial pour un modèle « souverain » ?

Cohere ne s'est pas expliquée, note The New Stack. L'hypothèse la plus plausible : protéger la monétisation via les licences et Model Vault, le NC jouant le rôle d'offre freemium. La tendance se confirme avec la licence conditionnelle de GLM-5.3, alors que le North Mini Code précédent sortait en Apache 2.0 sans restriction.

Quels GPU pour héberger le modèle ?

Le minimum officiel est 1x B200 ou 2x H100 avec le checkpoint NVFP4 W4A16. Le FP8 W8A8 demande 2x B200 ou 4x H100, et le BF16 de référence 4x B200 ou 8x H100. Ces trois checkpoints sont ceux servis en production par Cohere, décrits comme quasi sans perte.

Faut-il abandonner Google Translate et DeepL ?

Non, pas d'emblée. Pour un usage grand public ou une intégration rapide, les API propriétaires restent les plus simples. North Small Translate devient intéressant quand la confidentialité, la maîtrise des coûts à fort volume ou la couverture des langues européennes deviennent critiques — et surtout si vous pouvez héberger.


✅ Conclusion

North Small Translate prouve qu'un open-weight spécialisé peut battre les propriétaires sur la traduction — il prouve aussi que l'ère de l'open-weight vraiment gratuit pour le commerce est en train de se refermer. Testez la démo, évaluez sur vos données, et gardez un œil sur la réponse de DeepL et Google : le champ de bataille ne fait que s'ouvrir.