Aleph Alpha open-source Kolibri-1 : un MoE 78B (3,46B actifs) bilingue DE/EN sous Apache 2.0 pour l'IA souveraine on-premise
🔎 Le 3 octobre 2026, l'Allemagne a lâché un 78B open weight. Le calendrier n'est pas un hasard.
Le 3 octobre 2026 — jour de la fête de l'Unité allemande —, le labo de Heidelberg Aleph Alpha a publié Kolibri-1 : un modèle mixture-of-experts de 78,1 milliards de paramètres, dont 3,46B actifs par token, sous licence Apache 2.0. Choisir cette date précise pour un modèle estampillé « souverain » est un message politique autant qu'une sortie logicielle.
Sur le papier, la fiche technique tient la route : contexte natif de 262 144 tokens (1M extrapolé), bilinguisme DE/EN natif, mode de raisonnement contrôlable, tool calling, serving via vLLM. Les poids sont en ligne sur Hugging Face, en FP8 et BF16, sans gating ni restriction commerciale.
Pourquoi maintenant ? Parce que la vague open weight de 2026 a changé de nature : DeepSeek sous licence MIT, Qwen sur le code, Alphabet sur la robotique — et désormais un labo européen qui publie poids, pipeline et provenance des données. La sortie est notamment couverte par AICoder News, et l'analyse d'Orcarouter résume bien l'angle : ici, la disclosure fait partie du produit.
L'essentiel
- MoE 78,1B total / 3,46B actifs (4,4 %) : ratio d'environ 22,6:1, coût d'inférence proche d'un modèle dense 3B.
- Licence Apache 2.0 sur les poids, repos non gated, usage commercial autorisé — mais le pipeline d'entraînement n'est pas publié.
- Bilingue DE/EN natif : 21,3 % du pré-training en allemand. Aucune autre langue, français inclus.
- Contexte : 262 144 tokens natifs, 1 048 576 extrapolé (262k recommandé en serving).
- Benchmarks : AIME 2026 (EN) 96,0, GPQA Diamond 84,3, LiveCodeBench v6 85,9, SWE-Bench Verified 66,4, TerminalBench 2.1 seulement 27,7.
- Matériel minimum : 2x A100 80GB, 2x H100 SXM5, 1x H200 ou 1x B200/B300 ; empreinte d'environ 78 GB en FP8.
- Serving : vLLM avec le plugin
aleph-alpha-inference. - Knowledge cutoff : 18 juin 2026.
Outils recommandés
| Outil | Usage principal | Prix (octobre 2026) | Idéal pour |
|---|---|---|---|
| Kolibri-1 (FP8) | Poids quantisés, ~78 GB | Gratuit (Apache 2.0) | Déploiement production on-prem |
| Kolibri-1-BF16 | Poids pleine précision bfloat16 | Gratuit (Apache 2.0) | Fine-tuning, recherche |
| vLLM + plugin aleph-alpha-inference | Serving haute performance | Open source, gratuit | Inférence GPU en entreprise |
| Fiche produit Kolibri | Specs, licence, prérequis hardware | — | Vérifier avant d'acheter du GPU |
Les poids sont gratuits. Le vrai coût, c'est le hardware — et il n'est pas négociable, comme on va le voir.
Un MoE 78B qui n'active que 3,46B de paramètres par token
Toute l'idée de Kolibri-1 tient dans ce ratio : 78 103 074 560 paramètres au total, mais seulement 3,46B activés par token, soit 4,4 % du modèle. Vous obtenez la capacité d'un 78B avec un coût d'inférence proche d'un dense 3B — c'est le compromis qui rend le on-premise économiquement discutable, puis viable.
L'architecture : 50 blocs MoE, 384 experts par couche, dont 6 routés plus 1 expert partagé par token. Ce ratio de ~22,6:1 place Kolibri-1 dans la même famille que Qwen3-Coder-Next, le MoE 80B à 3B actifs qui rivalise avec Claude Sonnet — la formule qui a fait ses preuves en 2026 sur le rapport capacité/coût.
Détail qui compte pour le long contexte : l'attention est hybride, avec une sliding window de 512 tokens sur quatre couches sur cinq, et une couche de full attention une fois sur cinq. C'est ce design qui permet de contenir l'empreinte du KV cache sur de longues fenêtres, sans exploser la facture mémoire.
Dernier détail, savoureux : le prédécesseur, Kolibri Origin (30,6B total / 3,27B actifs), n'a jamais été publié. Aleph Alpha a itéré en interne avant de sortir une version « prête pour la production » — stratégie opposée aux releases rituelles et médiatisées de certains labs américains.
La frontière de Pareto, revendiquée
Le tech report revendique la frontière de Pareto qualité/coût de serving parmi les modèles ouverts évalués. Traduction : à qualité égale, Kolibri-1 coûterait moins cher à faire tourner que la concurrence ouverte — ou, à coût égal, serait plus performante.
Une revendication à prendre avec des pincettes, puisqu'elle dépend fortement des modèles comparés et des conditions de serving. Mais elle est cohérente avec le design MoE et l'attention hybride : ce modèle a été pensé pour le coût d'exploitation, pas seulement pour les leaderboards.
Bilingue par design : 21,3 % d'allemand dans le pré-training
Kolibri-1 n'est pas un modèle anglophone traduit après coup. L'allemand représente 21,3 % de son mix de pré-training, sur un pool unique de 2,4T tokens dont 80 % ont été curés ou générés en maison. C'est un choix industriel rare : la quasi-totalité des labs optimisent l'anglais et traitent les autres langues comme un supplément.
Ce « 80 % en maison » mérite qu'on s'y attarde. Cela signifie un contrôle total sur la qualité et la provenance des données — l'argument souverain poussé jusqu'au dataset —, mais aussi une part probablement importante de données synthétiques, dont l'effet réel sur la généralisation reste à documenter sur le long terme.
Le bilinguisme est d'ailleurs assumé comme une limite : DE et EN, rien d'autre. Pas de français, pas d'espagnol, pas de chinois. Aleph Alpha préfère deux langues excellentes à trente langues moyennes — un arbitrage défendable pour son marché cible, pénalisant pour le reste du monde.
Les scores le confirment : Overall EN 75,5 contre DE 70,8. L'écart existe, mais il est contenu. Pour situer honnêtement : le Qwen3.8 27B dense reste devant sur les deux langues (80,2 / 79,9), d'après les tables de benchmarks relayées par SignalStack. Kolibri-1 n'est donc pas le meilleur modèle ouvert tout court — c'est le meilleur modèle ouvert souverain et européen sur son créneau.
Si votre besoin est en français, passez votre chemin : notre sélection des meilleurs LLM en français recense des options bien plus pertinentes pour l'hexagone.
Benchmarks : brillant en raisonnement, en retrait sur l'agentique
Kolibri-1 excelle en raisonnement pur — 96,0 sur AIME 2026, 84,3 sur GPQA Diamond — mais décroche nettement sur l'exécution agentique, avec un TerminalBench 2.1 à 27,7. En clair : ce modèle réfléchit mieux qu'il n'agit.
| Benchmark | Score Kolibri-1 | Lecture |
|---|---|---|
| AIME 2026 (EN) | 96,0 | Maths niveau olympiades — excellent |
| GPQA Diamond (EN) | 84,3 | Sciences niveau expert — très bon |
| LiveCodeBench v6 | 85,9 | Génération de code — solide |
| SWE-Bench Verified | 66,4 | Bugs réels — correct, pas dominant |
| TerminalBench 2.1 | 27,7 | Agents en terminal — le point faible |
| Overall EN / DE | 75,5 / 70,8 | Derrière Qwen3.8 27B dense (80,2 / 79,9) |
Le post-training explique ce profil : SFT puis RL sur plus de 1,2M de tâches internes couvrant reasoning, tool use, code et retrieval. Le mode de raisonnement est contrôlable — on peut l'activer ou le couper selon la tâche, un vrai plus pour arbitrer latence et coût en production.
Mais soyons francs : 66,4 sur SWE-Bench Verified et 27,7 sur TerminalBench, c'est loin des frontier models. Sur notre classement agentic, GPT-5.5 d'OpenAI pointe à 98,2 et Claude Opus 4.7 (Adaptive) à 94,3. Si votre cas d'usage est l'agent de code autonome, regardez plutôt notre comparatif des meilleurs LLM pour coder ou notre guide des LLM pour agents IA.
Kolibri-1 ne joue pas ce match-là. Il joue celui du déploiement régulé — et sur ce terrain, un point de SWE-Bench compte moins que la conformité, l'auditabilité et le coût de possession.
Apache 2.0 : ce que la licence couvre vraiment (et ce qu'elle ne couvre pas)
La licence Apache 2.0 couvre les poids de Kolibri-1 — usage commercial inclus, repos non gated — mais pas le pipeline d'entraînement. C'est de l'« open weight », pas de l'open source intégral. La distinction compte, surtout quand le marketing vend du « souverain ».
Concrètement, vous pouvez télécharger, modifier, déployer et monétiser le modèle sans royalties ni négociation. Vous ne pouvez pas auditer les données d'entraînement ligne par ligne, ni reproduire le pipeline complet. Aleph Alpha publie tout de même une disclosure rare dans le secteur : provenance des données, 392k GPU-heures, chiffres énergétiques.
Cette sortie s'inscrit dans une tendance lourde de 2026. DeepSeek a ouvert V3.1 sous licence MIT et pousse désormais V4 Pro, tandis qu'Alphabet a open-sourcé sa stack robotique Intrinsic Core sous Apache 2.0. L'open weight est devenu une arme stratégique, pas un geste militant.
Mon avis : la licence d'Aleph Alpha est plus honnête que le vocabulaire qui l'entoure parfois. « Open weight sous Apache 2.0 » est un fait exact et vérifiable ; « open source » tout court serait exagéré. Les deux ne se valent pas, et un acheteur souverain a intérêt à le savoir avant de signer.
Contexte : 262k natif, 1M extrapolé — ce qu'il faut vraiment utiliser
Le card annonce 1 048 576 tokens de contexte, mais l'usage recommandé en serving reste ≤262 144. La trajectoire d'entraînement l'explique : 16k au pré-training, étendu à 65k en mid-training, puis 262 144 en natif. Le 1M est validé par extrapolation — il fonctionne, mais il n'a pas été appris.
Pour les workloads sensibles à la latence, 262k est donc la bonne cible. Pour du batch offline — analyse de corpus, retrieval massif, revue de contrats — le 1M peut se tenter, avec le KV cache en FP8 pour contenir l'empreinte mémoire. L'attention hybride (sliding window de 512, une couche full sur cinq) est précisément conçue pour rendre ces fenêtres abordables.
À titre de comparaison, la plupart des frontier models communiquent des contextes de 1M à 2M, avec des coûts de serving qui grimpent vite au-delà de 100k tokens. Kolibri-1 fait le pari inverse : un contexte honnête, chiffré, assorti d'une recommandation d'usage explicite. J'avoue préférer cette franchise à la course au chiffre rond.
Faire tourner Kolibri-1 chez soi : vLLM, 78 GB et des GPU de datacenter
Kolibri-1 se sert via vLLM, mais comptez du matériel de datacenter : minimum 2x A100 80GB, 2x H100 SXM5, 1x H200 ou 1x B200/B300. Avec ~78 GB de poids en FP8, un GPU consumer 24 GB est d'office éliminé — et même un seul H100 80GB ne passe pas : les poids n'y laisseraient aucune place au KV cache.
| Configuration | Verdict |
|---|---|
| 1x RTX 4090 / 5090 (24-32 GB) | Non — poids trop lourds |
| 1x H100 80GB | Non — pas de marge pour le KV cache |
| 2x A100 80GB | Minimum officiel |
| 2x H100 SXM5 | Oui |
| 1x H200 (141 GB) | Oui |
| 1x B200 / B300 | Oui |
L'installation passe par le plugin officiel d'Aleph Alpha pour vLLM :
pip install "aleph-alpha-inference>=1.0"
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8
Le blog officiel détaille les flags de serving recommandés, dont le KV cache en FP8. Prévoyez de la marge mémoire : les 78 GB de poids n'incluent pas le KV cache à 262k de contexte. Et si vous partez sur du fine-tuning, la version BF16 pèse environ le double, soit ~156 Go.
Pas de datacenter sous la main ? Deux options honnêtes : louer du GPU H100/H200 à l'heure chez un cloudeur, ou accepter un modèle plus léger. Pour la seconde voie, notre guide d'installation d'un LLM en local couvre Ollama et LM Studio, et notre comparatif des meilleurs LLM locaux aide à choisir un modèle qui tient sur du matériel normal. Pour expérimenter ces modèles plus légers sur un VPS, Hostinger offre un point d'entrée abordable (tarifs à vérifier sur hostinger.com, octobre 2026). Et pour construire des agents sur des modèles locaux moins gourmands, notre dossier agents IA open source avec Ollama reste la meilleure porte d'entrée.
Souveraineté : la provenance comme produit
Le vrai différenciateur de Kolibri-1 n'est pas un benchmark, c'est la chaîne de provenance. 24T tokens documentés, 392k GPU-heures sur 768 NVIDIA B200 (21 jours de pré-training), chiffres énergétiques publiés, pipeline décrit. Aucun frontier lab américain n'offre cette transparence : OpenAI, Google et Anthropic ne publient ni données, ni coûts, ni budgets d'entraînement.
Le positionnement est explicite : « mission critical », conforme EU AI Act, on-premise. Pour un hôpital allemand, une administration ou une banque, la question n'est pas « quel modèle a le meilleur score sur AIME ? » mais « quel modèle puis-je auditer, héberger derrière mon firewall et faire certifier ? ». Sur cette question, Kolibri-1 répond avec des arguments vérifiables, pas des slides.
Le knowledge cutoff au 18 juin 2026 est récent — moins de quatre mois à la sortie —, ce qui limite le recours au RAG pour les faits récents. Le tool calling et le retrieval font partie du post-training, pas des rustines ajoutées après coup. Et le budget d'entraînement, 392k GPU-heures, reste modeste à l'échelle des labs de frontière : la preuve qu'un acteur européen peut jouer dans la cour des grands sans budget colossal.
Mon avis de rédacteur : Kolibri-1 ne battra jamais GPT-5.5 ou Gemini 3 Pro Deep Think sur les classements généralistes, et ce n'est pas son but. C'est un produit politique et industriel — la démonstration qu'un labo européen peut livrer un modèle de premier plan, ouvert, documenté et déployable en infrastructure privée. Pour le marché régulé européen, c'est peut-être plus précieux qu'un point de SWE-Bench.
Kolibri-1 est-il fait pour vous ?
Oui si vous cochez au moins deux de ces cases : organisation régulée (santé, finance, secteur public, défense), besoin on-premise ou cloud souverain, langues de travail anglais et/ou allemand, volume d'inférence justifiant du GPU dédié.
Non si vous travaillez en français, si vous cherchez le meilleur agent de code du marché, ou si vous n'avez pas accès à des GPU datacenter. Dans ces cas, le comparatif mensuel des meilleurs LLM ou la sélection de LLM gratuits vous orienteront plus vite qu'un téléchargement de 78 GB.
Les cas d'usage où Kolibri-1 a du sens dès aujourd'hui : assistant interne DE/EN sur données sensibles, extraction et analyse documentaire sur longs corpus, raisonnement batch (maths, sciences) en infrastructure privée, base de fine-tuning Apache 2.0 pour un domaine vertical.
Les cas à éviter : agentique terminal à haute intensité (le 27,7 sur TerminalBench 2.1 le dit assez), production francophone, expérimentation sur GPU consumer.
❌ Erreurs courantes
Erreur 1 : confondre « open weight » et « open source »
La licence Apache 2.0 couvre les poids, pas le pipeline d'entraînement ni les données. Solution : lisez la licence et le tech report avant de communiquer en interne sur « l'open source », et évaluez précisément ce que vous pouvez réellement auditer.
Erreur 2 : sous-estimer le matériel requis
« 3,46B actifs » ne veut pas dire « léger » : les 78B de poids doivent tenir en mémoire, soit ~78 GB en FP8. Solution : partez de la configuration minimale officielle (2x A100 80GB ou 1x H200) et ajoutez la marge nécessaire au KV cache.
Erreur 3 : pousser le contexte à 1M en production
Le 1M est extrapolé, pas natif ; la recommandation du card est ≤262 144 pour le serving sensible à la latence. Solution : 262k en production, 1M réservé au batch offline avec KV cache en FP8.
Erreur 4 : s'attendre à du français
Kolibri-1 est bilingue DE/EN, point. Solution : pour des clients ou des contenus francophones, choisissez un modèle réellement adapté plutôt que de forcer un prompt système à moitié efficace.
❓ Questions fréquentes
Kolibri-1 est-il vraiment open source ?
Techniquement, c'est de l'open weight : les poids sont sous Apache 2.0, utilisables commercialement et sans gating, mais le pipeline d'entraînement et les données ne sont pas publiés. La transparence d'Aleph Alpha (provenance, coûts GPU, énergie) est supérieure à la moyenne du secteur, sans atteindre un open source complet.
Quel matériel minimum pour le faire tourner ?
Le minimum officiel est 2x A100 80GB, 2x H100 SXM5, 1x H200 ou 1x B200/B300. L'empreinte des poids est d'environ 78 GB en FP8, à laquelle s'ajoute le KV cache. Un GPU consumer 24 GB ne suffit pas, même avec quantification supplémentaire.
Kolibri-1 parle-t-il français ?
Non. Le modèle est bilingue allemand/anglais natif, un choix assumé par Aleph Alpha. Les scores Overall sont de 75,5 en anglais et 70,8 en allemand. Pour le français, d'autres modèles ouverts ou commerciaux sont nettement plus adaptés.
Comment se positionne-t-il face à GPT-5.5 ou Claude Opus 4.7 ?
Sur les benchmarks agentiques, les frontier models restent devant : GPT-5.5 domine les classements (98,2), et le TerminalBench 2.1 à 27,7 montre les limites de Kolibri en exécution. Kolibri-1 joue sur un autre terrain : on-premise, licence permissive, conformité EU AI Act et coût de serving.
Comment servir Kolibri-1 en production ?
Via vLLM avec le plugin officiel : installez aleph-alpha-inference, puis lancez vllm serve avec le KV cache en FP8. Les configurations recommandées sont documentées dans le blog d'Aleph Alpha. Comptez du matériel datacenter et une marge mémoire pour le contexte long.
Quel est le knowledge cutoff de Kolibri-1 ?
Le 18 juin 2026, soit moins de quatre mois avant la publication du modèle. C'est récent pour un open weight, ce qui réduit le recours au RAG pour les faits récents — sans l'éliminer pour l'actualité quotidienne.
✅ Conclusion
Avec Kolibri-1, Aleph Alpha prouve qu'un labo européen peut livrer un MoE 78B ouvert, documenté et déployable on-premise, sans prétendre battre les frontier models américains sur l'agentique. Avant de télécharger les 78 GB, évaluez votre matériel avec notre guide d'installation d'un LLM en local — ou explorez des alternatives plus légères si votre cas d'usage le permet.