Annonce et contexte

Le 03/10/2026 — jour de la fête de l’unité allemande —, Aleph Alpha a dévoilé Kolibri-1, son premier grand modèle de langage à poids ouverts, via un billet du blog officiel intitulé « Kolibri Has Landed: A Sovereign Open-Weight Model », relayé le même jour sur le compte X officiel du laboratoire (@Aleph__Alpha). « Kolibri » signifie « colibri » en allemand : petit oiseau, ailes rapides — le nom résume le pari architectural du modèle, 78 milliards de paramètres dont à peine 3,5 milliards travaillent à chaque token.

La promesse officielle, selon Aleph Alpha : « Kolibri is a specialized language model built for sovereign mission-critical work in regulated areas including public administration, industrials and aerospace. » (« Kolibri est un modèle de langage spécialisé, conçu pour les missions critiques souveraines dans les secteurs régulés : administration publique, industrie et aérospatial. ») Le laboratoire de Heidelberg (fondé en 2019, environ 200 personnes, dirigé par Ilhan Scheer) joue à fond la carte de la souveraineté européenne : entraînement réalisé en Allemagne et en Finlande, sous droit allemand et européen, avec signature du code de bonnes pratiques de l’UE pour l’IA à usage général.

Le lancement intervient dans un contexte chargé : un mois après la signature de l’accord de fusion définitif avec Cohere (septembre 2026 — la future entité combinée conservera le nom de Cohere, avec des sièges à Berlin et Toronto), et en pleine offensive des modèles ouverts chinois (DeepSeek, Qwen, GLM) face auxquels les laboratoires occidentaux peinent à rivaliser sur le rapport qualité-prix. Kolibri est la montée en puissance du prototype Kolibri Origin (juin 2026, 30 milliards de paramètres) : le total de paramètres est multiplié par 2,6 pour un coût d’inférence quasi inchangé.

Découvrir Kolibri
Lien officiel

Fiche technique

Caractéristique Valeur
Éditeur Aleph Alpha (Heidelberg, Allemagne)
Date d’annonce 03/10/2026 (blog officiel — jour de l’unité allemande)
Date de disponibilité 03/10/2026 — poids publiés sur Hugging Face
Famille / gamme Kolibri (Kolibri-1 ; prototype : Kolibri Origin, 06/2026)
Type LLM texte, mixture-of-experts (MoE), raisonnement à effort réglable, appels d’outils
Architecture 50 couches MoE ; 384 experts routés (6 actifs par token) + 1 expert partagé ; 78,1 Md de paramètres au total, 3,46 Md actifs par token
Fenêtre de contexte (entrée) 262 144 tokens natifs (longueur max d’entraînement) ; jusqu’à 1 048 576 tokens en service (réglage validé, déconseillé au-delà de 262K pour les tâches complexes ou sensibles à la latence)
Tokens max en sortie Non communiqué
Cutoff des connaissances 18/06/2026 (anglais et allemand)
Modalités d’entrée / sortie Entrée : texte (anglais, allemand) ; sortie : texte ; appels d’outils de style Hermes
Tokenizer UniBPE bilingue, vocabulaire de 128 000 tokens, optimisé pour l’allemand (mots composés préservés — moins de tokens par texte allemand)
Licence Apache 2.0 (poids et fichiers de configuration — le code d’entraînement reste propriétaire)
ID API Sans objet — aucune API officielle
Disponibilités Poids FP8 (~78 Go) + checkpoint BF16 sur Hugging Face ; inférence via vLLM (paquet aleph-alpha-inference requis) ; aucun fournisseur d’inférence hébergée (selon la model card)

Nouveautés : Kolibri-1 vs Kolibri Origin

Critère Kolibri-1 Kolibri Origin (06/2026)
Paramètres totaux 78,1 Md 30 Md
Paramètres actifs par token 3,46 Md ~3 Md
Contexte natif 262 144 tokens (1M en service) 65 536 tokens
Tokens d’entraînement ~24 000 Md 7 510 Md
Abstention (AA-Omniscience) 44 % de mauvaises réponses évitées 14,8 %
Ancrage (score M/A) 0,23 Non communiqué
Niveaux de raisonnement 4 (none, low, medium, high) Non communiqué

Il n’y a pas de « modèle précédent » commercial : la comparaison pertinente est interne, entre le prototype de juin 2026 et le modèle final. La trajectoire est éloquente : les paramètres actifs n’ont quasiment pas bougé (3,27 Md → 3,46 Md) pendant que le total était multiplié par 2,6 et le contexte par 4. Aleph Alpha revendique une itération architecturale délibérée — triplement du nombre d’experts, attention repensée (pleine toutes les 5 couches, fenêtre glissante de 512 tokens ailleurs), routage remplacé — plutôt qu’un simple passage à l’échelle brutal.

Le second enseignement concerne l’ancrage : avec sa procédure Merlin-Arthur (entraînement antagoniste qui apprend au modèle à se taire quand les preuves manquent), Kolibri évite une mauvaise réponse dans 44 % des cas du test AA-Omniscience, contre 14,8 % pour Origin. C’est le cœur du positionnement « mission-critical » : dans une administration ou un cockpit industriel, un modèle qui s’abstient vaut mieux qu’un modèle qui invente.

Benchmarks

Tous les chiffres ci-dessous sont communiqués par Aleph Alpha (aucune mesure indépendante publiée à ce jour). Les scores ont été obtenus avec les harnais internes du laboratoire, au niveau d’effort de raisonnement maximal. Le tableau reprend la comparaison officielle face à trois modèles ouverts de taille comparable.

Benchmark Kolibri-1 Qwen3.6-35B-A3B Nemotron 3 Super Mistral Small 4
AIME 2025 (EN) 96,9 84,6 91,7 79,8
AIME 2025 (DE) 87,5 82,9 85,6 72,3
AIME 2026 (EN) 96,0 91,0 90,4 83,1
AIME 2026 (DE) 90,0 84,4 87,5 78,5
GPQA Diamond (EN) 84,3 83,4 78,0 74,7
GPQA Diamond (DE) 81,3 80,6 76,6 72,9
Sources : tableau d’évaluation officiel Aleph Alpha, 03/10/2026 (mesures constructeur, non reproduites indépendamment).

Autres scores Kolibri-1 publiés par le laboratoire :

Benchmark Kolibri-1 (constructeur) Contexte
LiveCodeBench v6 85,9 Code — devant les trois comparés selon Aleph Alpha
SWE-Bench Verified 66,4 Code agentique
HumanEval+ 92,7 Code
BFCL v4 (global) 61,4 Outils — derrière Qwen3.6 (67,2)
LongBench Pro 64,5 Long contexte — derrière Qwen3.6 (70,8)
TerminalBench 2.1 27,7 Agentique
τ²-bench (télécom) 94,7 Agentique
Humanity’s Last Exam (EN) 21,5 Connaissances — score modeste, comme tous les modèles de cette taille
Score global (EN / DE) 75,5 / 70,8 Moyenne des suites d’Aleph Alpha
Sources : billet officiel et model card Hugging Face, 03/10/2026 (mesures constructeur).

Deux réserves s’imposent. D’abord, Kolibri ne gagne pas partout : Qwen3.6-35B-A3B le devance sur BFCL v4 et LongBench Pro, et les scores sont publiés par le seul laboratoire — aucune évaluation indépendante (Artificial Analysis, LMArena…) n’existe encore. Ensuite, les benchmarks « allemands » mis en avant (AIME et GPQA traduits) sont une rareté appréciable — presque personne ne publie la colonne allemande — mais ce sont bien des traductions, pas des épreuves conçues en allemand.

Comparatif : les poids ouverts de l’automne 2026

Modèle Éditeur Prix entrée /1M Prix sortie /1M Contexte Point fort Score de référence
Kolibri-1 Aleph Alpha 0 $ (poids ouverts) 0 $ 262K natif (1M servi) Souveraineté UE + allemand natif 96,9 AIME 2025 EN (constructeur)
Nemotron 3 Super NVIDIA Non communiqué (poids ouverts) Non communiqué Non communiqué 120B/12B actifs, le plus proche en maths 91,7 AIME 2025 EN (mesuré par Aleph Alpha)
Qwen3.6-35B-A3B Alibaba Non communiqué (poids ouverts) Non communiqué Non communiqué Devant Kolibri sur BFCL v4 et LongBench Pro 84,6 AIME 2025 EN (mesuré par Aleph Alpha)
Mistral Small 4 Mistral AI Non communiqué (poids ouverts) Non communiqué Non communiqué L’alternative européenne établie 79,8 AIME 2025 EN (mesuré par Aleph Alpha)

Le positionnement de Kolibri est limpide : le seul open-weight occidental de cette génération pensé d’abord pour l’allemand et la conformité européenne, là où Qwen et Nemotron jouent la carte du généraliste. Les amateurs de poids ouverts compareront aussi avec GPT-OSS-120B d’OpenAI, autre référence occidentale du moment. Son talon d’Achille est l’écosystème — pas d’API hébergée, pas de fournisseur d’inférence, une communauté naissante — face à des concurrents déjà intégrés partout. Mais pour une administration ou un industriel européen soumis à l’AI Act, l’argument « tout est traçable, tout tourne chez vous » n’a pas d’équivalent dans ce tableau.

Cas d’usage

  • Administration publique : traitement de dossiers longs (jusqu’à 1M tokens en service), réponses ancrées aux documents — avec l’abstention Merlin-Arthur comme garde-fou contre les hallucinations.
  • Industrie et aérospatial : déploiement 100 % on-premise pour des données sensibles, avec des suites d’évaluation sectorielles (automobile, semi-conducteurs, propulsion) déjà mesurées par le laboratoire.
  • Code et agents : 85,9 à LiveCodeBench v6, appels d’outils Hermes, 4 niveaux d’effort de raisonnement pour arbitrer coût et qualité.
  • RAG et documentation technique : fenêtre de 262K tokens recommandée, tokenizer qui compresse efficacement l’allemand (moins de tokens = moins de coût et de latence).
  • Contenus bilingues allemand-anglais : 21,3 % d’allemand authentique en pré-entraînement (pas de la traduction), colonne de benchmarks allemands publiée — rare sur le marché.
  • Recherche sur l’ancrage : licence Apache 2.0 et procédure Merlin-Arthur documentée, un terrain d’expérimentation pour les équipes qui travaillent sur la fiabilité.

Tarifs et accès

Offre Entrée /1M Sortie /1M Notes
Kolibri-1 — poids open source Gratuit Licence Apache 2.0 sur Hugging Face — usage commercial, modification et redistribution autorisés
API hébergée officielle Sans objet Aucune API officielle tarifée publiée ; la model card précise qu’aucun fournisseur d’inférence ne le déploie pour l’instant
Déploiement entreprise Sur devis Contact commercial (« Contact for Deployment and Specialization ») pour l’accompagnement au déploiement

Voir la documentation officielle
Lien officiel

Accès développeur : téléchargement des poids sur Hugging Face (FP8 ~78 Go, checkpoint BF16 également disponible), inférence via vLLM avec le paquet aleph-alpha-inference (paramètres d’échantillonnage recommandés : température 1,0, top_p 0,97, top_k 128). Pas d’inscription, pas de clé API — mais pas non plus d’offre « essayez en un clic » : il faut son propre GPU.

Déploiement local

Kolibri-1 n’est pas un modèle « quantifié pour laptop » : les poids FP8 pèsent environ 78 Go, et la configuration minimale officielle exige 2 × A100 80 Go, 2 × H100 SXM5, 1 × H200 ou 1 × B200 — du matériel de datacenter, pas un PC de bureau. En contrepartie, seuls 3,46 Md de paramètres travaillent par token : à matériel égal, le décodage est sensiblement plus rapide qu’un modèle dense de 78 Md.

  • Moteur : vLLM avec le parseur dédié (--tool-call-parser kolibri1) et le paquet aleph-alpha-inference (support spécifique à l’architecture).
  • Contexte : 262 144 tokens recommandés ; 1 048 576 tokens possibles via --hf-overrides, au prix d’une latence et d’une empreinte mémoire accrues.
  • Effort de raisonnement : réglable (none / low / medium / high) via le template de chat — none pour une réponse immédiate sans chaîne de pensée.
  • Limite : la licence Apache 2.0 couvre les poids et la configuration, pas le code ni les méthodes d’entraînement — on peut l’exploiter et le modifier, pas reproduire sa fabrication.

FAQ

Quand Kolibri a-t-il été annoncé ?

Le 03/10/2026, jour de la fête de l’unité allemande, par Aleph Alpha (Heidelberg) via son blog officiel et son compte X. Les poids sont disponibles depuis le jour de l’annonce sur Hugging Face.

Kolibri est-il vraiment open source ?

Les poids et les fichiers de configuration sont publiés sous licence Apache 2.0 : usage commercial, modification et redistribution autorisés. En revanche, le code et les méthodes d’entraînement restent propriétaires — c’est de l’« open-weight », pas de l’open source intégral.

Combien coûte l’utilisation de Kolibri ?

Les poids sont gratuits. Il n’existe aucune API officielle tarifée ni aucun fournisseur d’inférence hébergée : le seul coût est celui de votre infrastructure GPU. Pour un accompagnement entreprise, Aleph Alpha propose un contact commercial (sur devis).

Quelle est la différence entre Kolibri-1 et Kolibri Origin ?

Kolibri Origin (juin 2026) était un prototype de 30 milliards de paramètres, 65K de contexte, entraîné sur 7 510 milliards de tokens. Kolibri-1 multiplie le total par 2,6 (78,1 Md), quadruple le contexte natif (262K) et triple les données (~24 000 Md de tokens), pour un nombre de paramètres actifs par token quasi inchangé (3,46 Md).

Kolibri est-il meilleur que Qwen3.6 ?

Selon les mesures d’Aleph Alpha : oui en mathématiques (96,9 contre 84,6 à AIME 2025) et en code (85,9 à LiveCodeBench v6, en tête du comparatif officiel), mais non sur l’usage d’outils (61,4 contre 67,2 à BFCL v4) et le long contexte (64,5 contre 70,8 à LongBench Pro). Tous ces chiffres viennent du constructeur — aucune évaluation indépendante n’a encore été publiée.

Puis-je faire tourner Kolibri sur mon PC ?

Non : 78 Go de poids FP8 et un minimum de 2 × A100 80 Go (ou 1 × B200) exigent du matériel de datacenter. C’est un modèle pour serveurs d’entreprise ou cloud GPU, pas pour un ordinateur personnel.

Quelles langues Kolibri parle-t-il ?

L’anglais et l’allemand, « bilingue par conception » : 21,3 % des tokens de pré-entraînement sont en allemand authentique (pas de la traduction), avec un tokenizer optimisé pour la langue. Aleph Alpha publie d’ailleurs ses benchmarks dans les deux langues, ce qui est rare.

Verdict

Pour qui — OUI :

  • les administrations et industriels européens soumis à l’AI Act qui exigent traçabilité et hébergement local ;
  • les équipes qui travaillent en allemand et veulent un modèle entraîné sur de l’allemand authentique, pas traduit ;
  • les développeurs d’agents et de RAG qui privilégient l’ancrage (abstention à 44 %) et le long contexte.

Pour qui — NON :

  • ceux qui cherchent une API clé en main — il n’y en a pas, il faut son propre GPU ;
  • les budgets matériels limités — 78 Go de poids, c’est du datacenter ;
  • ceux qui attendent des évaluations indépendantes — tous les chiffres actuels viennent d’Aleph Alpha.

Note de la rédaction : 8/10. Le premier open-weight européen crédible face aux modèles chinois sur les maths et le code, avec un vrai angle allemand et souverain — et une honnêteté rare (colonnes allemandes publiées, défaites reconnues sur BFCL v4). Retranchés : des chiffres 100 % constructeur et un plancher matériel qui réserve le modèle aux organisations équipées.

Télécharger Kolibri sur Hugging Face
Lien officiel