2026-10-03

Aleph Alpha publie Kolibri, un modèle mixture d'experts de 78 milliards de paramètres dont 3,46 milliards actifs, en poids ouverts sous licence Apache 2.0

AIModelsOpen Source🌍 Europe

Aleph Alpha a publié Kolibri le 3 octobre 2026, un modèle mixture d'experts (MoE) anglais-allemand à poids ouverts sous licence Apache 2.0. L'annonce d'Aleph Alpha le résume en une ligne : « Petit oiseau, ailes rapides, Kolibri est là. 78 milliards de paramètres. 3,46 milliards actifs. Jusqu'à 1 million de jetons de contexte. Conçu en Europe. Désormais, les poids sont à vous. » Environ 4,4 % du modèle est actif par jeton. Le modèle a été conçu de bout en bout en Allemagne, entraîné en Allemagne et en Finlande, et documenté dans un rapport technique de 189 pages, « Kolibri: A Sovereign European Model on the Pareto Frontier ».

Deux checkpoints sont disponibles : Kolibri-1 en FP8 (environ 78 Go) et Kolibri-1-BF16 (environ 156 Go). La fenêtre de contexte est de 1 048 576 jetons, la fiche du modèle recommandant jusqu'à 262 144 pour l'efficacité du service. Le modèle prend en charge l'appel d'outils et un mode de raisonnement explicite.

Comment il a été construit

Le pré-entraînement a porté sur environ 24 000 milliards de jetons en trois étapes : 20 000 milliards à 16k de contexte, 3 400 milliards de mi-entraînement à 64k, et 200 milliards pour l'extension à 256k. Trending Topics rapporte que la première étape a tourné sur 768 GPU Nvidia B200 et duré environ 21 jours.

L'allemand représente plus de 20 % des données, dont plus de 2 000 milliards de jetons allemands issus du web ou générés de façon synthétique. Le tokenizer de 128k jetons nécessite 11,2 % de jetons en moins pour l'allemand que GPT-5.

L'architecture compte 50 blocs, dont 40 à attention par fenêtre glissante et 10 à attention complète. Chaque couche de mixture d'experts achemine un jeton vers 6 experts sur 384, plus un expert partagé. Le post-entraînement a combiné un fine-tuning supervisé sur 537 milliards de jetons, dont du raisonnement en allemand, puis un apprentissage par renforcement sur plus de 1,2 million de tâches constituées en interne, couvrant le raisonnement, l'usage d'outils, le code et la recherche d'information.

Les expériences ont tourné via Model Factory, un système d'« entraînement en tant que code » versionné (Savanna). Les auteurs affirment que la vitesse de décision, et non le calcul, était leur goulot d'étranglement ; ils sont passés du modèle interne précédent, Kolibri Origin, à Kolibri en environ trois mois.

Résultats et points faibles

Le rapport place Kolibri sur la frontière de Pareto qualité-coût de service dans les deux langues, en revendiquant un débit environ 1,6 à 2,7 fois supérieur et plus de 20 points de qualité face à certains modèles ouverts comparés. Un graphique montre environ 47 000 octets par seconde pour une qualité d'environ 71 %, contre environ 34 500 (70 %) pour GPT-OSS et environ 38 500 (67 %) pour Qwen3.6 A3B. L'ensemble de comparaison inclut aussi Qwen3.6-35B-A3B, Nvidia Nemotron 3 Super 120B-A12B et Mistral Small 4 119B-A6B.

Kolibri bat tous les modèles mixture d'experts de sa taille comparés sur les agrégats anglais et allemand. Les maths sont le point fort : il aurait obtenu 96,9 sur AIME 2025 et 96,0 sur AIME 2026, et le rapport affirme qu'il égale ou dépasse des modèles ayant 3 fois plus de paramètres actifs en maths et en code. Le Qwen3.8 27B dense obtient un meilleur score global, mais active environ 8 fois plus de paramètres. Les hallucinations baissent nettement par rapport à Kolibri Origin.

Les lacunes sont énoncées sans détour. Le rappel factuel en livre fermé est faible : Kolibri se classe dernier sur douze sur RGB Closed-Book et est aussi en retrait sur AA-Omniscience et RGB Fact-Check. Les découpages multi-tours du benchmark d'appel d'outils BFCL sont un autre point faible. Trending Topics, sous le titre « Aleph Alpha's Kolibri Is No Match for the Open-Weight Leaders » (« Kolibri d'Aleph Alpha ne fait pas le poids face aux leaders des poids ouverts »), note que les modèles de comparaison ont environ six mois et que les leaders actuels des poids ouverts sont très loin devant.

Souveraineté et conformité

Kolibri vise les déploiements réglementés et souverains, comme l'administration publique, l'industrie et l'aéronautique. Avec 3,46 milliards de paramètres actifs, il est bien moins coûteux à servir par jeton que les modèles gourmands en mémoire évoqués dans Ces poids ouverts que vous ne pouvez pas faire tourner, et Apache 2.0 est un échelon permissif de l'échelle décrite dans Ouvert jusqu'où ? Petit guide des licences de modèles d'IA. Le rapport d'été de Hugging Face a constaté que le plafond des poids ouverts était chinois presque chaque mois de 2026, ce qui est le terrain auquel se heurte un nouvel entrant européen.

Le pipeline est conçu autour de l'AI Act de l'UE, du code de bonnes pratiques GPAI et du RGPD (voir les changements du Digital Omnibus). Il filtre les contenus piratés et nuisibles, expurge les données personnelles et entraîne le modèle à s'abstenir lorsque le contexte ne permet pas de répondre. Les pages 111 à 129 du rapport forment une analyse juridique approfondie du droit d'auteur, couvrant l'exception de fouille de textes et de données de l'UE et l'AI Act. Les prochaines étapes annoncées sont un meilleur raisonnement en allemand, moins d'hallucinations et davantage de langues européennes.

Kolibri suit Soofi S comme deuxième modèle ouvert souverain allemand. Jonas Andrulis a quitté ses fonctions de PDG et est devenu président du conseil en octobre 2025. TechCrunch a rapporté le 25 avril 2026 que Cohere allait fusionner avec Aleph Alpha pour une valorisation combinée d'environ 20 milliards de $, et un accord définitif a été signé le 16 septembre 2026. Sous réserve de l'approbation des régulateurs, la clôture est attendue plus tard en 2026 sous la marque Cohere, avec Toronto et Berlin comme sièges jumelés et Heidelberg comme centre de recherche. Entre-temps, le ministre français de l'Économie a déclaré que l'IA européenne ne pouvait pas reposer sur Mistral seul, et Mistral vend de l'inférence régionale et de la confiance autour de ses modèles.

À lire ensuite