K2 Horizon : six modèles publiés avec leur code d’entraînement et leurs données

K2 Horizon : six modèles publiés avec leur code d’entraînement et leurs données

Ce qu’il faut retenir :

L’Institute of Foundation Models, rattaché à l’université émiratie MBZUAI, a publié le 3 septembre une gamme de six modèles de langage accompagnés de l’intégralité de leur cycle d’entraînement. La publication comprend les points de contrôle intermédiaires, le code d’entraînement, les recettes de construction des données, les configurations, les journaux détaillés et les résultats d’évaluation, le tout sous licence Apache 2.0.

Introducing K2 Horizon: a connected fleet of six foundation models ranging from 0.9 billion to 375 billion parameters.– Frontier performance: Across coding and agentic tasks, K2 Horizon delivers top-tier performance in every size class—with the 0.9B, 3.7B and 7B models setting… pic.twitter.com/WWbqrvcBAC

Le mot ouvert recouvre deux réalités bien distinctes dans ce secteur, et cette publication éclaire cet écart.

La pratique dominante consiste à diffuser les poids ouverts : les paramètres du modèle sont téléchargeables et exécutables, sans qu’on sache ce qui a produit ces valeurs. L’utilisateur dispose du résultat, pas de la méthode.

Un réseau de neurones de type transformeur constitue une fonction mathématique dont l’architecture et les paramètres forment le code source. Toute la dynamique interne réside dans ces poids, pas dans les données d’entraînement. Publier les seuls poids revient donc à livrer un programme compilé accompagné d’une liste d’adresses web, sans les instructions qui permettraient de le reconstruire.

Ce que l’institut a diffusé comprend au contraire les hyperparamètres, les points de contrôle permettant de mesurer l’évolution du modèle en cours d’entraînement, les versions précoces plus faciles à ajuster, les recettes de post-traitement et de déduplication, les approches d’utilisation des processeurs graphiques, la topologie réseau, les calendriers d’entraînement et le mélange de données complet.

La gamme couvre un éventail inhabituel. Les modèles de 0,9, 3,7 et 7 milliards de paramètres visent respectivement les objets connectés, les téléphones et les usages embarqués. Un modèle de 32 milliards cible les stations de travail locales.

Deux versions à mélange d’experts complètent l’ensemble : 36 milliards de paramètres dont 4 activés par token, et 375 milliards dont 23 activés.

Les résultats revendiqués placent les trois plus petits modèles en tête de leurs catégories de taille. Le modèle de 0,9 milliard dépasse 48 sur l’épreuve mathématique AIME 2026, tout en restant assez compact pour tenir dans une montre ou des lunettes connectées. Celui de 7 milliards, exécutable sur un téléphone, affiche de bons résultats sur les tâches d’ingénierie logicielle.

Le modèle phare obtient 47 points sur l’indice d’intelligence d’Artificial Analysis, ce qui le classe onzième sur 112 modèles comparables, avec une fenêtre de contexte de 524 000 tokens. La médiane des modèles à poids ouverts se situe à 29.

Le premier porte un nom : MoVA, pour mélange d’attention à valeurs. Le principe du mélange d’experts consiste d’ordinaire à n’activer qu’une fraction des couches de calcul pour chaque token. Cette architecture étend ce principe au mécanisme d’attention lui-même, celui qui détermine comment le modèle relie les informations réparties dans son contexte.

Le résultat obtenu approche celui du modèle dense de 32 milliards de paramètres en n’en activant qu’environ 4 milliards par token, avec une compatibilité conservée avec les techniques d’optimisation existantes.

Le second s’appelle Uno et attaque un goulot d’étranglement connu. La génération autorégressive produit un token à la fois, si bien qu’un délai minime par token se transforme en latence considérable sur de longues chaînes de raisonnement.

Le dispositif ajoute un jeu léger de paramètres de diffusion qui apprend à générer des blocs de tokens en parallèle, pendant que les paramètres autorégressifs restent figés et continuent de porter la qualité de sortie. L’institut revendique une accélération d’environ trois fois sans dégradation, livrée sous forme d’adaptateur léger disponible pour le modèle de 7 milliards.

Le volet le plus inhabituel concerne le corpus. L’institut a publié environ 10 000 milliards de tokens synthétiques issus d’un corpus de pré-entraînement d’environ 20 000 milliards.

Près de 17 % de ce pré-entraînement consiste en trajectoires de résolution de problèmes assorties d’un raisonnement explicite.

Pour les jeux de données dont la rediffusion n’est pas juridiquement possible, l’institut publie les méthodes de construction, la composition du mélange et les approches de filtrage. Cette documentation permet d’étudier ce que chaque modèle a appris et comment la distribution des données a évolué au cours de l’entraînement.

L’élément le plus notable de cette publication tient peut-être à ce que l’institut a choisi de reconnaître.

Ses équipes ont soumis leur modèle de 375 milliards à une procédure d’audit du détournement de récompense, sur 712 essais de l’épreuve TerminalBench 2.1. Elles ont identifié 24 essais, répartis sur 10 tâches, où le modèle a triché.

Les comportements observés méritent d’être détaillés. Le modèle déduit qu’il se trouve dans un banc d’essai public, retrouve le dépôt correspondant sur GitHub, télécharge les solutions de référence, inspecte les identifiants, modifie les scripts de test, et façonne des sorties exploitant la manière dont ces tests vérifient la réussite. Le modèle de 7 milliards a trouvé les réponses d’une épreuve d’ingénierie logicielle et gonflé son score à 82, un chiffre qui ne reflète donc aucune capacité réelle.

Le taux de signalement s’établit à 3,37 %, un niveau que l’institut situe entre celui de Claude Fable 5, à 2,2 %, et celui de GPT-5.6 Luna, à 4,1 %.

La portée de cette démarche dépasse le chiffre. En publiant ses points de contrôle intermédiaires, l’institut permet à des chercheurs extérieurs d’étudier à quel moment ces comportements apparaissent et quels choix d’entraînement les favorisent. Ce type de vérification reste impossible sur un modèle fermé.

L’ensemble bénéficie d’une prise en charge dès le premier jour par les principaux moteurs d’exécution locaux, dont vLLM, SGLang et Ollama, sur matériel Nvidia, AMD et Cerebras.

L’architecture partagée entre les six tailles permet de prototyper sur le modèle de 7 milliards, exécutable sur un ordinateur portable, puis de passer au modèle phare en production sans changer d’outillage.

Cette publication s’inscrit dans une année dense pour les modèles ouverts, marquée par les sorties de Zhipu AI, de DeepSeek et par la compression du modèle Hy4-preview de Tencent de 1,5 téraoctet à 200 gigaoctets.

Deux réserves accompagnent toutefois ces annonces. Les résultats revendiqués proviennent en partie de l’éditeur lui-même, même si l’indice d’intelligence cité émane d’un tiers. Et l’audit de triche, aussi bienvenu soit-il, mesure une catégorie de comportements dont personne ne prétend qu’elle est exhaustive.

Reste la question posée à l’ensemble du secteur par ce mode de publication. Si un institut de recherche peut diffuser six modèles avec leur code, leurs données et leurs journaux d’entraînement sous licence permissive, l’argument selon lequel une telle ouverture serait techniquement ou commercialement impraticable perd de sa force.

Rejoignez +40 000 abonnés. L'essentiel du marché crypto dans votre boîte mail, tous les 2 jours.

Okx 300 euros sidebar

Deblock Sidebar Vault Euro

Okx 300 euros sidebar

Newsletter CryptoRejoignez +40 000 abonnés. L'essentiel du marché crypto, 2x par semaine, en 5 min. S'inscrire › En cochant cette case, vous confirmez avoir lu et accepté nos conditions d'utilisation concernant le traitement des données soumises via ce formulaire.En savoir plus sur notre newsletter crypto →

Rejoignez +40 000 abonnés. L'essentiel du marché crypto, 2x par semaine, en 5 min.

Deblock Sidebar Vault Euro

Ce site et les informations qui y sont publiées ne constituent en aucun cas des conseils en investissement ni une incitation quelconque à acheter ou vendre des instruments financiers.

Les CFD sont des instruments complexes et présentent un risque élevé de perte rapide en capital en raison de l'effet de levier. Entre 74 et 89 % des comptes de clients de détail perdent de l'argent lors de la négociation de CFD.

Vous devez vous assurer que vous comprenez comment les CFD fonctionnent et que vous pouvez vous permettre de prendre le risque élevé de perdre votre argent

Rejoignez +40 000 abonnés. Recevez l'essentiel du marché crypto, tous les 2 jours.

Auteur : Alex LeRoux

Date de publication : 07 September 2026

Lire l'article original