Référence
Le paysage des modèles ouverts à la mi-2026
Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout.
À la mi-2026, le paysage des modèles ouverts a une signature reconnaissable au premier coup d’œil : presque plus aucun n’est un modèle dense chargé intégralement à chaque token. La sparsité — au sens du Mixture-of-Experts — est devenue la norme, du modèle de poche au trillion de paramètres. Voici notre lecture du terrain, et ce qu’on en retient pour une infrastructure sobre.
La tendance de fond : la sparsité partout
Le constat structurant de 2026, c’est la généralisation de trois techniques qu’on détaillait encore comme des nouveautés il y a un an :
- le MoE pour ne réveiller qu’une fraction des paramètres par token ;
- la Multi-head Latent Attention (MLA) pour comprimer le cache KV ;
- la Multi-Token Prediction (MTP) et l’attention clairsemée pour accélérer le décodage et le contexte long.
Ces briques ne sont pas des secrets de laboratoire : elles sont publiées et présentes dans les moteurs open source. C’est ce qui explique que des modèles très différents convergent vers la même physionomie.
Les familles qui comptent
| Modèle | Type | Total | Actifs / token |
|---|---|---|---|
| Qwen3.6 (dense) | Dense | 27B | 27B |
| Qwen3.6-A3B | MoE | 35B | 3B |
| Gemma 4 (Google) | Plusieurs tailles | — | — |
| GLM-5 | MoE | ~744B | ~40B |
| Kimi K2.6 | MoE | ~1 T | ~32B |
| DeepSeek V4 Pro | MoE, contexte million-token | — | — |
Quelques lectures de ce tableau :
- Qwen3.6 reste notre cheval de bataille. La déclinaison MoE 35B-A3B est celle qu’on sert en production : à fichier équivalent, elle bat le dense 27B sur notre matériel à mémoire unifiée, comme détaillé dans Dense ou MoE sur Strix Halo.
- Gemma 4 continue de « frapper au-dessus de son poids » : d’excellentes performances pour des tailles modestes, ce qui en fait un candidat sérieux quand la mémoire est comptée.
- GLM-5 et Kimi K2.6 illustrent l’autre extrême : des MoE géants (jusqu’au trillion de paramètres) qui, grâce à la sparsité, n’activent qu’une poignée de milliards de paramètres par token. Ils demandent beaucoup de capacité mémoire pour stocker les experts, mais une bande passante seulement modérée — exactement le profil que servent bien les plateformes à mémoire unifiée généreuse.
- DeepSeek V4 Pro pousse l’efficacité du contexte long : attention clairsemée et un coût par token nettement réduit par rapport à la génération précédente, pour des contextes de l’ordre du million de tokens.
Capacité contre bande passante : le bon matériel a changé
Cette bascule vers les gros MoE redéfinit ce qu’est une bonne machine d’inférence. Un MoE géant n’a pas besoin de la bande passante d’un GPU datacenter ; il a besoin de place pour loger ses experts. C’est ce qui propulse les architectures à mémoire unifiée — Apple Silicon, APU AMD Strix Halo, et les nouvelles plateformes Grace + Blackwell à 128 Go de mémoire partagée — comme terrain naturel de l’inférence locale.
On retrouve ici l’arbitrage qu’on développe dans Choisir son matériel : sur un MoE, ce qui compte n’est pas le nombre de paramètres totaux mais le nombre de paramètres actifs par token, et la capacité à tous les loger en mémoire.
Ce qu’on en garde pour une infra sobre
La leçon est cohérente avec notre ligne : la qualité brute des modèles fermés reste légèrement devant, mais l’ingénierie qui rend l’inférence efficace est ouverte. MoE, MLA, sparse attention, quantification — tout est disponible. Pour qui veut servir des LLM performants sur du matériel modeste, sans dépendre d’une API ni d’un marché mémoire sous tension (voir Pénurie de mémoire 2026), le paysage mi-2026 n’a jamais été aussi favorable.
Notre choix de production reste donc un MoE Qwen3.6-35B-A3B quantifié, servi en local — un point d’équilibre entre qualité, débit et empreinte mémoire qu’on réévalue à chaque nouvelle famille de modèles.