---
title: Le paysage des modèles ouverts à la mi-2026
description: "Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des
  modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée
  partout."
date: 2026-06-14T00:00:00.000Z
dateModified: 2026-06-14T00:00:00.000Z
author:
  name: Antoine Michéa
  url: https://sobercloud.fr/
  sameAs:
    - https://altilink.eu/
tags:
  - llm
  - modeles
  - moe
  - qwen
  - deepseek
section: Référence
canonical: https://sobercloud.fr/decouvertes/paysage-modeles-ouverts-2026/
---

# Le paysage des modèles ouverts à la mi-2026

À la mi-2026, le paysage des modèles ouverts a une signature reconnaissable au premier coup d'œil : **presque plus aucun n'est un modèle dense chargé intégralement à chaque token**. La sparsité — au sens du Mixture-of-Experts — est devenue la norme, du modèle de poche au trillion de paramètres. Voici notre lecture du terrain, et ce qu'on en retient pour une infrastructure sobre.

## La tendance de fond : la sparsité partout

Le constat structurant de 2026, c'est la généralisation de trois techniques qu'on détaillait encore comme des nouveautés il y a un an :

- le **MoE** pour ne réveiller qu'une fraction des paramètres par token ;
- la **Multi-head Latent Attention (MLA)** pour comprimer le cache KV ;
- la **Multi-Token Prediction (MTP)** et l'**attention clairsemée** pour accélérer le décodage et le contexte long.

Ces briques ne sont pas des secrets de laboratoire : elles sont publiées et présentes dans les moteurs open source. C'est ce qui explique que des modèles très différents convergent vers la même physionomie.

## Les familles qui comptent

| Modèle | Type | Total | Actifs / token |
|---|---|---|---|
| **Qwen3.6** (dense) | Dense | 27B | 27B |
| **Qwen3.6-A3B** | MoE | 35B | **3B** |
| **Gemma 4** (Google) | Plusieurs tailles | — | — |
| **GLM-5** | MoE | ~744B | ~40B |
| **Kimi K2.6** | MoE | ~1 T | ~32B |
| **DeepSeek V4 Pro** | MoE, contexte million-token | — | — |

Quelques lectures de ce tableau :

- **Qwen3.6** reste notre cheval de bataille. La déclinaison MoE 35B-A3B est celle qu'on sert en production : à fichier équivalent, elle bat le dense 27B sur notre matériel à mémoire unifiée, comme détaillé dans [Dense ou MoE sur Strix Halo](/decouvertes/dense-vs-moe-strix-halo/).
- **Gemma 4** continue de « frapper au-dessus de son poids » : d'excellentes performances pour des tailles modestes, ce qui en fait un candidat sérieux quand la mémoire est comptée.
- **GLM-5** et **Kimi K2.6** illustrent l'autre extrême : des MoE géants (jusqu'au trillion de paramètres) qui, grâce à la sparsité, n'activent qu'une poignée de milliards de paramètres par token. Ils demandent beaucoup de **capacité** mémoire pour stocker les experts, mais une bande passante seulement modérée — exactement le profil que servent bien les plateformes à mémoire unifiée généreuse.
- **DeepSeek V4 Pro** pousse l'efficacité du contexte long : attention clairsemée et un coût par token nettement réduit par rapport à la génération précédente, pour des contextes de l'ordre du million de tokens.

## Capacité contre bande passante : le bon matériel a changé

Cette bascule vers les gros MoE redéfinit ce qu'est une bonne machine d'inférence. Un MoE géant n'a pas besoin de la bande passante d'un GPU datacenter ; il a besoin de **place pour loger ses experts**. C'est ce qui propulse les architectures à mémoire unifiée — Apple Silicon, APU AMD Strix Halo, et les nouvelles plateformes Grace + Blackwell à 128 Go de mémoire partagée — comme terrain naturel de l'inférence locale.

On retrouve ici l'arbitrage qu'on développe dans [Choisir son matériel](/decouvertes/choix-du-materiel/) : sur un MoE, ce qui compte n'est pas le nombre de paramètres totaux mais le nombre de paramètres **actifs** par token, et la capacité à tous les loger en mémoire.

## Ce qu'on en garde pour une infra sobre

La leçon est cohérente avec notre ligne : la qualité brute des modèles fermés reste légèrement devant, mais **l'ingénierie qui rend l'inférence efficace est ouverte**. MoE, MLA, sparse attention, quantification — tout est disponible. Pour qui veut servir des LLM performants sur du matériel modeste, sans dépendre d'une API ni d'un marché mémoire sous tension (voir [Pénurie de mémoire 2026](/decouvertes/penurie-memoire-2026/)), le paysage mi-2026 n'a jamais été aussi favorable.

Notre choix de production reste donc un MoE Qwen3.6-35B-A3B quantifié, servi en local — un point d'équilibre entre qualité, débit et empreinte mémoire qu'on réévalue à chaque nouvelle famille de modèles.

## Pour aller plus loin

- [Comprendre les LLM open source](/decouvertes/comprendre-les-llm-open-source/)
- [Dense ou MoE sur Strix Halo](/decouvertes/dense-vs-moe-strix-halo/)
- [Benchmarks LLM : lire les scores sans se faire piéger](/decouvertes/benchmarks-llm/)
- [Pénurie de mémoire 2026](/decouvertes/penurie-memoire-2026/)
