Référence
Le paysage des modèles ouverts à la mi-2026
Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout.
Le carnet technique
Retours d'expérience bruts depuis nos nodes GPU à Briançon : ce qu'on a testé, mesuré, gardé et jeté pour servir des LLM open source souverains au meilleur ratio qualité / watt.
Référence
Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout.
Stratégie
Prix de la DRAM et des SSD doublés en 2026 : pourquoi les techniques d'inférence sobres (MoE, MLA, quantification) transforment la contrainte mémoire en atout.
Référence
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Benchmarks
Code, raisonnement, contamination, saturation : panorama des benchmarks LLM et pourquoi nous gardons BenchLocal, notre évaluation qualité interne.
Performance
Comment le cache KV accélère l'inférence, comment calculer sa taille, et comment le compresser : GQA, MLA, quantification q8_0/fp8, SWA, PagedAttention.
Matériel
VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée.
Référence
Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.
Performance
Speculative decoding, Multi-Token Prediction, EAGLE-3, Medusa : comment générer plusieurs tokens par passe sans dégrader la qualité du LLM.
Drivers
Comparatif des stacks GPU pour l'inférence LLM : CUDA, ROCm, Vulkan, Metal, et pourquoi Strix Halo passe par Vulkan.
Fine-tuning
Guide pratique du fine-tuning de LLM en 2026 : quand fine-tuner, LoRA vs QLoRA, Spectrum, préparation de datasets et alignement DPO/ORPO.
Performance
Flash Attention optimise l'attention en minimisant les transferts HBM/SRAM : tiling, recomputation, et l'évolution FA1 à FA4 (Ampere → Blackwell).