Opinion
La sobriété n'est pas de la décroissance
Un modèle de 110 Go qui refuse de démarrer, un autre quatre fois plus petit qui sert mieux. Ce que ça dit de qui a le droit de faire de l'IA.
Le carnet technique
Retours d'expérience bruts depuis nos nodes GPU à Briançon : ce qu'on a testé, mesuré, gardé et jeté pour servir des LLM open source souverains au meilleur ratio qualité / watt.
Opinion
Un modèle de 110 Go qui refuse de démarrer, un autre quatre fois plus petit qui sert mieux. Ce que ça dit de qui a le droit de faire de l'IA.
Référence
Qwen3.8, Kimi K3, GLM-5.2, MiniMax M3, DeepSeek V4 : panorama des modèles open-weight fin 2026 et pourquoi l'attention linéaire hybride change la donne.
Stratégie
Prix de la DRAM et des SSD doublés en 2026 : pourquoi les techniques d'inférence sobres (MoE, MLA, quantification) transforment la contrainte mémoire en atout.
Référence
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Benchmarks
Panorama des benchmarks LLM, comment lire les scores — et quatre pièges de mesure côté serveur qui produisent des chiffres crédibles et faux.
Performance
Le cache KV expliqué : calculer sa taille, le compresser (GQA, MLA, FP8), et l'impact du prefix caching sur les architectures hybrides.
Matériel
VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée.
Référence
Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.
Performance
Décodage spéculatif, MTP, EAGLE-3, DFlash 2 : générer plusieurs tokens par passe sans perte de qualité — et ce que ça coûte vraiment en mémoire.
Drivers
Comparatif des stacks GPU pour l'inférence LLM : CUDA, ROCm, Vulkan, Metal, et pourquoi Strix Halo passe par Vulkan.
Fine-tuning
Guide pratique du fine-tuning de LLM en 2026 : quand fine-tuner, LoRA vs QLoRA, Spectrum, préparation de datasets et alignement DPO/ORPO.