Référence
Le paysage des modèles ouverts à la mi-2026
Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout.
Référence
Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout.
Référence
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Benchmarks
Code, raisonnement, contamination, saturation : panorama des benchmarks LLM et pourquoi nous gardons BenchLocal, notre évaluation qualité interne.
Performance
Comment le cache KV accélère l'inférence, comment calculer sa taille, et comment le compresser : GQA, MLA, quantification q8_0/fp8, SWA, PagedAttention.
Référence
Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.
Fine-tuning
Guide pratique du fine-tuning de LLM en 2026 : quand fine-tuner, LoRA vs QLoRA, Spectrum, préparation de datasets et alignement DPO/ORPO.
Formats
Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.
Agents
Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence.
Paramètres
Temperature, top-p, top-k, pénalités : comment ces paramètres contrôlent la créativité et la cohérence des réponses d'un LLM.
Quantification
GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis.
Inférence LLM
Retour d'expérience SoberCloud : à fichier équivalent, un Mixture-of-Experts 35B-A3B sert plus vite qu'un modèle dense 27B sur un iGPU à mémoire unifiée.