<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SoberCloud — Découvertes</title><description>Le carnet technique de SoberCloud : inférence LLM open source souveraine, modèles denses vs MoE, llama.cpp, vLLM, MTP, quantification et KV cache.</description><link>https://sobercloud.fr/</link><language>fr-fr</language><atom:link href="https://sobercloud.fr/rss.xml" rel="self" type="application/rss+xml"/><lastBuildDate>Sun, 14 Jun 2026 00:00:00 GMT</lastBuildDate><item><title>Le paysage des modèles ouverts à la mi-2026</title><link>https://sobercloud.fr/decouvertes/paysage-modeles-ouverts-2026/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/paysage-modeles-ouverts-2026/</guid><description>Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s&apos;est imposée partout.</description><pubDate>Sun, 14 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>llm</category><category>modeles</category><category>moe</category><category>qwen</category><category>deepseek</category></item><item><title>Pénurie de mémoire 2026 : quand la sobriété devient un avantage</title><link>https://sobercloud.fr/decouvertes/penurie-memoire-2026/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/penurie-memoire-2026/</guid><description>Prix de la DRAM et des SSD doublés en 2026 : pourquoi les techniques d&apos;inférence sobres (MoE, MLA, quantification) transforment la contrainte mémoire en atout.</description><pubDate>Sun, 14 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>inference</category><category>sobriete</category><category>materiel</category><category>souverainete</category><category>moe</category></item><item><title>Le lexique de l&apos;inférence LLM, expliqué simplement</title><link>https://sobercloud.fr/decouvertes/lexique-inference/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/lexique-inference/</guid><description>Tous les mots de l&apos;inférence d&apos;IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l&apos;article pour creuser.</description><pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>reference</category><category>inference</category><category>llm</category></item><item><title>Aide-mémoire LLM : formats, quantification et commandes</title><link>https://sobercloud.fr/decouvertes/aide-memoire/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/aide-memoire/</guid><description>La référence rapide pour l&apos;inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>reference</category><category>gguf</category><category>quantification</category><category>parametres</category></item><item><title>Benchmarks LLM : lire les scores sans se faire piéger</title><link>https://sobercloud.fr/decouvertes/benchmarks-llm/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/benchmarks-llm/</guid><description>Code, raisonnement, contamination, saturation : panorama des benchmarks LLM et pourquoi nous gardons BenchLocal, notre évaluation qualité interne.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>benchmarks</category><category>llm</category><category>performance</category><category>reference</category></item><item><title>Le cache KV (Key-Value) expliqué</title><link>https://sobercloud.fr/decouvertes/cache-kv/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/cache-kv/</guid><description>Comment le cache KV accélère l&apos;inférence, comment calculer sa taille, et comment le compresser : GQA, MLA, quantification q8_0/fp8, SWA, PagedAttention.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>kv-cache</category><category>inference</category><category>llm</category><category>performance</category></item><item><title>Choisir son matériel pour l&apos;inférence LLM locale</title><link>https://sobercloud.fr/decouvertes/choix-du-materiel/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/choix-du-materiel/</guid><description>VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>hardware</category><category>gpu</category><category>inference</category><category>performance</category></item><item><title>Comprendre les LLM open source</title><link>https://sobercloud.fr/decouvertes/comprendre-les-llm-open-source/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/comprendre-les-llm-open-source/</guid><description>Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>llm</category><category>inference</category><category>reference</category></item><item><title>Décodage accéléré : spéculatif, MTP, EAGLE et draft models</title><link>https://sobercloud.fr/decouvertes/decodage-accelere/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/decodage-accelere/</guid><description>Speculative decoding, Multi-Token Prediction, EAGLE-3, Medusa : comment générer plusieurs tokens par passe sans dégrader la qualité du LLM.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>decodage</category><category>mtp</category><category>inference</category><category>performance</category></item><item><title>Drivers GPU pour l&apos;inférence : Vulkan, ROCm, CUDA, Metal</title><link>https://sobercloud.fr/decouvertes/drivers-gpu/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/drivers-gpu/</guid><description>Comparatif des stacks GPU pour l&apos;inférence LLM : CUDA, ROCm, Vulkan, Metal, et pourquoi Strix Halo passe par Vulkan.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>drivers</category><category>gpu</category><category>hardware</category><category>llamacpp</category></item><item><title>Fine-tuning complet : LoRA, QLoRA, Spectrum et alignement</title><link>https://sobercloud.fr/decouvertes/fine-tuning-complet/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/fine-tuning-complet/</guid><description>Guide pratique du fine-tuning de LLM en 2026 : quand fine-tuner, LoRA vs QLoRA, Spectrum, préparation de datasets et alignement DPO/ORPO.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>fine-tuning</category><category>lora</category><category>unsloth</category><category>llm</category></item><item><title>Flash Attention : de FA1 à FA4</title><link>https://sobercloud.fr/decouvertes/flash-attention/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/flash-attention/</guid><description>Flash Attention optimise l&apos;attention en minimisant les transferts HBM/SRAM : tiling, recomputation, et l&apos;évolution FA1 à FA4 (Ampere → Blackwell).</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>flash-attention</category><category>inference</category><category>performance</category><category>gpu</category></item><item><title>Formats de modèles : GGUF, SafeTensors, MLX</title><link>https://sobercloud.fr/decouvertes/formats-de-modeles/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/formats-de-modeles/</guid><description>Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>formats</category><category>gguf</category><category>quantification</category><category>llm</category></item><item><title>Guide pratique : faire tourner un LLM local en production</title><link>https://sobercloud.fr/decouvertes/guide-pratique/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/guide-pratique/</guid><description>Commandes concrètes llama.cpp, vLLM et Ollama, flags clés et configurations réelles pour servir Qwen3.6 sur GPU discret ou mémoire unifiée.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>llamacpp</category><category>vllm</category><category>inference</category><category>gguf</category></item><item><title>Harness IA et agents de code en 2026 : le harness compte plus que le modèle</title><link>https://sobercloud.fr/decouvertes/harness-agents-code/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/harness-agents-code/</guid><description>Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>agents</category><category>llm</category><category>performance</category><category>reference</category></item><item><title>Logiciels d&apos;inférence LLM : llama.cpp, vLLM, SGLang</title><link>https://sobercloud.fr/decouvertes/logiciels-inference/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/logiciels-inference/</guid><description>Comparatif des moteurs d&apos;inférence LLM en 2026 et le choix concret de SoberCloud : llama.cpp Vulkan, vLLM et LiteLLM.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>inference</category><category>vllm</category><category>llamacpp</category><category>performance</category></item><item><title>Paramètres de génération des LLM</title><link>https://sobercloud.fr/decouvertes/parametres-de-generation/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/parametres-de-generation/</guid><description>Temperature, top-p, top-k, pénalités : comment ces paramètres contrôlent la créativité et la cohérence des réponses d&apos;un LLM.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>parametres</category><category>decodage</category><category>inference</category><category>llm</category></item><item><title>Quantification avancée des LLM</title><link>https://sobercloud.fr/decouvertes/quantification-avancee/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/quantification-avancee/</guid><description>GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>quantification</category><category>gguf</category><category>llm</category><category>inference</category></item><item><title>Unsloth en profondeur : fine-tuning rapide et GGUF dynamiques</title><link>https://sobercloud.fr/decouvertes/unsloth-en-profondeur/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/unsloth-en-profondeur/</guid><description>Comment Unsloth accélère le fine-tuning LoRA et produit des GGUF Dynamic supérieurs, avec un exemple sur Qwen3.6-27B.</description><pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>unsloth</category><category>fine-tuning</category><category>lora</category><category>quantification</category></item><item><title>Dense ou MoE ? Pourquoi Qwen3.6-35B-A3B bat le 27B dense sur Strix Halo</title><link>https://sobercloud.fr/decouvertes/dense-vs-moe-strix-halo/</link><guid isPermaLink="true">https://sobercloud.fr/decouvertes/dense-vs-moe-strix-halo/</guid><description>Retour d&apos;expérience SoberCloud : à fichier équivalent, un Mixture-of-Experts 35B-A3B sert plus vite qu&apos;un modèle dense 27B sur un iGPU à mémoire unifiée.</description><pubDate>Mon, 25 May 2026 00:00:00 GMT</pubDate><dc:creator>Antoine Michéa</dc:creator><category>inference</category><category>llm</category><category>qwen</category><category>moe</category><category>strix-halo</category></item></channel></rss>