Formats
Formats de modèles : GGUF, SafeTensors, MLX
Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.
Le carnet technique — page 2/2
Retours d'expérience bruts depuis nos nodes GPU à Briançon : ce qu'on a testé, mesuré, gardé et jeté pour servir des LLM open source souverains au meilleur ratio qualité / watt.
Formats
Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.
Pratique
Commandes concrètes llama.cpp, vLLM et Ollama, flags clés et configurations réelles pour servir Qwen3.6 sur GPU discret ou mémoire unifiée.
Agents
Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence.
Logiciels
Comparatif des moteurs d'inférence LLM en 2026 et le choix concret de SoberCloud : llama.cpp Vulkan, vLLM et LiteLLM.
Paramètres
Temperature, top-p, top-k, pénalités : comment ces paramètres contrôlent la créativité et la cohérence des réponses d'un LLM.
Quantification
GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis.
Fine-tuning
Comment Unsloth accélère le fine-tuning LoRA et produit des GGUF Dynamic supérieurs, avec un exemple sur Qwen3.6-27B.
Inférence LLM
Retour d'expérience SoberCloud : à fichier équivalent, un Mixture-of-Experts 35B-A3B sert plus vite qu'un modèle dense 27B sur un iGPU à mémoire unifiée.