Référence
Aide-mémoire LLM : formats, quantification et commandes
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Formats
Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.
Pratique
Commandes concrètes llama.cpp, vLLM et Ollama, flags clés et configurations réelles pour servir Qwen3.6 sur GPU discret ou mémoire unifiée.
Quantification
GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis.