Référence
Aide-mémoire LLM : formats, quantification et commandes
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Formats
Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification.
Quantification
GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis.
Fine-tuning
Comment Unsloth accélère le fine-tuning LoRA et produit des GGUF Dynamic supérieurs, avec un exemple sur Qwen3.6-27B.