Référence
Le lexique de l'inférence LLM, expliqué simplement
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Benchmarks
Panorama des benchmarks LLM, comment lire les scores — et quatre pièges de mesure côté serveur qui produisent des chiffres crédibles et faux.
Référence
Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.
Agents
Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence.