Référence
Le lexique de l'inférence LLM, expliqué simplement
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser.
Référence
La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama.
Benchmarks
Code, raisonnement, contamination, saturation : panorama des benchmarks LLM et pourquoi nous gardons BenchLocal, notre évaluation qualité interne.
Référence
Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA.
Agents
Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence.