---
title: Le lexique de l'inférence LLM, expliqué simplement
description: Tous les mots de l'inférence d'IA — token, quantification, KV
  cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article
  pour creuser.
date: 2026-06-05T00:00:00.000Z
dateModified: 2026-06-05T00:00:00.000Z
author:
  name: Antoine Michéa
  url: https://sobercloud.fr/
  sameAs:
    - https://altilink.eu/
tags:
  - reference
  - inference
  - llm
section: Référence
canonical: https://sobercloud.fr/decouvertes/lexique-inference/
---

# Le lexique de l'inférence LLM, expliqué simplement

Le monde des LLM open source parle un dialecte bien à lui : *tokens*, *quantification*, *KV cache*, *MoE*, *MTP*… De quoi décrocher en deux phrases. Ce lexique reprend, en langage clair et **pour les néophytes**, tous les termes qu'on croise quand on fait tourner un modèle de langage. Chaque famille de mots renvoie vers l'article du carnet qui creuse le sujet.

Pas besoin de tout lire d'un coup : gardez cette page sous le coude et revenez-y dès qu'un mot vous échappe.

## Les fondamentaux

De quoi est fait un modèle de langage, et que veut dire « le faire tourner ».

- **LLM (Large Language Model)** — un « grand modèle de langage » : un réseau de neurones entraîné sur d'énormes quantités de texte pour comprendre et générer du langage. « Grand » renvoie à la fois au volume de texte avalé et au nombre de paramètres.
- **Inférence** — le fait d'*utiliser* un modèle déjà entraîné pour produire du texte. C'est l'opposé de l'entraînement (qui, lui, modifie le modèle). Tout ce carnet parle d'inférence.
- **Prompt** — le texte que vous envoyez au modèle : votre question, vos consignes, le contexte que vous fournissez. C'est le point de départ de toute génération.
- **Paramètres / Poids (weights)** — les milliards de valeurs numériques apprises pendant l'entraînement. Un modèle « 27B » a 27 milliards de paramètres. Plus il y en a, plus le modèle est « savant »… et plus il occupe de mémoire (voir VRAM, plus bas).
- **Token** — la brique élémentaire de texte que le modèle manipule : un mot court, un bout de mot ou un signe. Comptez environ 1,3 à 2 tokens par mot en français, selon le modèle. Le modèle ne « voit » jamais des lettres, seulement des tokens.
- **Tokenizer** — l'outil qui découpe le texte en tokens et fait l'inverse. Chaque modèle a le sien.
- **Embedding** — la transformation d'un token en une liste de nombres (un *vecteur*) qui représente son sens. Deux mots proches reçoivent des nombres proches : c'est ainsi que le modèle « mesure » que « roi » et « reine » se ressemblent.
- **Transformer** — l'architecture de réseau de neurones, inventée en 2017, sur laquelle reposent tous les LLM modernes.
- **Attention** — le mécanisme clé du Transformer : il permet à chaque token de « regarder » tous les autres pour décider lesquels comptent. Elle se découpe en plusieurs « têtes », des points de vue parallèles sur le texte. C'est ce qui donne au modèle sa compréhension du contexte.
- **Contexte (context length)** — le nombre maximum de tokens (votre question + la réponse) que le modèle peut traiter d'un coup. Typiquement de 4 000 à 128 000 tokens, parfois plus.
- **RoPE (Rotary Position Embedding)** — la façon moderne d'indiquer au modèle la position de chaque token dans le texte. C'est en grande partie ce qui permet aux modèles de bien gérer les contextes longs.

→ Pour creuser : [Comprendre les LLM open source](/decouvertes/comprendre-les-llm-open-source/).

## Comment le texte est généré

Un LLM écrit un mot après l'autre. Voici le vocabulaire de cette mécanique.

- **Autorégressif** — le modèle génère **un token à la fois**, en réinjectant sa propre sortie pour produire le suivant. D'où une génération séquentielle, mot après mot.
- **Prefill** — la première phase : le modèle lit tout votre prompt d'un coup. C'est gourmand en puissance de calcul (on dit *compute-bound* ; voir la section Matériel).
- **Decode** — la phase suivante : la génération token par token. Elle est limitée par la vitesse de la mémoire (*bandwidth-bound*), pas par la puissance de calcul.
- **Completion** — le texte produit par le modèle en réponse au prompt (aussi appelé « génération » ou « réponse »).
- **EOS (End of Sequence)** — le token spécial qui signale « j'ai fini ». Le modèle s'arrête de produire quand il le génère.
- **Sampling** — la façon de choisir le prochain token dans la liste des candidats probables. C'est là qu'interviennent les réglages ci-dessous.
- **Hyperparamètre** — un réglage que **vous** ajustez au moment de générer (temperature, top-p, top-k…), à ne pas confondre avec les paramètres/poids du modèle, eux figés une fois pour toutes à l'entraînement.
- **Temperature** — le bouton « créativité ». Basse (0,1–0,3) = réponses prévisibles et stables (presque toujours la même réponse à la même question) ; haute (0,8–1,5) = plus variées et surprenantes.
- **Top-K** — on ne tire que parmi les K tokens les plus probables. Coupe les choix farfelus.
- **Top-P (nucleus)** — on ne garde que les tokens les plus probables jusqu'à atteindre une probabilité cumulée P. Plus souple que le Top-K.
- **Zero-shot / Few-shot** — demander une tâche sans aucun exemple (*zero-shot*), ou en glissant quelques exemples dans le prompt (*few-shot*) pour guider le modèle.
- **Chat Template** — le format précis (balises de rôles « user » / « assistant », tokens spéciaux) qu'un modèle attend pour une conversation. Il diffère d'un modèle à l'autre, et un mauvais template donne des réponses incohérentes.
- **Hallucination** — quand le modèle invente une information fausse présentée comme vraie. C'est un travers de fond : un LLM prédit le texte *plausible*, pas forcément *vrai*.

→ Pour creuser : [Paramètres de génération](/decouvertes/parametres-de-generation/).

## Faire tenir le modèle en mémoire

Un modèle brut est énorme. Ces termes décrivent comment on le compresse et le range.

- **Quantification** — réduire la précision des poids (par exemple de 16 bits vers 4 bits) pour diviser la taille mémoire et accélérer l'inférence, avec une perte de qualité minime. C'est, en gros, le « JPEG » du modèle : comme une photo compressée, on perd un peu de finesse mais le fichier devient bien plus léger.
- **FP16 / FP32 / BF16** — des formats de nombres à virgule. FP32 (32 bits) est précis mais lourd ; FP16/BF16 (16 bits) sont le standard. BF16 garde la même plage que FP32 avec moins de précision.
- **INT4 / INT8** — des formats entiers sur 4 ou 8 bits, utilisés pour quantifier les poids et réduire drastiquement la mémoire.
- **GGUF** — le format de fichier des modèles quantifiés pour llama.cpp : un seul fichier qui contient tout (poids, tokenizer, configuration). Le plus simple à utiliser en local.
- **SafeTensors** — le format standard de Hugging Face pour stocker les poids : sûr et rapide à charger. Utilisé par la plupart des outils GPU (Transformers, vLLM, SGLang…).
- **GPTQ / AWQ / EXL2 / EXL3** — d'autres méthodes/formats de quantification, chacun avec ses compromis qualité/taille. AWQ préserve les poids les plus importants ; EXL2/EXL3 autorisent des précisions « mixtes ».
- **Dense (modèle)** — architecture classique où **tous** les paramètres servent à chaque token.
- **MoE (Mixture of Experts)** — architecture où seule une fraction des paramètres (les « experts ») s'active par token. Un **Qwen3.6-35B-A3B** a 35 milliards de paramètres mais n'en active qu'environ **3 milliards par token** (d'où le « A3B » = *Active 3B*) : grand savoir, calcul réduit. À l'inverse, **Qwen3.6-27B** est dense — ses 27 milliards de paramètres sont tous actifs à chaque token.
- **HuggingFace** — la plateforme principale où l'on télécharge gratuitement les modèles open source (et leurs versions quantifiées GGUF). En somme, le « GitHub » des modèles d'IA.

→ Pour creuser : [Quantification avancée](/decouvertes/quantification-avancee/) et [Formats de modèles](/decouvertes/formats-de-modeles/).

## Aller plus vite

Servir un modèle vite, c'est surtout éviter de recalculer ce qui peut être réutilisé.

- **KV cache (Key-Value cache)** — l'« antisèche » du modèle : il mémorise les calculs d'attention des tokens déjà vus pour ne pas les refaire à chaque nouveau token. Indispensable, mais il grossit avec la longueur de la conversation.
- **Flash Attention** — un algorithme d'attention optimisé qui réduit les allers-retours en mémoire. Plus rapide, et moins de VRAM consommée.
- **GQA / MLA / SWA** — des variantes d'attention qui allègent le KV cache : GQA fait partager des têtes d'attention, MLA les compresse, SWA (*sliding window*) ne regarde que les W derniers tokens.
- **Décodage spéculatif** — un petit modèle rapide (le « brouillon », *draft*) propose plusieurs tokens d'avance ; le gros modèle (le modèle « cible », *target*) les vérifie tous en même temps au lieu de les produire un par un — il garde ceux qui correspondent à ce qu'il aurait écrit et rejette les autres. Le résultat est **mathématiquement identique** à une génération normale : on gagne en vitesse sans rien perdre en qualité. Speedup ×2 à ×3.
- **MTP (Multi-Token Prediction)** — une forme de décodage spéculatif **intégrée au modèle** : il apprend à prédire plusieurs tokens à la fois. Bien réglé, il nous a donné environ **+40 % de débit** (≈ 52 → 73 t/s) sur nos bancs de test.
- **EAGLE / Medusa** — d'autres techniques de décodage spéculatif, encore plus rapides dans certains cas (jusqu'à ×6,5 pour EAGLE-3 dans les meilleurs cas).
- **Throughput (débit)** — la vitesse de génération, mesurée en **tokens par seconde (t/s)**. La métrique reine de l'inférence.
- **Batch size** — le nombre de requêtes traitées en parallèle. Un plus gros batch augmente le débit total mais consomme plus de mémoire.

→ Pour creuser : [Cache KV](/decouvertes/cache-kv/), [Flash Attention](/decouvertes/flash-attention/) et [Décodage accéléré](/decouvertes/decodage-accelere/).

## Le matériel

L'inférence est avant tout une affaire de mémoire et de bande passante.

- **GPU** — la carte graphique, le moteur de l'inférence. Sa mémoire (la VRAM) est la contrainte numéro un.
- **VRAM** — la mémoire embarquée du GPU. Elle plafonne la taille du modèle qu'on peut charger (par exemple 24 Go sur une RTX 3090).
- **Mémoire unifiée (UMA)** — sur certaines puces (Apple Silicon, AMD « Strix Halo »), le CPU et le GPU partagent la même RAM. Pratique pour charger de gros modèles, mais la bande passante devient le facteur limitant.
- **Compute-bound vs bandwidth-bound** — un système est « compute-bound » quand le frein est la puissance de calcul, « bandwidth-bound » quand c'est la vitesse de la mémoire. Sur une mémoire unifiée, on est typiquement bandwidth-bound : un modèle plus petit en octets va plus vite.
- **Tensor Cores** — des circuits spécialisés des GPU NVIDIA qui accélèrent les énormes multiplications de tableaux de nombres (les « calculs matriciels ») dont les LLM se nourrissent.
- **FLOPS** — une mesure de puissance de calcul brute (opérations à virgule par seconde).

→ Pour creuser : [Choix du matériel](/decouvertes/choix-du-materiel/) et notre comparatif [Dense ou MoE sur Strix Halo](/decouvertes/dense-vs-moe-strix-halo/).

## Les pilotes (drivers)

Pour parler au GPU, il faut la bonne couche logicielle.

- **CUDA** — la plateforme de calcul de NVIDIA. L'écosystème le plus mûr.
- **ROCm** — l'équivalent open source d'AMD.
- **Vulkan** — une API multiplateforme qui fonctionne sur (presque) tous les GPU — AMD, NVIDIA, Intel. Pratique pour sa portabilité (c'est la voie qu'on emprunte sur Strix Halo), parfois en retrait sur les performances face à CUDA/ROCm natif.
- **Metal / MLX** — l'API de calcul d'Apple et son framework de ML, pour l'inférence sur Mac.

→ Pour creuser : [Drivers GPU : Vulkan, ROCm, CUDA](/decouvertes/drivers-gpu/).

## Les logiciels d'inférence

Le programme qui charge le modèle et répond aux requêtes.

- **llama.cpp** — le moteur léger de référence pour l'inférence locale, notamment via GGUF. Excellent sur CPU et mémoire unifiée.
- **vLLM** — le moteur de référence pour mettre un modèle à disposition sur GPU et répondre à de nombreuses requêtes en parallèle (le « serving »). Son innovation, PagedAttention, range le KV cache en mémoire plus efficacement.
- **SGLang** — un moteur taillé pour les usages d'agents IA (voir plus bas). Son astuce, RadixAttention, partage automatiquement le KV cache entre requêtes qui ont un début commun.
- **Ollama / LM Studio** — des surcouches conviviales pour lancer un modèle en local en quelques clics/commandes.
- **MLX** — le framework d'Apple pour l'inférence (et le fine-tuning) sur Mac.
- **LiteLLM** — un proxy qui expose plusieurs moteurs derrière une seule API compatible OpenAI.

→ Pour creuser : [Logiciels d'inférence](/decouvertes/logiciels-inference/), avec un [guide pratique](/decouvertes/guide-pratique/) et un [aide-mémoire des commandes](/decouvertes/aide-memoire/).

## Adapter un modèle

Quand on veut spécialiser un modèle sur ses propres données.

- **Fine-tuning** — ré-entraîner un modèle déjà existant sur des données spécifiques pour l'adapter à une tâche ou un domaine.
- **LoRA (Low-Rank Adaptation)** — une méthode de fine-tuning économe : on n'entraîne qu'une petite fraction de paramètres au lieu du modèle entier.
- **QLoRA** — du LoRA appliqué sur un modèle de base quantifié en 4 bits, pour fine-tuner même avec peu de VRAM.
- **SFT / RLHF / DPO** — les grandes familles de *post-entraînement* (l'alignement) : SFT (*Supervised Fine-Tuning*, apprendre à suivre des consignes), RLHF (apprentissage par renforcement sur retours humains) et DPO (*Direct Preference Optimization*), qui alignent le modèle sur des préférences humaines.
- **Instruct (modèle)** — un modèle fine-tuné pour suivre des instructions et dialoguer. C'est la version à choisir pour poser des questions, par opposition au modèle « base » qui ne fait que prolonger le texte.
- **Dataset** — l'ensemble de données (conversations, instructions, texte) qui sert à entraîner ou fine-tuner.

→ Pour creuser : [Fine-tuning complet](/decouvertes/fine-tuning-complet/) et [Unsloth en profondeur](/decouvertes/unsloth-en-profondeur/).

## Agents, outils et mesure

Le vocabulaire de l'IA qui agit, et de la façon dont on la juge.

- **Agent (IA)** — un système qui pilote un LLM en boucle « décider un outil → l'exécuter → observer le résultat » pour atteindre un objectif en plusieurs étapes, de façon autonome.
- **Harness** — la couche logicielle qui orchestre cette boucle avec des outils (lecture de fichiers, terminal, web…). Claude Code, Cursor ou Aider sont des harness.
- **Tool calling** — la capacité d'un modèle à demander l'exécution d'un outil dans un format structuré, plutôt que de répondre en texte libre.
- **MCP (Model Context Protocol)** — un standard (Anthropic, 2024) pour brancher des outils externes (bases de données, API) sur un harness. Largement adopté en 2026.
- **RAG (Retrieval-Augmented Generation)** — on va d'abord chercher des documents pertinents, puis on les donne au modèle pour qu'il réponde avec des sources à jour.
- **System prompt** — les instructions initiales qui cadrent le comportement du modèle (ton, contraintes, format).
- **Chain-of-Thought (CoT)** — demander au modèle de raisonner étape par étape avant de conclure.
- **Perplexité** — une mesure de qualité d'un modèle de langage : plus elle est basse, mieux le modèle prédit le texte.
- **Benchmark** — un test standardisé pour comparer des modèles (qualité, vitesse). Utile, mais rien ne remplace une mesure sur sa propre charge.

→ Pour creuser : [Harness et agents de code](/decouvertes/harness-agents-code/) et [Benchmarks LLM](/decouvertes/benchmarks-llm/).

## Pour aller plus loin

Ce lexique est la porte d'entrée du carnet **Découvertes**. Les piliers à lire ensuite :

- [Comprendre les LLM open source](/decouvertes/comprendre-les-llm-open-source/) — les bases, en détail.
- [Quantification avancée](/decouvertes/quantification-avancee/) — combien de bits sans casser la qualité.
- [Choix du matériel](/decouvertes/choix-du-materiel/) — VRAM, mémoire unifiée, bande passante.
- [Logiciels d'inférence](/decouvertes/logiciels-inference/) — quel moteur pour quel usage.
