Performance
Décodage accéléré : spéculatif, MTP, EAGLE et draft models
Speculative decoding, Multi-Token Prediction, EAGLE-3, Medusa : comment générer plusieurs tokens par passe sans dégrader la qualité du LLM.
Performance
Speculative decoding, Multi-Token Prediction, EAGLE-3, Medusa : comment générer plusieurs tokens par passe sans dégrader la qualité du LLM.
Paramètres
Temperature, top-p, top-k, pénalités : comment ces paramètres contrôlent la créativité et la cohérence des réponses d'un LLM.