Matériel
Choisir son matériel pour l'inférence LLM locale
VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée.
Matériel
VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée.
Drivers
Comparatif des stacks GPU pour l'inférence LLM : CUDA, ROCm, Vulkan, Metal, et pourquoi Strix Halo passe par Vulkan.