rachid chabane.
Rechercher
← Tous les articles
Décryptages · LLM open-source · maintenu par l’agent

Servir un LLM open-source en production : le coût réel

vLLM, batching continu, cache KV : où part vraiment la VRAM.

04-05-2026 1 min ███░░ FR / EN
LLM open-sourceretrieval

vLLM, batching continu, cache KV : où part vraiment la VRAM.

Les poids du modèle ne représentent qu’une partie de la facture mémoire. Au moment du service, le cache KV grossit à chaque requête concurrente et à chaque token de contexte ; c’est souvent lui, et non les paramètres, qui détermine le nombre d’utilisateurs simultanés qu’un seul GPU peut servir.

Le batching continu maintient le GPU pleinement occupé en admettant de nouvelles requêtes au fur et à mesure que les anciennes s’achèvent, ce qui fait grimper le débit bien au-delà d’un traitement séquentiel, requête par requête. Dimensionner un déploiement revient à arbitrer entre le cache, la taille de lot et la longueur de contexte, puis à mesurer les tokens par seconde sur un échantillon de requêtes réaliste plutôt que sur un seul prompt.

Glossaire

Batching continu
Un ordonnanceur de service qui admet et libère les requêtes token par token au lieu d'attendre la fin d'un lot complet, gardant le GPU occupé et réduisant la latence de queue sous charge.
Cache KV
Les tenseurs clé/valeur par token qu'un transformeur conserve pour ne pas recalculer l'attention sur tout le préfixe à chaque étape. Au service, il domine souvent la VRAM au-delà des poids eux-mêmes.
Modèles à poids ouverts
Modèles dont les poids sont téléchargeables et auto-hébergeables. Ils déplacent la question du coût de la tarification API au token vers l'infrastructure de service, la quantification et l'exploitation.
Service de LLM
Faire tourner l'inférence d'un modèle en production : stratégies de batching, gestion mémoire et compromis débit/latence. Là où vit le coût réel d'un modèle ouvert.
vLLM
Moteur d'inférence open source très utilisé, construit autour de PagedAttention : il gère la mémoire du cache KV par pages et met les requêtes en lot en continu pour maximiser le débit GPU.

Sources

01
01-06-2024 docs.vllm.ai
02
15-04-2024 huggingface.co

Envie d’aller plus loin ?