Ce qui change
Artificial Analysis a exécuté son benchmark 100K context sur le modèle Gemma 4 31B sur Groq 3 LPX et y a mesuré 3,431 output tokens/second, chiffre rapporté par le billet de NVIDIA le 24 août 2026 1. Le même jour, The Register a calculé ce que ce modèle occupe sur la machine, un peu plus de 31 GB ou un peu moins de 64 LPUs de capacité SRAM, NVIDIA le faisant tourner en FP8 2. Le billet associe par ailleurs Groq 3 LPX à Vera Rubin NVL72 pour servir des systèmes multiagents portés par des modèles de 2T+ paramètres 1.
Ce qu’un rack contient réellement
À 31 milliards de paramètres, le calcul de The Register loge le modèle dans un seul rack LPX, quel que soit le type de données utilisé pour stocker les poids 2. Ce qui décide de l’ajustement à cette taille, c’est à mon sens le budget SRAM du rack ; la précision ne commence à peser sur le dimensionnement qu’à la frontière où le modèle cesse de tenir dans un rack. La quantité concrète derrière tout cela, c’est un peu moins de 64 LPUs de capacité SRAM en FP8 2. Le tableau ci-dessous met les chiffres côte à côte.
| Chiffre | Valeur | Origine |
|---|---|---|
| Interactivité, benchmark 100K context | 3,431 output tokens/second | Le billet de NVIDIA, rapportant la mesure d’Artificial Analysis 1 |
| Modèle évalué | Gemma 4 31B | Le billet de NVIDIA 1 |
| Poids en FP8 | a little over 31 GB | La dérivation propre de The Register 2 |
| Capacité SRAM nécessaire | just under 64 LPUs | La dérivation propre de The Register 2 |
| Empreinte | un seul rack LPX, quel que soit le type de données | La dérivation propre de The Register 2 |
Impact pour une équipe
Cela concerne qui choisit un fournisseur d’inférence sur des charges à long contexte, et qui dimensionne un rack autour d’un modèle donné. Je calcule d’abord l’empreinte des poids de mon modèle à ma propre précision, puis je la confronte au budget SRAM de l’accélérateur, avant de citer le débit de qui que ce soit, parce que sur ce matériel la capacité s’achète en nombre d’accélérateurs. Ce que cela change, c’est la liste retenue : un fournisseur incapable de loger votre modèle dans un rack relève d’une autre catégorie qu’un concurrent simplement plus lent. Le dimensionnement précède la vitesse.