Ce qui change
Deux mesures indépendantes de Qwen3.8 27B sont tombées à un jour d’intervalle, sur des montages sans rien de commun. Le 26 août 2026, Quesma a publié des scores par tâche sur les quantifications GGUF d’Unsloth, pour environ 3 000 dollars de GPU loués chez Modal 1. Le 27 août 2026, TerminalBytes a publié cinq mesures chronométrées du même modèle sous Ollama, sur un Mac Studio M3 Ultra 2. Les deux aboutissent à 17 Go pour le fichier 4 bits Q4_K_M 12, et les deux constatent qu’une compilation ancienne de llama.cpp ne fait pas tourner le modèle 12.
L’accord que personne ne cherchait
Quesma a travaillé avec une compilation de llama.cpp datée du 16 août 2026, les versions
antérieures ne fonctionnant pas avec ce modèle 1. TerminalBytes prévient de son côté
qu’il faut une compilation des dernières semaines, les plus anciennes échouant sur
unknown model architecture: 'qwen35' 2. Deux ingénieurs, deux chaînes d’outils, deux
machines, un même mur. Le marqueur d’architecture du GGUF est le signal, et j’y vois une
règle générale : pour un modèle ouvert aussi récent, c’est le runtime qui manque.
| Même machine, même quantification Q4_K_M de 17 Go 2 | qwen3.6:27b | qwen3.8:27b |
|---|---|---|
| Vitesse de génération, moyenne sur 5 runs | 28.6 tok/s | 14.0 tok/s |
| Jetons consommés par réponse | 1,950-3,340 | 890-1,090 |
Ces chiffres démentent la lecture spontanée. La vitesse a été divisée par deux entre les deux versions, or le modèle récent répond avec environ un tiers des jetons : le temps réel par réponse terminée est quasiment à égalité 2. Comparez des réponses terminées avant des jetons par seconde.
Le coût de reproductibilité, lui, dure. Quesma note qu’Unsloth a remplacé les fichiers v2 le 19 août 2026, si bien que les fichiers exacts derrière la plupart de ses scores ne sont plus disponibles 1.
Impact pour une équipe
La décision concerne quiconque fige une image d’inférence locale ce trimestre. Épinglez ensemble la compilation de llama.cpp ou d’Ollama, la révision exacte du fichier GGUF et le niveau d’effort de raisonnement. Quesma prévient que ce réglage pèse lourd, que la valeur par défaut est xhigh et qu’il pousse au sur-raisonnement 1 ; omettez-le et vos chiffres ne veulent plus rien dire. Le piège de migration joue ici à l’envers : aucune carte n’a rétréci, donc un dimensionnement bâti sur 17 Go tient toujours 12, tandis que le conteneur figé en juillet refuse le modèle d’emblée 12. Reconstruisez le runtime, puis mesurez.