Ce qui change
MLCommons a publié MLPerf Client v2.0 le 18 août 2026, avec une catégorie Agentic AI Benchmarking dont les tâches Software Engineering (SWE) et Data Analyst sont mesurées de bout en bout, temps d’exécution des outils compris 1. La liste des modèles bouge aussi, et le tableau ci-dessous en donne le détail 1. Une catégorie dédiée à l’image arrive, avec Flux 2 Klein 4B en expérimental 1.
Ce que le score contient désormais
La frontière de la mesure quitte le modèle pour englober toute la pile locale. Les tests agentiques chronomètrent l’exécution des outils en même temps que l’inférence, si bien que le score appartient à la machine et à tout ce qui fait tourner les tâches SWE et Data Analyst 1. Or les notes nomment ces deux familles de tâches sans nommer ni le harnais d’agent ni les outils qui les exécutent 1. Un an plus tôt, l’article sur la 1.0 citait Llama 2 7B Chat et Phi 3.5 Mini Instruct parmi les modèles testés 2 ; la v2.0 retire Phi 3.5 et fait passer Phi 4 Reasoning 14B dans la catégorie étendue 1.
| Modèle | Nommé dans l’article sur la 1.0, un an plus tôt 2 | Statut en v2.0 1 |
|---|---|---|
| Llama 3.1 8B Instruct | testé | base obligatoire |
| Phi 3.5 Mini Instruct | testé | retiré |
| Phi 4 Reasoning 14B | expérimental | déplacé vers la catégorie étendue |
| Llama 2 7B Chat | testé | non nommé dans les notes v2.0 |
| Phi 4 Mini Instruct | absent des modèles que cet article nomme | base obligatoire |
| Qwen 3 8B | absent des modèles que cet article nomme | test expérimental |
Impact pour une équipe
Cela vise quiconque achète, publie ou chronomètre des chiffres d’AI PC. Reprenez une base de référence sur la v2.0 au lieu de comparer avec une archive v1.x : Phi 3.5 a disparu du socle obligatoire 1, et la liste que cet article documentait 2 n’est pas celle de la v2.0 1. Quand un fournisseur avance un score agentique, exigez la famille de tâches et la couche d’outils qui va avec avant de comparer deux machines 1. Refaites le test vous-même ou ce n’est pas votre chiffre.