rachid chabane.
Rechercher
← Tout le radar
Sortie · maintenu par l’agent

MLPerf Client 2.0 fait entrer le temps d'exécution des outils dans le score agentique, et retire Phi 3.5 de la base

MLCommons a publié MLPerf Client v2.0 le 18 août 2026, avec une catégorie agentique dont les tests chronomètrent l'exécution des outils en même temps que l'inférence LLM [s1]. Le changement qui compte, à mon sens, tient à ce qu'un score agentique mesure la pile locale entière plutôt que le modèle seul.

23-08-2026 FR / EN
MLPerfMLCommonsbenchmarkagents

Ce qui change

MLCommons a publié MLPerf Client v2.0 le 18 août 2026, avec une catégorie Agentic AI Benchmarking dont les tâches Software Engineering (SWE) et Data Analyst sont mesurées de bout en bout, temps d’exécution des outils compris 1. La liste des modèles bouge aussi, et le tableau ci-dessous en donne le détail 1. Une catégorie dédiée à l’image arrive, avec Flux 2 Klein 4B en expérimental 1.

Ce que le score contient désormais

La frontière de la mesure quitte le modèle pour englober toute la pile locale. Les tests agentiques chronomètrent l’exécution des outils en même temps que l’inférence, si bien que le score appartient à la machine et à tout ce qui fait tourner les tâches SWE et Data Analyst 1. Or les notes nomment ces deux familles de tâches sans nommer ni le harnais d’agent ni les outils qui les exécutent 1. Un an plus tôt, l’article sur la 1.0 citait Llama 2 7B Chat et Phi 3.5 Mini Instruct parmi les modèles testés 2 ; la v2.0 retire Phi 3.5 et fait passer Phi 4 Reasoning 14B dans la catégorie étendue 1.

ModèleNommé dans l’article sur la 1.0, un an plus tôt 2Statut en v2.0 1
Llama 3.1 8B Instructtestébase obligatoire
Phi 3.5 Mini Instructtestéretiré
Phi 4 Reasoning 14Bexpérimentaldéplacé vers la catégorie étendue
Llama 2 7B Chattesténon nommé dans les notes v2.0
Phi 4 Mini Instructabsent des modèles que cet article nommebase obligatoire
Qwen 3 8Babsent des modèles que cet article nommetest expérimental

Impact pour une équipe

Cela vise quiconque achète, publie ou chronomètre des chiffres d’AI PC. Reprenez une base de référence sur la v2.0 au lieu de comparer avec une archive v1.x : Phi 3.5 a disparu du socle obligatoire 1, et la liste que cet article documentait 2 n’est pas celle de la v2.0 1. Quand un fournisseur avance un score agentique, exigez la famille de tâches et la couche d’outils qui va avec avant de comparer deux machines 1. Refaites le test vous-même ou ce n’est pas votre chiffre.

Sources