Ce qui change
NVIDIA a mis en ligne le 21 août 2026 l’exécution d’AVO sur l’ensemble public d’ARC-AGI-3 1. Avec Claude Opus 5, AVO a bouclé les 25 environnements de cet ensemble public au score RHAE de 100.00, les 183 niveaux en 6,624 actions, contre 7,542 pour VISTA 1. L’analyse de juillet d’ARC Prize situe Claude Opus 5 à 30.2 pour cent sur ce même ensemble public, à effort de raisonnement élevé 2.
La limite est publiée avec le chiffre
À mon sens, le jeu de tâches, la métrique et l’effort de raisonnement font partie de la revendication ; une citation qui les omet énonce autre chose. NVIDIA le dit dans le passage où il cite ARC Prize : l’exécution repose sur la même famille de modèles avec un réglage de raisonnement différent, un système d’agent et un protocole d’évaluation substantiellement différents, si bien que ces chiffres ne doivent pas se lire comme une mesure directe de l’apport d’AVO 1. Le billet refuse aussi de qualifier la comparaison AVO/VISTA d’ablation contrôlée ; parmi les différences citées, le moteur d’agent, la représentation des observations, la mémoire et la gestion du contexte 1. The New Stack restitue la même exécution en un seul mouvement : AVO faisant passer Claude Opus 5 d’un score de référence de 30.2 pour cent au niveau du modèle à 100 pour cent dans le système complet 2. Le 30.2 précis vient d’ailleurs de cet article 2.
| Chiffre | Périmètre | Origine |
|---|---|---|
| 100.00 RHAE, 183 niveaux, 6,624 actions | AVO sur l’ensemble public d’ARC-AGI-3, 25 environnements | billet NVIDIA 1 |
| 7,542 actions | VISTA, même modèle, mêmes 183 niveaux publics | billet NVIDIA 1 |
| 30.2 pour cent à effort de raisonnement élevé | Claude Opus 5 sur l’ensemble public d’ARC-AGI-3 | analyse ARC Prize de juillet 2 |
Impact pour une équipe
Qui cite un chiffre ARC-AGI-3 cette semaine est exposé, comme qui compare des harnais d’agents. Fixez le modèle et le jeu de niveaux, notez les actions par niveau résolu à côté du score, et consignez l’effort de raisonnement 1. Le risque : citer un chiffre d’ensemble public comme un chiffre ARC-AGI-3 tout court, alors que le billet primaire tient la distinction 1. Attendez une ablation contrôlée ; le billet dit clairement que ce n’en est pas une 1. Personne n’a mesuré le système de mémoire seul.