Ce qui change
Relay-Bench a été déposé sur arXiv le 20 juillet 2026 par Liam Swayne, en réponse à la saturation des benchmarks 12. Son auteur le décrit comme « non saturé, holistique, uniquement textuel » 1. Le format des items fait tout l’intérêt : le jeu de test ne contient que des problèmes composites, de deux à treize sous-problèmes mono-domaine enchaînés dans une seule invite, avec des couches d’encodage de l’invite et de gonflement délibéré du contexte 1. Les domaines couvrent le raisonnement visuel, le code, les mathématiques, l’extraction d’information axée recherche web, la résolution de problèmes, la culture générale et l’analyse de données ; le harnais n’impose aucune restriction et encourage explicitement l’exécution de code, la recherche web et tout outil disponible 1. GPT-5.5 en effort xHigh domine avec 43,3 % 12.
Le chiffre auquel le comparer
Ces 43,3 % ne prennent leur sens qu’à côté de ce que le même modèle, GPT-5.5 en xHigh, obtient quand le travail arrive une tâche à la fois. Zaikei Shimbun a posé cette comparaison le 23 juillet 2.
| Benchmark | Score | Rapporté par |
|---|---|---|
| Relay-Bench | 43,3 % | l’article 12 |
| Terminal-Bench 2.0 | 82,7 % | Zaikei Shimbun 2 |
| FrontierMath Tiers 1 à 3 | 51,7 % | Zaikei Shimbun 2 |
Je lis cet écart comme un fait sur la forme des tâches, pas sur la capacité brute. Le modèle qui franchit un banc d’essai d’agent en terminal est celui-là même qui cale dès que son étape trois devient la prémisse de l’étape quatre. C’est mon interprétation : aucune des deux sources ne nomme de mécanisme.
Ce que cela change dans une suite d’évaluation
Les équipes recopient les suites par capacité, parce que les fournisseurs les publient et qu’elles coûtent peu à assembler. Elles mesurent un modèle qui fait une seule chose dans un contexte propre, or ce n’est jamais la forme sous laquelle tourne ce que vous mettez en production. Inutile d’élargir la suite. Ajoutez-y un item composite : trois ou quatre de vos vraies sous-tâches enchaînées dans une seule invite, évaluées de bout en bout, réussite ou échec sur la seule réponse finale. La précision par étape restera bonne pendant que cet item échoue ; c’est cet écart qu’il faut suivre.
Impact pour une équipe
Si votre agent est aujourd’hui conditionné à un seuil de précision par étape, c’est ce seuil qu’il faut revoir ce trimestre, avant la prochaine décision de montée de version. Deux gestes concrets : un item composite évalué de bout en bout dans la suite, et un point de vérification entre les étapes enchaînées, pour qu’un résultat intermédiaire faux ne devienne pas la prémisse du suivant. Ce qu’il faut ignorer : les 43,3 % comme signal de classement des modèles. Un article, un auteur, un score ne classent rien.