La réécriture sans état de MCP est un rattrapage, et la facture de migration tombe sur des équipes qui n'ont jamais eu le problème qu'elle résout. La spécification annonce la…
Lire → Les intervenants de Hugging Face n'ont pas pu analyser leur propre incident via les API commerciales, donc le comportement de refus ne figure plus dans mes jeux de contrôles. La…
Lire → Le score d'abstention publié par un benchmark est un taux, et le nombre qui décide du câblage d'un agent est le nombre d'actions irréversibles exécutées avant son arrêt. La…
Lire → Si votre agent a choisi le mauvais outil, la formulation de vos descriptions d'outils n'y est presque pour rien. Dans une étude de 2026, la réparation par le prompt récupère au…
Lire → Ce n'est pas la structure de votre CLAUDE.md qui explique l'oubli de l'agent. Chaque fonction supplémentaire générée s'accompagne d'une baisse d'environ 5,6 % des chances que…
Lire → Les trois résultats de mi-2026 qui ressemblent à une querelle générale sur la défense contre le prompt injection ne se contredisent pas, et nommer la couche que chacun attaque…
Lire → La configuration d'auto-approbation que vous avez livrée ce trimestre vérifie une chaîne que bash n'a pas fini de réécrire. Votre garde-fou et votre shell ne parlent pas de la…
Lire → L'analyse que tout le monde cite pour prouver que le harnais l'emporte sur le modèle attribue au harnais environ 5,3 % de la variation du succès et au modèle 0,7 % [s2] : un…
Lire → Le plus dur, quand on entraîne un agent de code, n'est plus de générer une solution, c'est d'en vérifier une, et ce simple déplacement casse en silence la recette de récompense…
Lire → Normalisez le budget de jetons de réflexion et l'avantage de raisonnement multi-saut que l'on prête à l'orchestration multi-agent cesse d'apparaître de façon fiable [s1]. Ce seul…
Lire → L'argument de vente d'un agent de revue de code, c'est qu'il lit chaque pull request à votre place. Une étude empirique portant sur 13 d'entre eux renverse cet argument : 60,2 %…
Lire → La faille de Claude Code Action a exigé deux conditions pour aboutir, une injection de prompt et un contrôle d'autorisation cassé, et la prochaine heure de revue doit aller sur…
Lire → Acheter un tableau de bord d'observabilité, ce n'est pas savoir que votre agent a raison, et c'est pourtant le troc que la plupart des équipes concluent en silence. Deux enquêtes…
Lire → Un 92,5 au benchmark mémoire LoCoMo vous dit que votre agent sait retrouver un fait, et presque rien sur sa tendance à continuer de le servir avec pleine confiance une fois qu'il…
Lire → Quatre-vingt-quatorze pour cent des responsables jugent le code produit par IA de meilleure qualité que le code écrit par des humains au moment de la revue, et pourtant 82 %…
Lire → La prochaine version du modèle ne réparera pas votre agent de code, car les défaillances qui vous coûtent cher ne sont pas celles qu'un modèle plus puissant corrige. Ce sont des…
Lire → MCP a rendu triviale la connexion d'un agent à ses outils en faisant confiance aux descriptions d'outils du serveur, et ce choix par défaut a déplacé sans bruit la frontière de…
Lire → Vous activez le cache de prompt en attendant que la facture baisse et que la latence diminue, et la plupart du temps c'est ce qui se produit. Mais la première étude contrôlée…
Lire → Quand un agent s'enlise au milieu d'une tâche longue, le réflexe est d'agrandir la fenêtre de contexte. C'est le mauvais levier : sur les tâches logicielles de longue haleine, la…
Lire → Sélectionner un agent autonome multi-étapes sur son score pass@1, c'est optimiser le mauvais chiffre : capacité et fiabilité coïncident à l'horizon un mais divergent dès que…
Lire → On lit un score SWE-bench sur un classement et on le prend pour une propriété du modèle. Or, pour la comparaison qui guide vraiment un achat, choisir entre des modèles de codage…
Lire → La plupart des équipes budgètent leurs entraînements au dollar près et considèrent l'évaluation comme à peu près gratuite. Un seul balayage d'agents sur le Holistic Agent…
Lire → Le pass@1 en un coup et la maintenabilité itérative ne mesurent pas la même chose, et sur l'axe qui reflète le vrai travail logiciel, les meilleurs agents de code d'aujourd'hui…
Lire → Découper une tâche d'ingénierie en étapes vérifiables, et laisser l'agent échouer tôt plutôt que tard.
Lire → Un agent qui mène la tâche à bien mais corrompt l’état n’a rien réussi du tout.
Lire →