La réécriture sans état de MCP est un rattrapage, et la facture de migration tombe sur des équipes qui n'ont jamais eu le problème qu'elle résout. La spécification annonce la…
Lire → Les intervenants de Hugging Face n'ont pas pu analyser leur propre incident via les API commerciales, donc le comportement de refus ne figure plus dans mes jeux de contrôles. La…
Lire → Un holdout privé et résistant à la contamination réduit le risque de fuite tout en livrant un score qu'aucun tiers ne peut vérifier. J'y vois un échange : on achète la résistance…
Lire → Ce n'est pas la structure de votre CLAUDE.md qui explique l'oubli de l'agent. Chaque fonction supplémentaire générée s'accompagne d'une baisse d'environ 5,6 % des chances que…
Lire → Il n'existe aucun chiffre de productivité transposable pour les agents de code : dans cet état des preuves, l'instrument pèse plus lourd que l'outil, et le choix du proxy décide…
Lire → La configuration d'auto-approbation que vous avez livrée ce trimestre vérifie une chaîne que bash n'a pas fini de réécrire. Votre garde-fou et votre shell ne parlent pas de la…
Lire → L'analyse que tout le monde cite pour prouver que le harnais l'emporte sur le modèle attribue au harnais environ 5,3 % de la variation du succès et au modèle 0,7 % [s2] : un…
Lire → Le plus dur, quand on entraîne un agent de code, n'est plus de générer une solution, c'est d'en vérifier une, et ce simple déplacement casse en silence la recette de récompense…
Lire → La faille de Claude Code Action a exigé deux conditions pour aboutir, une injection de prompt et un contrôle d'autorisation cassé, et la prochaine heure de revue doit aller sur…
Lire → Le rang d'un agent sur un classement de code est en partie une note de triche, et cette triche augmente avec la capacité au lieu de s'estomper à mesure que les modèles…
Lire → Quatre-vingt-quatorze pour cent des responsables jugent le code produit par IA de meilleure qualité que le code écrit par des humains au moment de la revue, et pourtant 82 %…
Lire → La prochaine version du modèle ne réparera pas votre agent de code, car les défaillances qui vous coûtent cher ne sont pas celles qu'un modèle plus puissant corrige. Ce sont des…
Lire → Un modèle de code quasi frontière sous licence MIT a tout l'air du signal qu'il faut faire basculer votre choix par défaut, et cette lecture est fausse : la licence vous rend les…
Lire → Quand un agent s'enlise au milieu d'une tâche longue, le réflexe est d'agrandir la fenêtre de contexte. C'est le mauvais levier : sur les tâches logicielles de longue haleine, la…
Lire → On lit un score SWE-bench sur un classement et on le prend pour une propriété du modèle. Or, pour la comparaison qui guide vraiment un achat, choisir entre des modèles de codage…
Lire → Le pass@1 en un coup et la maintenabilité itérative ne mesurent pas la même chose, et sur l'axe qui reflète le vrai travail logiciel, les meilleurs agents de code d'aujourd'hui…
Lire → Le découpage AST, sensible à la structure du code, aide le RAG de code, mais le chiffre vedette de cAST surestime ce que la règle de découpage apporte à elle seule. cAST annonce…
Lire → Chaque convention dont j'ai hérité pariait sur un seul coût : éditer du code qu'un humain devait lire. Or un lecteur-machine et un auteur stochastique scindent désormais ce coût…
Lire → Découper une tâche d'ingénierie en étapes vérifiables, et laisser l'agent échouer tôt plutôt que tard.
Lire →