La télémétrie de votre agent de code est un réglage de comportement
À mon sens, la télémétrie d'un agent de code règle son comportement : dans Claude Code, elle a décidé des instructions chargées et du mode de départ des sessions interactives. Un…
À mon sens, la télémétrie d'un agent de code règle son comportement : dans Claude Code, elle a décidé des instructions chargées et du mode de départ des sessions interactives. Un…
À mon sens, des runners plus rapides ne suffisent pas face à la charge de CI des agents de code : chaque test coûte moins cher, mais les agents multiplient exécutions et revues.…
Je ne cite pas un taux de qualité des correctifs tant que je ne sais pas si l'évaluateur qui l'a produit donnerait deux fois le même verdict au même correctif. La pédanterie…
Servi en BF16, un accélérateur de décodage dit sans perte ne tient plus la promesse qu'on y lit, et cette étiquette ne devrait jamais court-circuiter l'évaluation. L'article…
Le plafond de tokens d'une session se règle : passé un point mesurable, un token de plus vaut moins qu'un nouvel échantillon, et le découpage exige un évaluateur bon marché. Dans…
Dire à un agent de code de demander en cas de doute suppose qu'il voie que la spécification est incomplète, et deux benchmarks montrent que les modèles peinent justement là. Sur…
Opposer diff et fichier entier ne suffit pas pour décider comment un modèle de code doit éditer : je pense que la taille de l'unité éditée compte dans ce choix, à côté du format.…
Votre couche d'autorisation valide l'artefact produit par l'agent et jamais le raisonnement qui l'a produit, si bien que le contrôle qui a manqué n'a jamais été écrit. Les…
L'état que votre agent transporte d'un tour à l'autre relève de la décision d'achat, et ARC Prize vient de publier ce que coûte la version lisible de cet état. Un seul modèle, un…
Une allowlist de sortie qui filtre sur le verbe HTTP ne borne rien, car c'est l'extrémité distante qui décide si une requête est une lecture ou une écriture. Un essaim autorisé à…
Localisez la faute, remplissez l'intervalle suspect, et vous perdez face à un simple échantillon de plus [s3] ; l'étape de livraison coûte plus que le signal ne vaut. Je pense…
L'essentiel du budget sécurité achète un ordre de passage dans une file qui ne se vide pas, et l'heure marginale rapporte davantage investie dans le débit de remédiation. La note…
À mon sens, une migration à l'échelle du dépôt est décidée par l'instrument qui la note : une note comportementale ne voit pas une migration absente. Ce n'est pas un jugement sur…
À mon sens, la variable de conception d'un harnais de code tient à ce que dit la trace d'échec, et mes deux réflexes y écrivent le mauvais texte. Le premier consiste à consigner…
Le filigrane est fait de la liberté du sampler [s17], et chaque pratique qui rend mon agent de code fiable dépense cette même liberté. Anthropic énonce le mécanisme sans détour :…
En multi-agents, l'intervention qui a payé en tokens mesurés est celle qui a changé ce que chaque agent peut lire. C'est là, à mon sens, que se joue le débat sur le design.
Le gain de votre agent de code s'affiche sur votre tableau de bord, et la facture atterrit sur une trace publique qu'aucun tableau de bord ne possède. Le gain est réel et mesuré:…
Si vous rédigez une politique LLM pour votre dépôt, c'est la prémisse retenue qui décide de l'endroit où la règle fuira. Trois projets de chaîne d'outils viennent de publier la…
L'arrêt anticipé d'un run d'agent s'achète au moment où l'on sert le modèle, et il se paie en épisodes réussis que votre cible de rappel a décidé de tuer.
Le contrôle qui autorise une écriture doit lire l'état de l'environnement, seule preuve que le récit de l'agent ne peut pas inventer ; un détecteur arrive après l'écriture.
Énumérer les instances autorisées d'une opération n'apporte aucune garantie sur l'effet que cette opération était censée empêcher.
La réécriture sans état de MCP est un rattrapage, et la facture de migration tombe sur des équipes qui n'ont jamais eu le problème qu'elle résout. La spécification annonce la…
Le +11.3 % que le plugin AFD de vLLM rapporte en 64A16F [s1] ne se transporte pas jusqu'à votre cluster, et la publication ne livre pas de quoi le mériter. Par rapport à EP64, le…
Les intervenants de Hugging Face n'ont pas pu analyser leur propre incident via les API commerciales, donc le comportement de refus ne figure plus dans mes jeux de contrôles. La…
Le score d'abstention publié par un benchmark est un taux, et le nombre qui décide du câblage d'un agent est le nombre d'actions irréversibles exécutées avant son arrêt. La…
Un holdout privé et résistant à la contamination réduit le risque de fuite tout en livrant un score qu'aucun tiers ne peut vérifier. J'y vois un échange : on achète la résistance…
Ce n'est pas la structure de votre CLAUDE.md qui explique l'oubli de l'agent. Chaque fonction supplémentaire générée s'accompagne d'une baisse d'environ 5,6 % des chances que…
Les trois résultats de mi-2026 qui ressemblent à une querelle générale sur la défense contre le prompt injection ne se contredisent pas, et nommer la couche que chacun attaque…
Il n'existe aucun chiffre de productivité transposable pour les agents de code : dans cet état des preuves, l'instrument pèse plus lourd que l'outil, et le choix du proxy décide…
La configuration d'auto-approbation que vous avez livrée ce trimestre vérifie une chaîne que bash n'a pas fini de réécrire. Votre garde-fou et votre shell ne parlent pas de la…
L'analyse que tout le monde cite pour prouver que le harnais l'emporte sur le modèle attribue au harnais environ 5,3 % de la variation du succès et au modèle 0,7 % [s2] : un…
Le plus dur, quand on entraîne un agent de code, n'est plus de générer une solution, c'est d'en vérifier une, et ce simple déplacement casse en silence la recette de récompense…
Normalisez le budget de jetons de réflexion et l'avantage de raisonnement multi-saut que l'on prête à l'orchestration multi-agent cesse d'apparaître de façon fiable [s1]. Ce seul…
L'argument de vente d'un agent de revue de code, c'est qu'il lit chaque pull request à votre place. Une étude empirique portant sur 13 d'entre eux renverse cet argument : 60,2 %…
La faille de Claude Code Action a exigé deux conditions pour aboutir, une injection de prompt et un contrôle d'autorisation cassé, et la prochaine heure de revue doit aller sur…
Acheter un tableau de bord d'observabilité, ce n'est pas savoir que votre agent a raison, et c'est pourtant le troc que la plupart des équipes concluent en silence. Deux enquêtes…
Le rang d'un agent sur un classement de code est en partie une note de triche, et cette triche augmente avec la capacité au lieu de s'estomper à mesure que les modèles…
Un 92,5 au benchmark mémoire LoCoMo vous dit que votre agent sait retrouver un fait, et presque rien sur sa tendance à continuer de le servir avec pleine confiance une fois qu'il…
Quatre-vingt-quatorze pour cent des responsables jugent le code produit par IA de meilleure qualité que le code écrit par des humains au moment de la revue, et pourtant 82 %…
La prochaine version du modèle ne réparera pas votre agent de code, car les défaillances qui vous coûtent cher ne sont pas celles qu'un modèle plus puissant corrige. Ce sont des…
MCP a rendu triviale la connexion d'un agent à ses outils en faisant confiance aux descriptions d'outils du serveur, et ce choix par défaut a déplacé sans bruit la frontière de…
Un modèle de code quasi frontière sous licence MIT a tout l'air du signal qu'il faut faire basculer votre choix par défaut, et cette lecture est fausse : la licence vous rend les…
Quand un agent s'enlise au milieu d'une tâche longue, le réflexe est d'agrandir la fenêtre de contexte. C'est le mauvais levier : sur les tâches logicielles de longue haleine, la…
Réglez un LLM sur la température 0, relancez mille fois la même requête, et vous n'obtiendrez pas mille réponses identiques ; l'excuse habituelle veut que l'arithmétique…
Sélectionner un agent autonome multi-étapes sur son score pass@1, c'est optimiser le mauvais chiffre : capacité et fiabilité coïncident à l'horizon un mais divergent dès que…
On lit un score SWE-bench sur un classement et on le prend pour une propriété du modèle. Or, pour la comparaison qui guide vraiment un achat, choisir entre des modèles de codage…
La plupart des équipes budgètent leurs entraînements au dollar près et considèrent l'évaluation comme à peu près gratuite. Un seul balayage d'agents sur le Holistic Agent…
Le pass@1 en un coup et la maintenabilité itérative ne mesurent pas la même chose, et sur l'axe qui reflète le vrai travail logiciel, les meilleurs agents de code d'aujourd'hui…
Chaque convention dont j'ai hérité pariait sur un seul coût : éditer du code qu'un humain devait lire. Or un lecteur-machine et un auteur stochastique scindent désormais ce coût…
Si votre agent a choisi le mauvais outil, la formulation de vos descriptions d'outils n'y est presque pour rien. Dans une étude de 2026, la réparation par le prompt récupère au…
Le découpage AST, sensible à la structure du code, aide le RAG de code, mais le chiffre vedette de cAST surestime ce que la règle de découpage apporte à elle seule. cAST annonce…
Découper une tâche d'ingénierie en étapes vérifiables, et laisser l'agent échouer tôt plutôt que tard.
Combiner BM25 et vecteurs sans régler dix poids : le rang suffit.
Avant de publier, l’agent doit prouver ce qu’il avance, sources à l’appui.
GPTQ, AWQ, GGUF : ce que la quantification coûte vraiment, mesuré.
Un agent qui mène la tâche à bien mais corrompt l’état n’a rien réussi du tout.
vLLM, batching continu, cache KV : où part vraiment la VRAM.
Tous les chiffres publics de Kimi K3 décrivent une API louée, pas le fichier de poids attendu pour le 27 juillet. Artificial Analysis attribue au modèle un score de 57 sur son…
Vous activez le cache de prompt en attendant que la facture baisse et que la latence diminue, et la plupart du temps c'est ce qui se produit. Mais la première étude contrôlée…
La longueur de contexte affichée sur la fiche technique d'un modèle est un plafond marketing, pas un budget opérationnel ; je dimensionne donc un prompt pour ce que le modèle…
Une erreur est survenue. Réessayez.
L’assistant est temporairement indisponible. Retour prévu le {date}.
Une question sur Rachid ou sur ce site ? Demandez-moi.