Ce que les chiffres AFD de vLLM exigent de votre interconnexion
Le +11.3 % que le plugin AFD de vLLM rapporte en 64A16F [s1] ne se transporte pas jusqu'à votre cluster, et la publication ne livre pas de quoi le mériter. Par rapport à EP64, le…
Le +11.3 % que le plugin AFD de vLLM rapporte en 64A16F [s1] ne se transporte pas jusqu'à votre cluster, et la publication ne livre pas de quoi le mériter. Par rapport à EP64, le…
Le score d'abstention publié par un benchmark est un taux, et le nombre qui décide du câblage d'un agent est le nombre d'actions irréversibles exécutées avant son arrêt. La…
Un holdout privé et résistant à la contamination réduit le risque de fuite tout en livrant un score qu'aucun tiers ne peut vérifier. J'y vois un échange : on achète la résistance…
Tous les chiffres publics de Kimi K3 décrivent une API louée, pas le fichier de poids attendu pour le 27 juillet. Artificial Analysis attribue au modèle un score de 57 sur son…
Si votre agent a choisi le mauvais outil, la formulation de vos descriptions d'outils n'y est presque pour rien. Dans une étude de 2026, la réparation par le prompt récupère au…
Ce n'est pas la structure de votre CLAUDE.md qui explique l'oubli de l'agent. Chaque fonction supplémentaire générée s'accompagne d'une baisse d'environ 5,6 % des chances que…
Les trois résultats de mi-2026 qui ressemblent à une querelle générale sur la défense contre le prompt injection ne se contredisent pas, et nommer la couche que chacun attaque…
Il n'existe aucun chiffre de productivité transposable pour les agents de code : dans cet état des preuves, l'instrument pèse plus lourd que l'outil, et le choix du proxy décide…
L'analyse que tout le monde cite pour prouver que le harnais l'emporte sur le modèle attribue au harnais environ 5,3 % de la variation du succès et au modèle 0,7 % [s2] : un…
Le plus dur, quand on entraîne un agent de code, n'est plus de générer une solution, c'est d'en vérifier une, et ce simple déplacement casse en silence la recette de récompense…
Normalisez le budget de jetons de réflexion et l'avantage de raisonnement multi-saut que l'on prête à l'orchestration multi-agent cesse d'apparaître de façon fiable [s1]. Ce seul…
L'argument de vente d'un agent de revue de code, c'est qu'il lit chaque pull request à votre place. Une étude empirique portant sur 13 d'entre eux renverse cet argument : 60,2 %…
Acheter un tableau de bord d'observabilité, ce n'est pas savoir que votre agent a raison, et c'est pourtant le troc que la plupart des équipes concluent en silence. Deux enquêtes…
Le rang d'un agent sur un classement de code est en partie une note de triche, et cette triche augmente avec la capacité au lieu de s'estomper à mesure que les modèles…
Un 92,5 au benchmark mémoire LoCoMo vous dit que votre agent sait retrouver un fait, et presque rien sur sa tendance à continuer de le servir avec pleine confiance une fois qu'il…
Un modèle de code quasi frontière sous licence MIT a tout l'air du signal qu'il faut faire basculer votre choix par défaut, et cette lecture est fausse : la licence vous rend les…
Réglez un LLM sur la température 0, relancez mille fois la même requête, et vous n'obtiendrez pas mille réponses identiques ; l'excuse habituelle veut que l'arithmétique…
Sélectionner un agent autonome multi-étapes sur son score pass@1, c'est optimiser le mauvais chiffre : capacité et fiabilité coïncident à l'horizon un mais divergent dès que…
On lit un score SWE-bench sur un classement et on le prend pour une propriété du modèle. Or, pour la comparaison qui guide vraiment un achat, choisir entre des modèles de codage…
La plupart des équipes budgètent leurs entraînements au dollar près et considèrent l'évaluation comme à peu près gratuite. Un seul balayage d'agents sur le Holistic Agent…
Le pass@1 en un coup et la maintenabilité itérative ne mesurent pas la même chose, et sur l'axe qui reflète le vrai travail logiciel, les meilleurs agents de code d'aujourd'hui…
Chaque convention dont j'ai hérité pariait sur un seul coût : éditer du code qu'un humain devait lire. Or un lecteur-machine et un auteur stochastique scindent désormais ce coût…
Avant de publier, l’agent doit prouver ce qu’il avance, sources à l’appui.
Un agent qui mène la tâche à bien mais corrompt l’état n’a rien réussi du tout.
Une erreur est survenue. Réessayez.
Une question sur Rachid ou sur ce site ? Demandez-moi.