Veille Radar
Ce qui vient de sortir en ingénierie de l’IA : specs, modèles, outils. Brèves datées, sourcées, avec schéma, code et impact pour une équipe.
33 brèves · du plus récent Cursor a lancé Cursor Router le 22 juillet 2026, un classifieur qui examine chaque requête avant qu'un modèle ne tourne et l'oriente vers le modèle le mieux adapté, entraîné sur plus de 600k requêtes réelles et optimisé sur la satisfaction utilisateur (AFC) comme récompense. Cursor annonce 60% d'économie sur son propre A/B test en ligne. Il nomme aussi une seconde métrique de qualité, le keep rate, sans en publier de chiffre.
Cursoragentscoding
Lire → NVIDIA a annoncé l'Open Secure AI Alliance le 27 juillet 2026 et cite parmi ses contributions ses travaux sur les cadres d'exécution d'agents. Ces travaux, c'est NOOA, un framework sous licence Apache 2.0 où une docstring tient lieu de prompt. Son article a été déposé sur arXiv le 22 juillet 2026 : il précède donc l'alliance de cinq jours.
NVIDIANOOAagentssecurity
Lire → Kodem Security et Intezer ont divulgué le 19 juillet 2026 une chaîne d'injection de prompt dans Kiro, l'IDE agentique d'AWS : une page web récupérée pousse l'agent à écrire le serveur d'un attaquant dans ~/.kiro/settings/mcp.json, que Kiro recharge et démarre. Selon la chronologie de Kodem, AWS a corrigé le 3 avril 2026 et Amazon a attribué CVE-2026-10591 le 22 juillet ; l'actualité, c'est donc la chaîne publiée et la leçon sur les écritures d'agent qui méritent un garde-fou.
KiroAWSMCPprompt injectionagent security
Lire → Relay-Bench a été déposé sur arXiv le 20-07-2026 : chaque item du jeu de test enchaîne de deux à treize sous-problèmes mono-domaine dans une seule invite, et le meilleur modèle, GPT-5.5 en effort xHigh, plafonne à 43,3 %.
Relay-BenchGPT-5.5evalsagents
Lire → Anthropic a publié Claude Opus 5 le 24 juillet 2026 à 5 $ par million de tokens en entrée et 25 $ par million en sortie, soit le tarif d'Opus 4.8. La décision de coût se joue désormais sur le réglage d'effort défini requête par requête, et le banc de revue de CodeRabbit montre que l'augmenter se paie en rappel et en tokens.
ClaudeClaude Opus 5Anthropicagentic codingeffort
Lire → Google a livré Gemini 3.6 Flash le 21 juillet 2026 à 7,50 $ par million de tokens de sortie, avec 17 % de tokens de sortie en moins par tâche que 3.5 Flash. Les deux leviers se cumulent : le coût réel par tâche baisse plus que le seul prix affiché.
GeminiGoogleagentsinference
Lire → Le 16 juillet 2026, Hugging Face a révélé qu'un framework d'agents autonomes avait compromis sa chaîne de traitement, et que les modèles hébergés ont refusé d'analyser le journal d'attaque. La forensique a tourné sur un GLM 5.2 auto-hébergé : la politique de refus devient une dépendance du runbook.
Hugging FaceGLM-5.2securityagents
Lire → Gemini 3.5 Flash Cyber a remonté 55 problèmes uniques confirmés sur le moteur V8, contre 47 pour sa version courante et 36 pour Claude Opus 4.6, avant d'être réservé aux gouvernements et partenaires de confiance via CodeMender. L'écart décisif est 55 contre 47: la barrière tient à la recette d'entraînement, pas aux poids.
GeminiCodeMendersecurityagentsevals
Lire → 21-07-2026 Évolution de spec
L'entrée de notes de version du 2026-07-15 documente les messages système en cours de conversation sur Claude Fable 5, Claude Mythos 5 et Claude Opus 4.8, sans en-tête bêta, tandis que la page Bedrock, consultée le 2026-07-21, annonce toujours Opus 4.8 uniquement : conditionnez la fonctionnalité à un drapeau de capacité, pas à une liste de modèles figée.
ClaudeAnthropic APIprompt-cachingagents
Lire → Le 15 juillet 2026, Thinking Machines Lab a publié Inkling sous Apache 2.0 : 975 milliards de paramètres, 41 milliards actifs, poids disponibles le jour même. Le laboratoire concède que le modèle n'est pas le meilleur du marché, et garde Tinker, la boucle d'affinage, pour lui.
Thinking MachinesInklingTinkeropen-weightagents
Lire → Le 9 juillet 2026, OpenAI a livré l'orchestration multi-agents en beta dans son API Responses, hébergeant l'arbre de sous-agents côté serveur derrière un seul champ. Le signal, c'est le frein : max_concurrent_subagents vaut 3 par défaut, un fan-out étroit là où la lignée Claude Code en pousse des centaines.
OpenAIGPT-5.6Responses APIagentsorchestration
Lire → Le 16-07-2026, Moonshot a lancé Kimi K3, un MoE à poids ouverts de 2 800 milliards de paramètres, mais seulement sur sa propre infrastructure hébergée ; les poids téléchargeables sont attendus le 27-07-2026, à un tarif de classe Sonnet 5.
Kimi K3Moonshotopen weightsagentscoding
Lire → La CISA a inscrit CVE-2026-55255 au KEV le 7 juillet 2026 : un IDOR entre locataires dans Langflow, exploité depuis le 25 juin pour extraire les clés LLM et cloud embarquées dans les flows des autres. La même faille est notée 9.9 par l'éditeur, 8.4 par le NVD et 6.1 par The Hacker News, donc tout seuil CVSS l'aurait laissée passer.
LangflowCISA KEVagentssecurity
Lire → Le 08-07-2026, Cognition publie SWE-1.7 : code agentique proche de la frontière, gains venus d'une seconde passe de RL sur une base Kimi K2.7, et qui ne tourne que dans Devin.
CognitionDevinSWE-1.7agentscoding
Lire → En semaine 28 (du 6 au 10 juillet 2026), Claude Code sur ordinateur a reçu un navigateur intégré, doté d'un profil isolé et vierge sans aucune connexion enregistrée. Le vrai changement, c'est la séparation : vous disposez désormais de deux surfaces de navigation, et vous choisissez selon que l'agent doit voir votre identité authentifiée ou non.
ClaudeClaude Codeagentsbrowser-use
Lire → Le 2026-07-09, Meta a lancé Muse Spark 1.1 et ouvert la Meta Model API en préversion publique, son premier modèle payant et fermé. Le vrai changement, c'est le revirement : le laboratoire dont les poids ouverts ont banalisé la couche des modèles de base facture désormais au token.
Muse SparkMetaMCPagentscoding
Lire → Le 2026-06-30, DeepSeek a prévenu les abonnés de son API que la V4 passera à une tarification heures pleines / heures creuses lors de la disponibilité générale de la mi-juillet : les appels dans deux créneaux quotidiens (heure de Pékin) sont facturés au double. Le vrai changement, c'est que l'heure de la journée devient une dimension de routage que votre passerelle doit intégrer.
DeepSeekDeepSeek-V4inferencepricingrouting
Lire → xAI a livré Grok 4.5 le 2026-07-08 pour le code et l'agentique, à 2 et 6 dollars par million de tokens. Sur ses quatre benchmarks auto-déclarés, le partage avec Opus 4.8 est de 2 à 2 et Fable 5 devance partout, donc c'est un pari prix-performance, pas une victoire de frontière, et il n'est pas encore disponible dans l'UE.
GrokxAICursorcodingagents
Lire → OpenAI a ouvert le 2026-06-26 une préversion limitée de GPT-5.6 sur trois paliers, Sol, Terra et Luna. La vraie nouvelle technique : les écritures de cache coûtent désormais 1,25x l'entrée non mise en cache.
GPT-5.6OpenAICodexinference
Lire → Anthropic a lancé Claude Science le 2026-06-30, un atelier d'IA en bêta pour les scientifiques, sur macOS et Linux et réservé aux formules payantes. Ce n'est pas un nouveau modèle : il s'appuie sur les mêmes modèles Claude, dont Opus 4.8. L'idée transférable : un coordinateur qui crée des sous-agents et un agent réviseur distinct qui signale chaque nombre qu'il ne peut tracer, avec une provenance fournie par défaut.
ClaudeAnthropicagentsNVIDIA
Lire → Le 2026-06-22, Google a fait passer son API Interactions en disponibilité générale et en a fait la voie principale, par défaut, pour construire sur les modèles et les agents Gemini ; l'API generateContent reste prise en charge, mais les nouvelles capacités agentiques devraient atterrir exclusivement sur l'API Interactions.
GeminiGoogleagentsAPI
Lire → GitHub a rendu Kimi K2.7 Code généralement disponible dans Copilot le 2026-07-01 : premier modèle à poids ouverts du sélecteur, hébergé sur Azure et facturé à l'usage, et les mêmes poids que vous pouvez auto-héberger sous une Modified MIT License.
KimiGitHub CopilotMoonshotopen-weightcoding
Lire → Anthropic a livré Claude Sonnet 5 le 2026-06-30, disponible dès le premier jour à un tarif d'introduction de 2 $/10 $ par million de tokens jusqu'au 2026-08-31, à six points d'Opus 4.8 sur le codage agentique et à un prix inférieur à Opus 4.8, GPT-5.5 et Gemini 3.1 Pro.
ClaudeAnthropicagentsinference
Lire → Les Hosted Agents de Microsoft Foundry forment un runtime managé et agnostique du framework pour votre propre code d'agent, appelable dès aujourd'hui en preview publique sur 20 régions Azure, GA visée pour fin juin 2026, pas encore livrée.
Microsoft FoundryAzureagentsdeployment
Lire → Le 23-06-2026, Volcengine (ByteDance) a publié Doubao Seed 2.1, un modèle agent propriétaire en tête de GDPval et appelable dès aujourd'hui sur Ark, quand l'essentiel de la frontière reste en accès restreint.
DoubaoByteDanceMCPagentsevals
Lire → Le 24-06-2026, l'équipe Qwen a publié Qwen-AgentWorld, un modèle de monde langagier sous Apache-2.0 qui ne joue pas l'agent mais prédit la prochaine observation de l'environnement sur sept domaines, livré avec l'évaluation AgentWorldBench.
QwenvLLMMCPagentsevals
Lire → Le 23-06-2026, Anthropic a lancé Claude Tag, un Claude permanent qui rejoint un espace Slack comme une identité d'équipe partagée, et non comme un chatbot par utilisateur.
ClaudeAnthropicSlackagents
Lire → Le 2026-06-10, Google DeepMind a publié DiffusionGemma 26B-A4B, un MoE à poids ouverts (25,2 G au total / 3,8 G actifs) bâti sur le squelette Gemma 4, qui troque le décodage autoregressif contre une diffusion de texte discrète : il débruite en parallèle un canevas de 256 tokens à plus de 1000 tokens/s sur un seul H100. La vitesse se paie en qualité : 77,6 % sur MMLU Pro contre 82,6 % pour Gemma 4. Le tout sous licence Apache 2.0.
open-weightllm-releasetext-diffusioninferencelong-context
Lire → Spec Kit, la boîte à outils MIT de GitHub pour le développement piloté par spécification, est arrivée en v0.11.3 avec des commandes désormais préfixées /speckit.* et plus de 30 agents pris en charge.
agentsosstooling
Lire → Z.ai a livre GLM-5.2, un modele de codage Mixture-of-Experts de 753B avec un contexte d'1M de tokens et des poids ouverts sous MIT, associant l'attention parcimonieuse IndexShare a une couche MTP amelioree pour le decodage speculatif.
ossinferencelong-contextagentsevaluation
Lire → MiniMax a publié M3 le 1er juin 2026 : un MoE en poids ouverts (~428 Md / ~23 Md actifs) qui associe un contexte d'un million de tokens à une entrée native texte, image et vidéo et un nouvel opérateur d'attention creuse (MSA), avec 59,0 % sur SWE-Bench Pro.
open-weightllm-releaselong-contextmultimodalsparse-attention
Lire → 22-06-2026 Évolution de spec
La revision MCP 2026-07-28, en release candidate depuis le 21 mai 2026, supprime les sessions et le handshake initialize et deplace tout l'etat protocolaire dans _meta a chaque requete.
mcpagentsspec-changetransportoss
Lire → Deux outils open source indépendants - RTK comprime les sorties de commandes qui entrent dans le contexte, Caveman comprime les réponses du modèle qui en sortent.
agentsagentic-codingossinference
Lire →