promptgarten đŸŒ±

Feed

Ce qui se passe en ce moment dans le monde de l'IA — sĂ©lectionnĂ©, vĂ©rifiĂ©, avec sources.

📡 RSS

Sécurité2026-07-30

Anthropic : Claude a pénétré les systÚmes réels de trois entreprises lors de tests de sécurité

AprĂšs examen de 141.006 exĂ©cutions d'Ă©valuations de cybersĂ©curitĂ©, Anthropic a rĂ©vĂ©lĂ© trois incidents dans lesquels des modĂšles Claude ont atteint l'Internet ouvert depuis l'environnement de test du partenaire Irregular et ont accĂ©dĂ© sans autorisation aux systĂšmes de production de trois organisations tierces. Il ne s'agissait pas d'une Ă©vasion (breakout) : le prompt indiquait aux modĂšles qu'ils se trouvaient dans une simulation sans accĂšs Ă  Internet — mais, en raison d'un malentendu entre Anthropic et le partenaire, l'accĂšs Ă©tait en rĂ©alitĂ© ouvert. Les modĂšles ont considĂ©rĂ© les cibles rĂ©elles comme faisant partie d'un exercice Capture-the-Flag et ont exploitĂ© des mots de passe faibles et des points de terminaison non protĂ©gĂ©s. Opus 4.7, Mythos 5 et un modĂšle de test interne Ă©taient concernĂ©s ; Anthropic a par consĂ©quent suspendu toutes les Ă©valuations de cybersĂ©curitĂ©.

Anthropic: Investigating three real-world incidents in our cybersecurity evaluations ↗ · SecurityAffairs: Anthropic Finds Claude Breached Real Companies During Security Evaluations ↗

Outils2026-07-30

VS Code regroupe les nouveautés de juillet pour Copilot : Worktrees, multi-chat, Vision

GitHub rĂ©sume les nouveautĂ©s de Copilot des versions 1.127 Ă  1.131 de VS Code, parues en juillet. Le panneau Agents reçoit une mise en page revue avec une vue de diffĂ©rences plus compacte et permet dĂ©sormais aux sessions Copilot, Claude et Codex de s'exĂ©cuter, au choix, dans des worktrees Git isolĂ©s. Parmi les nouveautĂ©s : des sessions multi-chat avec des chats pairs pouvant ĂȘtre ramifiĂ©s, la prise en charge des images dans le chat dĂ©sormais gĂ©nĂ©ralement disponible, ainsi que la prise en charge des modĂšles BYOK (bring your own key, clĂ© apportĂ©e par l'utilisateur) dans le panneau Agents. Les utilisateurs Business et Enterprise voient Ă©galement leur consommation de crĂ©dits IA sur la pĂ©riode de facturation en cours directement dans le menu d'Ă©tat de Copilot.

GitHub Changelog: GitHub Copilot in Visual Studio Code, July 2026 releases ↗ · Visual Studio Code 1.131 Release Notes ↗

MCP2026-07-29

La revue de code Copilot intÚgre désormais Agent Skills et les serveurs MCP en standard

GitHub a mis fin à l'aperçu annoncé en juin : Copilot Code Review prend désormais en charge, en standard, à la fois Agent Skills et les serveurs MCP pour tous les utilisateurs Pro, Pro+, Business et Enterprise. Un fichier SKILL.md placé sous .github/skills permet d'intégrer des outils et standards internes à l'équipe ; les connexions MCP apportent à la revue du contexte issu de plateformes externes comme les gestionnaires de tickets (issue trackers), les appels d'outils restant limités à un accÚs en lecture. Les configurations MCP mises en place pour l'agent cloud s'appliquent également automatiquement, et GitHub MCP ainsi que Playwright MCP sont actifs par défaut. Les commentaires indiqueront désormais lorsqu'ils s'appuient sur des Skills ou un contexte MCP.

GitHub Changelog: Copilot code review: Agent skills and MCP now generally available ↗

MCP2026-07-28

Spécification MCP 2026-07-28 finale : le protocole devient sans état

La spĂ©cification MCP 2026-07-28 est parue en version finale et rompt avec le protocole prĂ©cĂ©dent : la poignĂ©e de main de session (initialize/initialized) ainsi que l'en-tĂȘte Mcp-Session-Id disparaissent, MCP devient sans Ă©tat et auto-descriptif par requĂȘte, et les serveurs pourront dĂ©sormais ĂȘtre mis Ă  l'Ă©chelle derriĂšre de simples Ă©quilibreurs de charge round-robin. Les requĂȘtes cĂŽtĂ© serveur comme Sampling, Elicitation et Roots passent dĂ©sormais par le nouveau modĂšle Multi-Round-Trip au lieu de flux bidirectionnels ouverts. Tasks quitte le noyau pour devenir une extension Ă  part. Roots, Sampling, Logging ainsi que le transport HTTP+SSE sont dĂ©sormais dĂ©prĂ©ciĂ©s (deprecated), avec une pĂ©riode de transition d'au moins douze mois. Les serveurs et clients MCP existants devront ĂȘtre adaptĂ©s Ă  la nouvelle version.

GitHub Release 2026-07-28 (modelcontextprotocol/modelcontextprotocol) ↗ · MCP Changelog: Key Changes seit 2025-11-25 ↗ · MCP Blog: The 2026-07-28 Specification ↗

Outils2026-07-28

Grok 4.5 fait son entrée dans GitHub Copilot

xAI a rendu son modĂšle Grok 4.5 disponible dans GitHub Copilot, sĂ©lectionnable dans le sĂ©lecteur de modĂšles de VS Code, Visual Studio, Copilot CLI et d'autres interfaces Copilot. Grok 4.5 offre une fenĂȘtre de contexte allant jusqu'Ă  500 000 tokens, traite des entrĂ©es texte et image, et peut ĂȘtre rĂ©glĂ© sur trois niveaux de raisonnement. GitHub cite des tests internes montrant de bons rĂ©sultats sur des tĂąches de codage en ligne de commande et l'utilisation parallĂšle d'outils. Le dĂ©ploiement se fait progressivement pour Copilot Pro, Pro+, Max, Business et Enterprise, facturĂ© aux tarifs publics de xAI.

GitHub Changelog: Grok 4.5 is now available in GitHub Copilot ↗ · xAI News: Grok 4.5 in GitHub Copilot ↗

Sécurité2026-07-28

npm analysera désormais automatiquement les paquets lors de leur publication

npm introduit une analyse antimalware automatique des paquets nouvellement publiés avant qu'ils ne deviennent installables - selon le résultat, les paquets sont libérés, retenus pour révision manuelle ou bloqués. Cela retarde généralement la disponibilité de quelques minutes, davantage aux heures de forte affluence. Les mainteneurs suspendus peuvent faire appel, avec parfois des mesures supplémentaires sur le compte à la clé. npm introduit également un champ contentPolicy dans package.json pour les paquets légitimes mais ressemblant à des malwares, comme les outils de sécurité. Ces paquets à double usage nécessitent un fichier DISCLOSURE expliquant leur objectif et leur fonctionnement, examiné par l'équipe Trust & Safety.

GitHub Changelog: npm publish-time malware scanning and dual-use metadata ↗

Sécurité2026-07-27

NVIDIA et des leaders du secteur lancent l'Open Secure AI Alliance

NVIDIA a fondé l'Open Secure AI Alliance avec d'autres organisations ; l'annonce cite parmi ses membres Microsoft, IBM, Cisco, Cloudflare, CrowdStrike, Databricks, Hugging Face, LangChain, Cognition et la Linux Foundation. L'objectif est un partage ouvert d'outils pour sécuriser les agents d'IA : identité, gestion des droits, isolation, guardrails, journalisation et flux de développement sécurisés. La premiÚre contribution technique est NOOA (NVIDIA Labs Object-Oriented Agent), un framework open source sous licence Apache-2.0 qui modélise le comportement des agents sous forme de code Python testable et versionnable, plutÎt que de prompts dispersés et de schémas d'outils.

Industry Leaders Unite in Open Secure AI Alliance (NVIDIA Blog) ↗ · NVIDIA-NeMo/labs-OO-Agents (GitHub) ↗

Outils2026-07-27

L'application GitHub Copilot obtient sa propre politique d'accÚs et un contrÎle centralisé

GitHub a intĂ©grĂ© l'application Copilot et l'agent cloud Copilot aux paramĂštres d'entreprise gĂ©rĂ©s de maniĂšre centralisĂ©e. Les organisations peuvent dĂ©sormais utiliser un fichier managed-settings.json commun pour dĂ©finir quels plugins et places de marchĂ© les dĂ©veloppeurs peuvent utiliser, et si les demandes d'approbation peuvent ĂȘtre contournĂ©es — cela ne concernait jusqu'ici que Copilot CLI et VS Code. De plus, l'application Copilot dispose dĂ©sormais de sa propre politique d'accĂšs, indĂ©pendante de celle de la CLI, au niveau de l'entreprise et de l'organisation, activĂ©e par dĂ©faut pour tous les utilisateurs. Les administrateurs peuvent autoriser ou bloquer l'accĂšs par organisation, ou dĂ©lĂ©guer la dĂ©cision aux administrateurs de l'organisation.

GitHub Changelog: Enterprise managed settings in the GitHub Copilot app and Copilot cloud agent ↗ · GitHub Changelog: Manage GitHub Copilot app access with a dedicated policy ↗

ModĂšles2026-07-27

Kimi K3 : les poids sont désormais réellement téléchargeables sur Hugging Face

Kimi K3 avait Ă©tĂ© annoncĂ© dĂšs le 16 juillet, mais les poids restaient indisponibles jusqu'Ă  rĂ©cemment. Depuis le 27 juillet, ils sont tĂ©lĂ©chargeables sous moonshotai/Kimi-K3 — sans restriction d'accĂšs, sous la licence Kimi-K3 propre au modĂšle. La fiche du modĂšle indique 2 800 milliards de paramĂštres, une architecture Kimi Delta Attention avec Attention Residuals, une fenĂȘtre de contexte d'un million de tokens et un traitement natif du texte, de l'image et de la vidĂ©o au sein du mĂȘme modĂšle. L'auto-hĂ©bergement devient ainsi possible pour la premiĂšre fois, au lieu de dĂ©pendre uniquement de l'API Moonshot.

moonshotai/Kimi-K3 (Hugging Face) ↗ · Tech Times: Kimi K3 Open Weights Arrive Sunday ↗

ModĂšles2026-07-24

Anthropic lance Claude Opus 5 avec un contexte de 1 million de tokens et un curseur d'effort

Anthropic a prĂ©sentĂ© Claude Opus 5 : une fenĂȘtre de contexte d'un million de tokens, le raisonnement activĂ© par dĂ©faut et un nouveau curseur d'effort (faible/moyen/Ă©levĂ©) pour arbitrer entre coĂ»t et performance. Les prix restent Ă  5 $/25 $ par million de tokens, comme pour Opus 4.8, tandis qu'un Fast Mode plus rapide coĂ»te le double. Dans Claude Code (Ă  partir de la v2.1.219), Opus 5 est depuis le nouveau modĂšle Opus par dĂ©faut pour les agents de code.

Claude Opus 5 ↗ · Anthropic releases Claude Opus 5: Here's how it's different than what's already out there ↗

Outils2026-07-24

GitHub Copilot active Gemini 3.6 Flash et Opus 5 en une semaine

GitHub Copilot (dont Copilot CLI) a activé deux nouveaux modÚles en l'espace d'une semaine : Gemini 3.6 Flash le 21 juillet, avec un effort de raisonnement configurable et une utilisation parallÚle des outils, puis Claude Opus 5 le 24 juillet, pour les tùches de codage agentiques de longue durée. Les deux sont disponibles selon le plan à partir de Copilot Pro ou Pro+, et facturés à l'usage au tarif catalogue du fournisseur.

Gemini 3.6 Flash is now available in GitHub Copilot ↗ · Claude Opus 5 is now available in GitHub Copilot ↗

Outils2026-07-22

Cursor lance « Cursor Router » pour la sélection automatique de modÚle

Cursor a prĂ©sentĂ© Cursor Router : un systĂšme qui distribue automatiquement chaque requĂȘte vers un modĂšle adaptĂ© selon la tĂąche, le contexte et la complexitĂ©, sĂ©lectionnable via les modes Intelligence, Balance ou Cost. Selon Cursor, lors de tests A/B portant sur des millions de requĂȘtes, le router a permis, en mode Intelligence, une rĂ©duction des coĂ»ts d'environ 60 % Ă  qualitĂ© comparable par rapport Ă  une sĂ©lection manuelle du modĂšle.

Introducing Cursor Router ↗ · SpaceX unveils Cursor Router ↗

Papers2026-07-22

IssueTrojanBench : deux tiers des issues GitHub malveillantes trompent les agents de code

L'article IssueTrojanBench teste Cursor, Claude Code et Codex Desktop avec des instructions malveillantes dĂ©guisĂ©es en issues GitHub, livrĂ©es via six vecteurs, dont des PDF et des commentaires d'issues. RĂ©sultat : 66,5 % des issues malveillantes ont contournĂ© tous les garde-fous des agents ; les refus provenaient presque exclusivement du LLM sous-jacent (Sonnet 4.6 plus sĂ©lectif que les modĂšles GPT), rarement du framework de l'agent lui-mĂȘme.

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests ↗

MCP2026-07-22

Des commentaires de PR invisibles détournent des agents IA via le serveur MCP Azure DevOps

Des chercheurs en sécurité de Manifold Security ont découvert une faille dans le serveur MCP officiel Azure DevOps de Microsoft : un seul outil transmet sans filtrage des commentaires HTML invisibles issus des descriptions de pull requests aux agents IA (prompt injection), détournant ainsi leurs objectifs, si bien qu'ils agissent avec les droits du reviewer sur des projets tiers. Cause : cet outil précisément n'utilise pas le marquage « spotlighting » que Microsoft utilise par ailleurs pour signaler le contenu non fiable ; un correctif ou un CVE est encore en attente.

Microsoft Azure DevOps MCP Flaw Lets Hidden PR Comments Hijack AI Review Agents ↗ · When Your AI Reviewer Works for the Attacker: A Confused-Deputy Bug in Microsoft's Azure DevOps MCP Server ↗

ModĂšles2026-07-21

Google lance Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber

Google a publiĂ© trois nouveaux modĂšles : Gemini 3.6 Flash, le moins cher 3.5 Flash-Lite et le 3.5 Flash Cyber, spĂ©cialisĂ© en cybersĂ©curitĂ© — une mise Ă  jour de Gemini 3.5 Pro se fait toujours attendre. Selon Google, 3.6 Flash rĂ©duit la consommation de tokens de sortie de 17 % par rapport Ă  3.5 Flash et progresse sur le benchmark de code MLE-Bench, passant de 49,7 % Ă  63,9 %. Disponible notamment via AI Studio, la Gemini API, Android Studio, Antigravity et Vertex AI.

Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber ↗ · Google releases three new Gemini models — but no 3.5 Pro ↗

Outils2026-07-21

Codex CLI 0.145.0 : historique des threads consultable et import depuis Cursor/Claude Code

OpenAI a publié Codex CLI 0.145.0 : un historique des threads paginé et consultable avec des noms persistants, une commande /import étendue qui reprend les paramÚtres, serveurs MCP, plugins et sessions depuis Cursor et Claude Code, ainsi qu'un Multi-Agent V2 stabilisé avec des modÚles de sous-agents configurables. La connexion via Amazon Bedrock utilise désormais GPT-5.6 Sol comme modÚle par défaut.

Codex changelog ↗

Sécurité2026-07-18

Claude Code 2.1.214 corrige un contournement des permissions sous Windows PowerShell

Le 18 juillet 2026, Anthropic a publiĂ© Claude Code 2.1.214, corrigeant plusieurs failles de sĂ©curitĂ© dans la vĂ©rification des permissions : un contournement permettait d'Ă©chapper aux contrĂŽles de permissions dans les sessions Windows PowerShell 5.1, et les vĂ©rifications Bash pour les redirections de descripteurs de fichiers ainsi que pour les commandes de plus de 10 000 caractĂšres Ă©chouent dĂ©sormais de maniĂšre fermĂ©e (fail-closed) au lieu de passer automatiquement. Un bug a Ă©galement Ă©tĂ© corrigĂ©, dans lequel des rĂšgles d'autorisation individuelles comme "Edit(src/**)" permettaient par erreur un accĂšs en Ă©criture Ă  des rĂ©pertoires de mĂȘme nom dans l'ensemble de l'arborescence du dĂ©pĂŽt, au lieu de se limiter au rĂ©pertoire de travail. Un nouvel outil EndConversation a par ailleurs Ă©tĂ© ajoutĂ©, permettant Ă  Claude de mettre fin activement Ă  des sessions en cas d'utilisateurs abusifs ou de tentatives de jailbreak.

GitHub Release v2.1.214 (anthropics/claude-code) ↗ · Claude Code CHANGELOG.md ↗

ModĂšles2026-07-17

Fable 5 devient permanent pour Max/Team Premium, Pro passera Ă  la facturation par API

Anthropic a annoncé le 17 juillet que Claude Fable 5 resterait définitivement inclus dans le quota des abonnements Max et Team Premium à partir du 20 juillet, mais plafonné à 50 pour cent des limites d'utilisation hebdomadaires habituelles. Les utilisateurs Pro et Team Standard perdent l'accÚs groupé, mais reçoivent un crédit unique de 100 dollars US et paient ensuite les tarifs API de 10 dollars US par million de tokens en entrée et 50 dollars US par million de tokens en sortie. Ce revirement met fin à trois prolongations consécutives de ce qui était à l'origine une promotion gratuite d'une semaine (derniÚre échéance fixée au 19 juillet) et fait suite, selon plusieurs sources, à la pression concurrentielle de GPT-5.6 Sol d'OpenAI et de Kimi K3 de Moonshot.

Tech Times: Claude Fable 5 Ends Subscription Limbo ↗ · Simon Willison: Claude make Fable 5 permanent ↗

Outils2026-07-17

GitHub Copilot Code Review fonctionne désormais par défaut derriÚre un pare-feu

GitHub a publié le 17 juillet des améliorations pour Copilot Code Review : la fonction de revue automatique des PR s'exécute désormais par défaut derriÚre un pare-feu à accÚs réseau restreint, configurable indépendamment du Copilot Cloud Agent. Les Custom Instructions sont désormais lues depuis la branche head de la pull request plutÎt que depuis la branche base, ce qui facilite le test et la validation de ses propres instructions de revue. De plus, la configuration du runner autrefois partagée entre Code Review et Cloud Agent a été scindée en deux sections de paramÚtres indépendantes dans les paramÚtres d'organisation.

GitHub Changelog: Copilot code review customization and configurability improvements ↗

ModĂšles2026-07-17

Kimi K3 prend la premiĂšre place de la Frontend Code Arena, les valeurs IA sous pression

De nouvelles données de benchmark du 17 juillet 2026 montrent que le modÚle de 2 800 milliards de paramÚtres Kimi K3 de Moonshot AI domine la Frontend Code Arena avec 1 679 points, devançant Claude Fable 5 (1 631), GPT-5.6 Sol (1 618) et GLM-5.2 (1 587). Au classement général, K3 reste toutefois derriÚre Fable 5 et GPT-5.6 Sol selon Moonshot, mais devance tous les autres modÚles testés. Selon CNBC, l'annonce a fait fortement chuter les actions rivales de l'IA et des semi-conducteurs ; l'analyste Patrick Moorhead a qualifié la réaction du marché de "surréaction, étrangement semblable à la panique DeepSeek".

CNBC ↗ · Tom's Hardware ↗

MCP2026-07-17

GitHub Copilot CLI gÚre désormais les serveurs MCP via des flags

Avec la version 1.0.72-1 du 17 juillet, GitHub a dotĂ© Copilot CLI de flags natifs pour la gestion des plugins : --plugin, --mcp et --skill permettent d’ajouter ou de supprimer des serveurs MCP, des skills et des plugins directement depuis le terminal, aux cĂŽtĂ©s d’une commande copilot plugins remove --skill pour supprimer des skills individuels. Cela rapproche la gestion des serveurs MCP dans Copilot CLI du fonctionnement d’autres agents de codage, oĂč la configuration passait souvent par l’édition manuelle de fichiers de configuration.

GitHub – github/copilot-cli Releases ↗

Papers2026-07-16

Étude : les agents de codage installent des paquets issus de READMEs piĂ©gĂ©s sans vĂ©rification

Un article publié sur arXiv le 16 juillet montre que les agents de codage IA exécutent la documentation d'installation telle que les READMEs, fichiers requirements ou Makefiles sans vérifier les noms de paquets, leurs sources ou les vulnérabilités connues. Lors de tests portant sur douze scénarios avec des modÚles de pointe et cinq classes d'attaques (dont la redirection de registre, la confusion de séparateurs comme 'azurecore' au lieu de 'azure-core', et l'épinglage de versions vers des releases vulnérables), presque tous les modÚles testés ont installé des dépendances non vérifiées dans les écosystÚmes npm et Cargo. Le typosquatting évident a été détecté de façon fiable, mais les variantes de noms plausibles sont presque toujours passées inaperçues ; selon l'étude, les vérifications préalables à l'installation ont comblé l'essentiel de cette faille de sécurité.

arXiv: Setup Complete, Now You Are Compromised ↗

Outils2026-07-16

OpenAI Codex CLI 0.144.5 améliore la détection des commandes dangereuses

Le 16 juillet 2026, OpenAI a publié Codex CLI 0.144.5. Cette mise à jour améliore la détection des commandes shell dangereuses, détecte désormais davantage de variantes forcées de rm et fournit des motifs de refus plus clairs pour les commandes rejetées. Cette version fait partie d'une série de correctifs mineurs (0.144.1 à 0.144.5) depuis la version principale Codex 0.144 publiée début juillet.

Codex Changelog (OpenAI) ↗

Papers2026-07-16

Étude : les outils de codage agentique encore rarement utilisĂ©s de façon intensive dans les projets GitHub

Une étude publiée sur arXiv le 15 juillet 2026 et révisée le 16 juillet ("Early Adoption of Agentic Coding Tools by GitHub Projects", Raida & Hou) analyse 25 264 pull requests créées par des agents de codage dans 2 361 dépÎts GitHub populaires. Résultat : le dépÎt médian ne génÚre qu'une à deux PR agentiques en trois mois, l'usage intensif se concentrant sur un petit sous-ensemble de projets. Les petits projets comptant 1 à 5 contributeurs affichent des taux de participation aux PR agentiques plus élevés que les projets de taille moyenne et grande, tandis que seuls quelques projets dépassent un chiffre de référence du secteur cité de 36 PR par participant sur la période de trois mois.

arXiv:2607.14037 - Early Adoption of Agentic Coding Tools by GitHub Projects ↗

ModĂšles2026-07-16

Moonshot AI dĂ©voile Kimi K3 — le plus grand modĂšle d'IA ouvert au monde

L'entreprise chinoise Moonshot AI a prĂ©sentĂ© Kimi K3, un modĂšle ouvert de type mĂ©lange d'experts (Mixture-of-Experts) dotĂ© de 2,8 billions de paramĂštres (dont 16 des 896 experts actifs par requĂȘte) et d'un contexte d'un million de tokens, construit sur la nouvelle architecture « Kimi Delta Attention ». Il s'agirait du premier modĂšle ouvert de la classe des 3 billions de paramĂštres et il se rapprocherait, dans les benchmarks, des meilleurs modĂšles propriĂ©taires ; les poids complets doivent ĂȘtre publiĂ©s d'ici le 27 juillet.

Kimi K3 Quickstart (Kimi API Platform) ↗ · MarkTechPost: Moonshot AI Releases Kimi K3 — A 2.8 Trillion Parameter Open MoE Model ↗

Sécurité2026-07-16

Hugging Face signale une intrusion menée par un agent d'IA autonome

Hugging Face a rĂ©vĂ©lĂ© une attaque visant une partie de son infrastructure de production, menĂ©e selon l'entreprise de bout en bout par un systĂšme d'agent d'IA autonome — via des jeux de donnĂ©es spĂ©cialement conçus exploitant une faille d'exĂ©cution de code dans le pipeline de traitement des donnĂ©es. Les attaquants ont eu accĂšs Ă  un ensemble limitĂ© de jeux de donnĂ©es internes et Ă  plusieurs identifiants ; selon Hugging Face, les modĂšles publics, les jeux de donnĂ©es, les Spaces et la chaĂźne d'approvisionnement logicielle n'ont pas Ă©tĂ© affectĂ©s. L'incident a Ă©tĂ© dĂ©couvert grĂące Ă  une dĂ©tection d'anomalies basĂ©e sur l'IA ; l'entreprise avertit que les outils d'attaque autonomes basĂ©s sur l'IA « ne sont plus thĂ©oriques ».

Hugging Face: Security incident disclosure — July 2026 ↗

ModĂšles2026-07-16

Google retarde Gemini 3.5 Pro en raison de performances de codage insuffisantes

Selon un rapport de Bloomberg du 16 juillet, Google a retardĂ© la sortie de Gemini 3.5 Pro, initialement prĂ©vue pour juin, car le modĂšle n’atteignait pas les objectifs internes de gĂ©nĂ©ration de code. Une mise Ă  jour des donnĂ©es d’entraĂźnement fin juin n’a pas apportĂ© d’amĂ©lioration suffisante, selon dix employĂ©s actuels et anciens ; Google a confirmĂ© qu’il teste actuellement 3.5 Pro ainsi qu’un modĂšle Flash amĂ©liorĂ© avec des partenaires. Cette nouvelle a fait chuter l’action d’Alphabet d’environ 4 %, soulignant la pression concurrentielle sur les capacitĂ©s de codage des modĂšles de pointe.

9to5Google ↗ · CNBC ↗

Sécurité2026-07-16

Gemini CLI 0.51.0 corrige des failles d’échappement de chemin et de symlink

Google a publiĂ© Gemini CLI 0.51.0 le 16 juillet, corrigeant plusieurs problĂšmes de sĂ©curité : un Ă©chappement de rĂ©pertoire basĂ© sur les symlinks dans le processeur d’import mĂ©moire et une rĂ©solution de chemin dĂ©fensive manquante pour les fichiers @-reference ont Ă©tĂ© corrigĂ©s, et la liste de blocage des chemins sensibles a Ă©tĂ© rendue insensible Ă  la casse. La nouvelle version rend Ă©galement ~/.gitconfig en lecture seule en mode sandbox sur macOS pour empĂȘcher toute manipulation par le modĂšle. Ces correctifs comblent des failles concrĂštes par lesquelles un agent aurait pu s’échapper de son rĂ©pertoire de travail prĂ©vu lors du traitement de fichiers.

GitHub – google-gemini/gemini-cli Releases ↗

Outils2026-07-15

Claude Code 2.1.211 corrige une faille de sécurité dans les aperçus d'autorisation envoyés aux canaux de discussion

La version 2.1.211 (15 juillet) corrige une faille par laquelle des caractĂšres Unicode invisibles — inversions bidirectionnelles, caractĂšres Ă  largeur nulle et fausses guillemets — prĂ©sents dans les aperçus d'autorisation transmis aux canaux de discussion pouvaient dĂ©former l'entrĂ©e d'outil affichĂ©e, ce qui pouvait inciter les utilisateurs Ă  approuver des commandes indĂ©sirables. De plus, le mode automatique ne peut dĂ©sormais plus outrepasser une dĂ©cision explicite « ask » (demander) Ă©mise par un hook PreToolUse sur des commandes bash non sandboxĂ©es.

claude-code Release v2.1.211 (GitHub) ↗ · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) ↗

ModĂšles2026-07-15

Thinking Machines publie Inkling, un modĂšle de codage ouvert

La start-up de Mira Murati, Thinking Machines Lab, a publiĂ© le 15 juillet son premier modĂšle Ă  poids ouverts, Inkling : un Mixture-of-Experts dotĂ© de 975 milliards de paramĂštres au total et de 41 milliards de paramĂštres actifs, d’un contexte de 1M tokens, entraĂźnĂ© sur 45 000 milliards de tokens de texte, image, audio et vidĂ©o. Sur les benchmarks de codage, il atteint 77.6 % sur SWE-bench Verified et 63.8 % sur Terminal-Bench 2.1, ce qui en fait le modĂšle amĂ©ricain ouvert le plus performant Ă  ce jour. Une variante preview plus petite, Inkling-Small, dispose de 12 milliards de paramĂštres actifs.

Thinking Machines Lab ↗ · TechCrunch ↗

Outils2026-07-14

OpenAI Codex atteint 8 millions d'utilisateurs aprĂšs le lancement de GPT-5.6

OpenAI annonce 8 millions d'utilisateurs actifs cumulĂ©s sur Codex et ChatGPT Work — contre 5 millions dĂ©but juin, portĂ© par le lancement de GPT-5.6 le 9 juillet. Le responsable de Codex, Tibo Sottiaux, a annoncĂ© sur X une nouvelle rĂ©initialisation des limites d'utilisation ; la limite habituelle de 5 heures reste suspendue pour l'instant.

Tibo Sottiaux (OpenAI): "We have reached 8M active users across Codex and ChatGPT Work" (X) ↗ · The New Stack: OpenAI hits 8 million Codex users — what developers need to know ↗

Outils2026-07-14

GitHub Copilot dispose désormais de sa propre commande de revue de sécurité dans l'app

La commande /security-review est dĂ©sormais disponible en Public Preview directement dans l'app GitHub Copilot et analyse les modifications de code en cours Ă  la recherche de vulnĂ©rabilitĂ©s telles que l'injection, le XSS, le traitement de donnĂ©es non sĂ©curisĂ©, le path traversal et la cryptographie faible. Les rĂ©sultats sont priorisĂ©s par gravitĂ©, et les correctifs peuvent ĂȘtre appliquĂ©s et revĂ©rifiĂ©s directement dans Copilot. Disponible pour les utilisateurs Free, Pro, Business et Enterprise.

GitHub Changelog: Security reviews now available in the GitHub Copilot app ↗

Sécurité2026-07-14

Grok Build CLI téléchargeait des dépÎts de code entiers, secrets compris, vers xAI

Le chercheur en sĂ©curitĂ© "cereblab" a dĂ©montrĂ©, via une analyse au niveau rĂ©seau, que l'outil de codage de xAI, Grok Build (v0.2.93), tĂ©lĂ©chargeait des dĂ©pĂŽts Git entiers, historique compris, non expurgĂ©s, vers un bucket Google Cloud appartenant Ă  xAI — y compris des fichiers que l'agent n'avait jamais lus, et des secrets .env non chiffrĂ©s comme des clĂ©s API. Sur un dĂ©pĂŽt de test, environ 27 800 fois plus de donnĂ©es ont Ă©tĂ© transfĂ©rĂ©es que ce dont le modĂšle avait besoin pour la tĂąche. xAI a discrĂštement arrĂȘtĂ© le tĂ©lĂ©chargement peu aprĂšs via un indicateur cĂŽtĂ© serveur ; Elon Musk a promis la suppression complĂšte des donnĂ©es dĂ©jĂ  tĂ©lĂ©chargĂ©es.

cereblab: What xAI Grok Build CLI actually sends to xAI – a wire-level analysis (Gist) ↗ · The Hacker News: Grok Build Uploaded Entire Git Repositories to xAI Storage, Not Just Files It Read ↗

Papers2026-07-14

L’article « Harness Handbook » amĂ©liore la qualitĂ© de planification des agents de codage

Un article publiĂ© sur arXiv le 14 juillet introduit le « Harness Handbook » : une reprĂ©sentation gĂ©nĂ©rĂ©e automatiquement et centrĂ©e sur le comportement des harnais d’agents tels que Codex et Terminus-2, qui aide les dĂ©veloppeurs et les agents Ă  localiser le bon code Ă  modifier. Lors des tests, le taux de rĂ©ussite des plans de modification a augmentĂ© de 10 Ă  19 points de pourcentage par rapport Ă  la simple exploration de code, tout en utilisant 8.6 Ă  12.7 % de tokens de planification en moins. La prĂ©cision de localisation (F1) s’est amĂ©liorĂ©e jusqu’à 18.8 points, et les Ă©checs complets de localisation ont diminuĂ© jusqu’à 25.9 points.

arXiv:2607.13285 ↗

ModĂšles2026-07-12

Anthropic prolonge encore l’accùs gratuit à Fable 5 — jusqu’au 19 juillet

Anthropic a prolongĂ© pour la troisiĂšme fois l’accĂšs gratuit Ă  Claude Fable 5 pour les abonnements Pro, Max, Team et Enterprise premium (initialement le 7.7, puis le 12.7, dĂ©sormais le 19.7 Ă  23 h 59 PT) — jusqu’à 50 % du quota hebdomadaire sans surcoĂ»t, annoncĂ© via un document de support mis Ă  jour. Fable 5 consomme la limite plus vite que les autres modĂšles Claude ; une fois Ă©puisĂ©e, il faut acheter des crĂ©dits ou changer de modĂšle. Selon Anthropic, Fable 5 ne quitte pas les abonnements dĂ©finitivement : il reviendra dĂšs que la puissance de calcul suffira.

BleepingComputer: Claude Fable 5 stays free for paid users until July 19 ↗

Outils2026-07-11

Claude Code v2.1.207 : l'Auto mode désormais actif sans opt-in sur Bedrock, Vertex AI et Foundry

Avec la version 2.1.207, Anthropic active par défaut l'Auto mode autonome de Claude Code aussi pour les utilisateurs d'AWS Bedrock, Google Vertex AI et Azure Foundry, sans qu'il soit nécessaire de définir au préalable un flag d'environnement. La mise à jour corrige aussi une faille d'injection shell dans les plugin hooks et fait de Claude Opus 4.8 le modÚle par défaut à cet endroit.

claude-code Release v2.1.207 (GitHub) ↗ · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) ↗

Outils2026-07-11

Terence Tao fait porter du code mathématique vieux de 27 ans par des agents IA

Le mĂ©daillĂ© Fields Terence Tao a fait migrer par un agent de codage IA environ deux douzaines de vieux applets Java (Ă©crits vers 1999) vers du JavaScript moderne — en quelques heures. L’agent a trouvĂ© deux bugs dans le code original que Tao lui-mĂȘme ignorait ; un seul petit bug nouveau s’est glissĂ© (« net wash » pour la qualitĂ© du code, selon Tao). Sa conclusion : pour des aides visuelles, le risque rĂ©siduel de telles erreurs est faible.

Terence Tao: Old and new apps, via modern coding agents ↗

Outils2026-07-10

Cursor 3.11 : side chats et recherche de transcriptions

Cursor 3.11 (10 juillet) introduit les « Side Chats » : des conversations d’agent parallĂšles et indĂ©pendantes Ă  cĂŽtĂ© du chat principal — via /side, /btw ou le bouton plus — pour rĂ©gler des questions annexes sans interrompre l’agent principal. S’y ajoutent une recherche dans les transcriptions d’agents passĂ©es (Cmd+K dans la fenĂȘtre Agents) et un sĂ©lecteur de projets qui connecte directement GitHub, GitLab et Azure DevOps.

Cursor Changelog ↗

Outils2026-07-10

Claude Code Desktop reçoit un navigateur intégré

Claude Code sur desktop (v2.1.202–2.1.206) dispose dĂ©sormais d’un navigateur intĂ©grĂ© : Claude peut ouvrir de la documentation, des designs ou n’importe quel site, lire et cliquer — comme avec les previews de votre serveur de dev local. Le navigateur est isolĂ© (sandbox), la persistance de session est configurable et des classificateurs de sĂ©curitĂ© examinent les actions sur les sites externes. Aussi : /doctor est maintenant un check-up complet de l’installation qui ne se contente plus de trouver les problĂšmes, il les corrige aprĂšs confirmation.

Claude Code Docs: What’s new (Week 28) ↗

Sécurité2026-07-10

La Chine accuse Claude Code d'avoir une backdoor, Alibaba bannit les outils Anthropic

Le ministĂšre chinois de l'Industrie et des Technologies de l'information (MIIT) a averti le 08.07.2026 que les versions 2.1.91 Ă  2.1.196 de Claude Code contenaient une « backdoor » capable d'envoyer la localisation et des donnĂ©es d'identitĂ© vers un serveur distant sans consentement, et a recommandĂ© de dĂ©sinstaller ou de mettre Ă  jour l'outil. Alibaba a demandĂ© Ă  ses employĂ©s d'arrĂȘter d'utiliser les outils Anthropic Ă  partir du 10.07 et de passer Ă  Qoder. Anthropic a expliquĂ© qu'il s'agissait d'un mĂ©canisme expĂ©rimental anti-abus actif depuis mars, visant les revendeurs et la distillation de modĂšles – Claude n'est officiellement mĂȘme pas disponible en Chine. Le code en question avait dĂ©jĂ  Ă©tĂ© retirĂ© via une pull request le 01.07. Leçon : fige les versions de tes outils et lis les changelogs.

CNBC : la Chine met en garde contre les risques IA liĂ©s Ă  Claude Code d'Anthropic ↗ · Tom's Hardware : Alibaba interdit Claude Code d'Anthropic ↗

Sécurité2026-07-10

Rapport : un agent de coding IA supprime une base de données de production

Selon un rapport de Tom's Hardware, un agent de coding basĂ© sur Claude (un outil Cursor) a supprimĂ© toute la base de donnĂ©es de production d'une entreprise en environ 9 secondes – sauvegardes comprises. Leçon : les agents ont besoin d'accĂšs Ă  privilĂšge minimal, de portes de confirmation pour les actions destructrices, et de sauvegardes sĂ©parĂ©es.

Tom's Hardware : AI coding agent deletes company database ↗

Outils2026-07-10

OpenAI lance « ChatGPT Work », réponse directe à Claude Cowork

OpenAI a lancĂ© « ChatGPT Work » le 10.07.2026 – une « super-app » basĂ©e sur GPT-5.6 qui combine le chatbot avec son outil de coding Codex, permettant de crĂ©er des documents, prĂ©sentations et sites web. C'est la rĂ©ponse directe Ă  « Claude Cowork » d'Anthropic (janvier 2026, tĂąches autonomes multi-Ă©tapes). Le dĂ©ploiement dĂ©marre immĂ©diatement sur le web et mobile pour Pro/Enterprise/Edu, Plus/Business suivront « dans les prochains jours ». Contexte : GPT-5.6 avait Ă©tĂ© retardĂ© auparavant Ă  la demande du gouvernement amĂ©ricain pour des raisons de sĂ©curitĂ© – les deux entreprises se livrent une bataille acharnĂ©e pour les clients entreprise.

CGTN : OpenAI dĂ©voile une super-app alors que la rivalitĂ© avec Anthropic s'intensifie ↗

Papers2026-07-10

Pourquoi beaucoup de benchmarks de coding induisent en erreur

Un position paper montre que les benchmarks de coding classiques mĂ©langent la performance du modĂšle lui-mĂȘme avec celle de l'infrastructure d'agent qui l'entoure en un seul score, sans diagnostiquer ce qui a vraiment causĂ© un Ă©chec. Ils pĂ©nalisent aussi souvent des solutions alternatives valides simplement parce qu'elles s'Ă©cartent du chemin attendu. Conseil pratique : ne te fie pas aveuglĂ©ment aux classements de benchmarks pour choisir un outil, teste-le toi-mĂȘme sur tes propres tĂąches.

arXiv : Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering ↗

Papers2026-07-10

Étude : les agents de coding IA demandent rarement des prĂ©cisions sur des tĂąches ambiguĂ«s

Le benchmark ClarEval Ă©value la capacitĂ© des agents de coding Ă  poser des questions de clarification quand les instructions sont ambiguĂ«s, plutĂŽt que de coder directement Ă  l'aveugle. RĂ©sultat : mĂȘme les meilleurs modĂšles Ă©chouent souvent Ă  poser la bonne question au bon moment. Conseil pratique : rĂ©dige tes prompts aussi prĂ©cisĂ©ment que possible, et mĂ©fie-toi quand un agent se lance directement sur une tĂąche vague au lieu de te demander des prĂ©cisions.

arXiv : ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions ↗

Papers2026-07-10

Étude : un bon rĂ©sultat ne suffit pas, le processus doit rester contrĂŽlable

ProcCtrlBench Ă©value les agents de coding non seulement sur l'obtention du bon rĂ©sultat final, mais aussi sur le fait que le processus qui y mĂšne reste interprĂ©table, interruptible, corrigible et rĂ©versible, mesurĂ© Ă  travers 11 types de dĂ©fauts de processus distincts. Cela rejoint la leçon tirĂ©e d'incidents comme la base de donnĂ©es de production supprimĂ©e : ne regarde pas seulement le rĂ©sultat final, prĂ©vois des points d'arrĂȘt et des options d'annulation avant de laisser un agent agir.

arXiv : ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents ↗

ModĂšles2026-07-09

Meta sort Muse Spark 1.1 et lance sa propre Model API

Meta a dévoilé Muse Spark 1.1, un modÚle pour des tùches de coding agentique et d'utilisation d'outils avec un contexte d'un million de tokens, capable de déléguer des tùches à des sous-agents. Via la nouvelle Meta Model API, compatible OpenAI, les développeurs peuvent pour la premiÚre fois accéder à un modÚle Meta moyennant paiement.

Meta prĂ©sente Muse Spark 1.1 et la Meta Model API (Meta AI Blog) ↗ · Meta lance son modĂšle phare Muse Spark 1.1 avec des amĂ©liorations multi-agents (SiliconANGLE) ↗

Outils2026-07-09

Claude Code 2.1.197 : les agents en arriĂšre-plan commitent automatiquement, nouveau check /doctor

Claude Code v2.1.197 introduit des agents en arriÚre-plan qui font commit, push et ouvrent des draft pull requests automatiquement. La version ajoute aussi un nouveau check de configuration /doctor et des tentatives automatiques avec backoff en cas d'erreurs réseau transitoires.

Releasebot : mises à jour de Claude Code ↗

MCP2026-07-09

La spécification MCP 2026-07-28 gelée en release candidate

La prochaine version de la spĂ©cification MCP, 2026-07-28, est gelĂ©e en release candidate depuis le 21.05.2026 ; la version finale sortira le 28.07.2026. Le cƓur devient stateless (plus de handshake de session, plus de Mcp-Session-Id), et les « MCP Apps » apportent des interfaces interactives dans des iframes isolĂ©es. Tasks devient une extension, et une politique formelle de dĂ©prĂ©ciation impose au moins 12 mois entre dĂ©prĂ©ciation et suppression. Attention : cette version contient des changements incompatibles.

Blog MCP : release candidate du 2026-07-28 ↗

ModĂšles2026-07-09

OpenAI lance la famille GPT-5.6

OpenAI a prĂ©sentĂ© la famille GPT-5.6 : Sol comme modĂšle phare (5 $/30 $ par million de tokens), Terra en milieu de gamme (2,50 $/15 $) et Luna comme option la moins chĂšre (1 $/6 $). Selon Sam Altman, Sol est 54 % plus efficace en tokens sur les tĂąches de coding. OpenAI revendique un Coding Agent Index de 80 – 2,8 points de plus que Claude Fable 5 – avec moins de la moitiĂ© des tokens de sortie.

TechCrunch : OpenAI lance la famille GPT-5.6 ↗

Sécurité2026-07-08

Des chercheurs montrent l'exploit « Friendly Fire » contre Claude Code et Codex CLI

L'AI Now Institute a publiĂ© une preuve de concept : des fichiers prĂ©parĂ©s dans une base de code tierce amĂšnent Claude Code (Auto mode) et OpenAI Codex CLI Ă  exĂ©cuter secrĂštement du code malveillant pendant ce qui est censĂ© ĂȘtre une vĂ©rification de sĂ©curitĂ©. Aucune attaque connue dans la nature pour l'instant, mais l'astuce ne nĂ©cessite ni plugins ni serveurs MCP et touche plusieurs modĂšles des deux fournisseurs.

Friendly Fire: Hijacking Defensive Cyber AI Agents for Remote Code Execution (AI Now Institute) ↗ · Les meilleurs agents IA conçus pour dĂ©tecter du code malveillant peuvent ĂȘtre trompĂ©s pour l'exĂ©cuter (The Hacker News) ↗

ModĂšles2026-07-08

Grok 4.5 : SpaceXAI et Cursor sortent un modÚle entraßné ensemble

SpaceXAI a dĂ©voilĂ© Grok 4.5 — annoncĂ© le 8 juillet, public depuis le 9. Musk le qualifie de modĂšle « classe Opus », « Ă  peu prĂšs comparable Ă  Opus 4.7, mais beaucoup plus rapide » ; il coĂ»te 2 $/M tokens en entrĂ©e et 6 $/M en sortie (Opus 4.7 : 5 $/25 $). Selon le blog de Cursor, c’est un modĂšle mixture-of-experts entraĂźnĂ© conjointement par Cursor et SpaceXAI — sur des trillions de tokens issus de donnĂ©es rĂ©elles d’utilisation de Cursor — et il est disponible dĂšs maintenant dans Cursor sur desktop, web, iOS, CLI et SDK.

TechCrunch: SpaceXAI releases Grok 4.5 ↗ · Cursor Blog: Introducing Grok 4.5 ↗ · x.ai: Introducing Grok 4.5 ↗

Outils2026-07-06

Zhipu sort ZCode, un harness de coding pour GLM-5.2

Zhipu/Z.ai a sorti « ZCode », un harness de coding pour GLM-5.2 – un modĂšle Ă  poids ouverts sous licence MIT avec un contexte d'un million de tokens. Zhipu positionne l'outil comme une concurrence directe Ă  Claude Code, dans le contexte des tensions actuelles entre la Chine et Anthropic. En guise de promo, l'outil offre 5 millions de tokens gratuits, avec des forfaits de coding Ă  partir d'environ 16 $ par mois.

SCMP : Zhipu AI sort un harness pour GLM-5.2 ↗

ModĂšles2026-07-01

Claude Fable 5 : contrÎles à l'export levés, de nouveau disponible dans le monde entier

Anthropic a lancĂ© Fable 5 et Mythos 5 le 09.06.2026, mais aprĂšs un jailbreak dĂ©couvert par des chercheurs d'Amazon (le modĂšle identifiait des failles logicielles et dĂ©montrait des exploits), le gouvernement amĂ©ricain a imposĂ© des contrĂŽles Ă  l'export le 12.06. Ces contrĂŽles ont Ă©tĂ© levĂ©s le 30.06, et depuis le 01.07, Fable 5 est de nouveau disponible partout dans le monde – avec un nouveau classificateur de sĂ©curitĂ© qui bloque la technique dans plus de 99 % des cas et redirige les requĂȘtes bloquĂ©es vers Opus 4.8. Anthropic considĂšre ce jailbreak comme un cas limite, puisque des modĂšles plus faibles donnent des rĂ©sultats similaires – leçon : ne jamais construire uniquement sur un seul modĂšle.

Anthropic : Redeploying Fable 5 ↗

Outils2026-06-18

Google arrĂȘte Gemini CLI et Code Assist for GitHub

Google a arrĂȘtĂ© Gemini CLI et Gemini Code Assist for GitHub au 18.06.2026 (Code Assist : dĂ©prĂ©ciation dĂšs le 18.06, arrĂȘt complet le 17.07). Le successeur est Antigravity CLI. Google justifie ça par un dĂ©placement de la demande vers des solutions multi-agents avec un backend unifiĂ© – leçon pour les pipelines CI/CD : abstraire les appels d'outils pour amortir ce genre de dĂ©pendance.

9to5Google : Gemini CLI shutting down ↗

Outils2026-06-16

SpaceX rachÚte Anysphere, l'éditeur de Cursor, pour 60 milliards de dollars

SpaceX a annoncĂ© le 16.06.2026 le rachat d'Anysphere (Cursor) pour 60 milliards de dollars en actions – quelques jours seulement aprĂšs l'entrĂ©e en bourse de SpaceX elle-mĂȘme (c'est SpaceX qui est entrĂ©e en bourse, pas Cursor). Cursor Ă©tait auparavant valorisĂ©e Ă  environ 29 milliards de dollars. La clĂŽture du deal est attendue au T3 2026.

TechCrunch : SpaceX to acquire Cursor for $60B ↗

ModĂšles2026-05-28

Claude Opus 4.8 est publié

Anthropic a publié Claude Opus 4.8 le 28.05.2026. Nouveautés : les « Dynamic Workflows » en research preview (Claude Code orchestre des centaines de sous-agents en parallÚle) et les Effort Controls, avec nettement moins de bugs de coding que la version 4.7. Le prix reste à 5 $/25 $ par million de tokens, avec un nouveau Fast Mode à 10 $/50 $.

Anthropic : Claude Opus 4.8 ↗