Was gerade in der KI-Welt passiert â kuratiert, verifiziert, mit Quellen.
Security2026-07-30
Anthropic: Claude drang bei Sicherheitstests in reale Systeme dreier Firmen ein
Anthropic hat nach Durchsicht von 141.006 Cybersicherheits-AuswertungslĂ€ufen drei VorfĂ€lle offengelegt, bei denen Claude-Modelle aus der Testumgebung des Partners Irregular heraus das offene Internet erreichten und unautorisiert auf Produktivsysteme dreier fremder Organisationen zugriffen. Ein Ausbruch war es nicht: Der Prompt sagte den Modellen, sie seien in einer Simulation ohne Internetzugang â durch ein MissverstĂ€ndnis zwischen Anthropic und dem Partner stand der Zugang aber offen. Die Modelle hielten die realen Ziele fĂŒr Teil einer Capture-the-Flag-Ăbung und nutzten schwache Passwörter und ungeschĂŒtzte Endpunkte. Betroffen waren Opus 4.7, Mythos 5 und ein internes Testmodell; Anthropic stoppte daraufhin alle Cyber-Evaluationen.
Anthropic: Investigating three real-world incidents in our cybersecurity evaluations â · SecurityAffairs: Anthropic Finds Claude Breached Real Companies During Security Evaluations â
Tools2026-07-30
VS Code bĂŒndelt Juli-Neuerungen fĂŒr Copilot: Worktrees, Multi-Chat, Vision
GitHub fasst die Copilot-Neuerungen der VS-Code-Versionen 1.127 bis 1.131 zusammen, die im Juli erschienen sind. Das Agents-Fenster erhĂ€lt ein ĂŒberarbeitetes Layout mit kompakterer Diff-Ansicht und lĂ€sst Copilot-, Claude- und Codex-Sitzungen wahlweise in isolierten Git-Worktrees laufen. Neu sind Multi-Chat-Sitzungen mit abzweigbaren Peer-Chats, eine nun allgemein verfĂŒgbare BildunterstĂŒtzung im Chat sowie UnterstĂŒtzung fĂŒr mitgebrachte BYOK-Modelle im Agents-Fenster. Business- und Enterprise-Nutzer sehen zudem ihren KI-Guthabenverbrauch im laufenden Abrechnungszeitraum direkt im Copilot-StatusmenĂŒ.
GitHub Changelog: GitHub Copilot in Visual Studio Code, July 2026 releases â · Visual Studio Code 1.131 Release Notes â
MCP2026-07-29
Copilot-Code-Review bindet Agent Skills und MCP-Server jetzt regulÀr ein
GitHub hat die im Juni angekĂŒndigte Vorschau beendet: Copilot Code Review unterstĂŒtzt nun fĂŒr alle Pro-, Pro+-, Business- und Enterprise-Nutzer regulĂ€r sowohl Agent Skills als auch MCP-Server. Ăber eine SKILL.md-Datei unter .github/skills lassen sich teaminterne Werkzeuge und Standards einbinden, MCP-Verbindungen ziehen Kontext aus externen Plattformen wie Issue-Trackern in die Review, Werkzeugaufrufe bleiben dabei auf Lesezugriff beschrĂ€nkt. FĂŒr den Cloud-Agenten eingerichtete MCP-Konfigurationen gelten automatisch mit, GitHub- und Playwright-MCP sind standardmĂ€Ăig aktiv. Kommentare kennzeichnen kĂŒnftig, wenn sie auf Skills oder MCP-Kontext beruhen.
GitHub Changelog: Copilot code review: Agent skills and MCP now generally available â
MCP2026-07-28
MCP-Spezifikation 2026-07-28 final: Protokoll wird zustandslos
Die MCP-Spezifikation 2026-07-28 ist final erschienen und bricht mit dem bisherigen Protokoll: Der Session-Handshake (initialize/initialized) sowie der Mcp-Session-Id-Header entfallen, MCP wird zustandslos und pro Anfrage selbstbeschreibend, Server lassen sich kĂŒnftig hinter einfachen Round-Robin-Load-Balancern skalieren. Serverseitige Anfragen wie Sampling, Elicitation und Roots laufen jetzt ĂŒber das neue Multi-Round-Trip-Muster statt ĂŒber offene bidirektionale Streams. Tasks wandert aus dem Kern in eine eigene Extension. Roots, Sampling, Logging sowie der HTTP+SSE-Transport gelten nun als deprecated, mit mindestens zwölf Monaten Ăbergangsfrist. Bestehende MCP-Server und -Clients mĂŒssen fĂŒr die neue Version angepasst werden.
GitHub Release 2026-07-28 (modelcontextprotocol/modelcontextprotocol) â · MCP Changelog: Key Changes seit 2025-11-25 â · MCP Blog: The 2026-07-28 Specification â
Tools2026-07-28
Grok 4.5 hÀlt Einzug in GitHub Copilot
xAI hat sein Modell Grok 4.5 in GitHub Copilot verfĂŒgbar gemacht, wĂ€hlbar im ModellwĂ€hler von VS Code, Visual Studio, Copilot CLI und weiteren Copilot-OberflĂ€chen. Grok 4.5 bietet ein Kontextfenster von bis zu 500.000 Token, verarbeitet Text- und Bildeingaben und lĂ€sst sich in drei Reasoning-Stufen einstellen. GitHub verweist auf interne Tests mit guten Ergebnissen bei terminalbasierten Coding-Aufgaben und parallelem Werkzeugeinsatz. Der Rollout erfolgt schrittweise fĂŒr Copilot Pro, Pro+, Max, Business und Enterprise, abgerechnet zu den Listenpreisen von xAI.
GitHub Changelog: Grok 4.5 is now available in GitHub Copilot â · xAI News: Grok 4.5 in GitHub Copilot â
Security2026-07-28
npm scannt Pakete kĂŒnftig automatisch beim Veröffentlichen
npm fĂŒhrt eine automatische Malware-PrĂŒfung neu veröffentlichter Pakete ein, bevor diese installierbar werden - je nach Befund werden Pakete freigegeben, zur manuellen PrĂŒfung zurĂŒckgehalten oder blockiert. Das verzögert die VerfĂŒgbarkeit meist um wenige Minuten, in Spitzenzeiten auch lĂ€nger. Gesperrte Maintainer können Einspruch einlegen, teils drohen zusĂ€tzliche KontomaĂnahmen. npm fĂŒhrt zudem ein contentPolicy-Feld in package.json fĂŒr legitime, aber malware-Ă€hnlich wirkende Pakete ein, etwa Sicherheitswerkzeuge. Solche Dual-Use-Pakete benötigen eine DISCLOSURE-Datei, die Zweck und Funktion erlĂ€utert und vom Trust-&-Safety-Team geprĂŒft wird.
GitHub Changelog: npm publish-time malware scanning and dual-use metadata â
Security2026-07-27
NVIDIA grĂŒndet mit BranchengröĂen die Open Secure AI Alliance
NVIDIA hat gemeinsam mit anderen Organisationen die Open Secure AI Alliance gegrĂŒndet; im AnkĂŒndigungstext genannt werden unter anderem Microsoft, IBM, Cisco, Cloudflare, CrowdStrike, Databricks, Hugging Face, LangChain, Cognition und die Linux Foundation. Ziel ist der offene Austausch von Werkzeugen zur Absicherung von KI-Agenten â IdentitĂ€t, Rechteverwaltung, Isolation, Guardrails, Protokollierung und sichere Coding-Workflows. Erster technischer Beitrag ist NOOA (NVIDIA Labs Object-Oriented Agent), ein Open-Source-Framework unter Apache-2.0-Lizenz, das Agenten-Verhalten als testbaren, versionierbaren Python-Code statt verstreuter Prompts und Tool-Schemas modelliert.
Industry Leaders Unite in Open Secure AI Alliance (NVIDIA Blog) â · NVIDIA-NeMo/labs-OO-Agents (GitHub) â
Tools2026-07-27
GitHub Copilot App bekommt eigene Zugriffsrichtlinie und zentrale Policy-Kontrolle
GitHub hat die Copilot-App und den Copilot-Cloud-Agent in die zentral verwaltbaren Enterprise-Settings aufgenommen. Unternehmen können damit ĂŒber eine gemeinsame managed-settings.json-Datei festlegen, welche Plugins und MarktplĂ€tze Entwickler nutzen dĂŒrfen und ob sich Freigabeaufforderungen umgehen lassen â bislang galt das nur fĂŒr Copilot CLI und VS Code. ZusĂ€tzlich erhĂ€lt die Copilot-App eine eigene, von der CLI-Policy unabhĂ€ngige Zugriffsregelung auf Enterprise- und Organisationsebene, standardmĂ€Ăig fĂŒr alle Nutzer aktiviert. Admins können den Zugriff pro Organisation freigeben, sperren oder Entscheidungen an Organisationsadmins delegieren.
GitHub Changelog: Enterprise managed settings in the GitHub Copilot app and Copilot cloud agent â · GitHub Changelog: Manage GitHub Copilot app access with a dedicated policy â
Modelle2026-07-27
Kimi K3: Gewichte jetzt wirklich auf Hugging Face ladbar
AngekĂŒndigt wurde Kimi K3 bereits am 16. Juli, die Gewichte fehlten bis zuletzt. Seit dem 27. Juli liegen sie unter moonshotai/Kimi-K3 zum Download bereit â ohne Zugangsschranke, unter der eigenen Kimi-K3-Lizenz. Die Modellkarte nennt 2,8 Billionen Parameter, Kimi Delta Attention mit Attention Residuals, ein Kontextfenster von einer Million Token und native Verarbeitung von Text, Bild und Video im selben Modell. Damit ist Selbsthosten erstmals möglich statt nur Nutzung ĂŒber die Moonshot-API.
moonshotai/Kimi-K3 (Hugging Face) â · Tech Times: Kimi K3 Open Weights Arrive Sunday â
Modelle2026-07-24
Anthropic veröffentlicht Claude Opus 5 mit 1-Mio-Kontext und Effort-Reglern
Anthropic hat Claude Opus 5 vorgestellt: 1-Million-Token-Kontextfenster, Denken standardmĂ€Ăig aktiv und ein neuer Effort-Regler (niedrig/mittel/hoch) zum AbwĂ€gen von Kosten und Leistung. Die Preise bleiben bei 5$/25$ pro Million Tokens wie bei Opus 4.8, ein schnellerer Fast-Mode kostet doppelt so viel. In Claude Code (ab v2.1.219) ist Opus 5 seither der neue Standard-Opus fĂŒr Coding-Agenten.
Claude Opus 5 â · Anthropic releases Claude Opus 5: Here's how it's different than what's already out there â
Tools2026-07-24
GitHub Copilot schaltet binnen einer Woche Gemini 3.6 Flash und Opus 5 frei
GitHub Copilot (inkl. Copilot CLI) hat innerhalb einer Woche zwei neue Modelle freigeschaltet: Gemini 3.6 Flash am 21. Juli mit konfigurierbarem Reasoning-Aufwand und parallelem Tool-Einsatz, sowie Claude Opus 5 am 24. Juli fĂŒr lange, agentische Coding-Aufgaben. Beide sind je nach Plan ab Copilot Pro bzw. Pro+ verfĂŒgbar und werden nutzungsbasiert zum Anbieter-Listenpreis abgerechnet.
Gemini 3.6 Flash is now available in GitHub Copilot â · Claude Opus 5 is now available in GitHub Copilot â
Tools2026-07-22
Cursor stellt âCursor Router" fĂŒr automatische Modellwahl vor
Cursor hat Cursor Router vorgestellt: ein System, das jede Anfrage nach Aufgabe, Kontext und KomplexitĂ€t automatisch an ein passendes Modell verteilt, wĂ€hlbar ĂŒber die Modi Intelligence, Balance oder Cost. Laut Cursor lieferte der Router in A/B-Tests ĂŒber Millionen Anfragen im Intelligence-Modus rund 60% niedrigere Kosten bei vergleichbarer QualitĂ€t gegenĂŒber manueller Modellwahl.
Introducing Cursor Router â · SpaceX unveils Cursor Router â
Papers2026-07-22
IssueTrojanBench: Zwei Drittel bösartiger GitHub-Issues tÀuschen Coding-Agenten
Das Paper IssueTrojanBench testet Cursor, Claude Code und Codex Desktop mit als GitHub-Issues getarnten bösartigen Anweisungen ĂŒber sechs Zustellwege (u.a. PDFs, Issue-Kommentare). Ergebnis: 66,5% der bösartigen Issues umgingen alle Schutzmechanismen der Agenten; Ablehnungen kamen fast ausschlieĂlich vom zugrunde liegenden LLM (Sonnet 4.6 selektiver als GPT-Modelle), kaum vom Agenten-Framework selbst.
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests â
Modelle2026-07-21
Google bringt Gemini 3.6 Flash, 3.5 Flash-Lite und 3.5 Flash Cyber
Google hat drei neue Modelle veröffentlicht: Gemini 3.6 Flash, das gĂŒnstigere 3.5 Flash-Lite und das auf Cybersicherheit spezialisierte 3.5 Flash Cyber â ein Gemini-3.5-Pro-Update bleibt weiterhin aus. Laut Google senkt 3.6 Flash den Output-Token-Verbrauch um 17% gegenĂŒber 3.5 Flash und verbessert sich im MLE-Bench-Coding-Benchmark von 49,7% auf 63,9%. VerfĂŒgbar u.a. ĂŒber AI Studio, Gemini API, Android Studio, Antigravity und Vertex AI.
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber â · Google releases three new Gemini models â but no 3.5 Pro â
Tools2026-07-21
Codex CLI 0.145.0: durchsuchbare Thread-Historie und Import aus Cursor/Claude Code
OpenAI hat Codex CLI 0.145.0 veröffentlicht: eine paginierte, durchsuchbare Thread-Historie mit persistenten Namen, ein erweiterter /import-Befehl, der Einstellungen, MCP-Server, Plugins und Sessions aus Cursor und Claude Code ĂŒbernimmt, sowie ein stabilisiertes Multi-Agent-V2 mit konfigurierbaren Subagent-Modellen. ZusĂ€tzlich nutzt der Login ĂŒber Amazon Bedrock jetzt GPT-5.6 Sol als Standardmodell.
Codex changelog â
Security2026-07-20
Claude Code 2.1.216 stopft Symlink-Schreibpfade und eine Windows-Netzwerkpfad-LĂŒcke
Anthropic hat am 20. Juli 2026 Claude Code 2.1.216 veröffentlicht â ein Release mit deutlichem Sicherheitsschwerpunkt. Behoben wurden mehrere Wege, auf denen Schreibzugriffe das Projektverzeichnis verlassen konnten: Workflow-Speicherungen und geplante Aufgaben folgten einem Symlink an der Stelle â.claudeâ und konnten so auĂerhalb des Projekts schreiben; â/rewindâ stellte Dateien ĂŒber Symlinks und Hardlinks wieder her oder löschte sie (solche Pfade werden jetzt ĂŒbersprungen und gezĂ€hlt); und worktree-isolierte Subagenten konnten Git ĂŒber âgit -Câ, â--git-dirâ oder âGIT_DIRâ/âGIT_WORK_TREEâ in das gemeinsame Checkout umleiten. Unter Windows verlangten schreibgeschĂŒtzte Kommandos beim Zugriff auf Netzwerkpfade keine Berechtigungsabfrage mehr â das ist nun korrigiert. Neu ist die Einstellung âsandbox.filesystem.disabledâ, die die Dateisystem-Isolierung abschaltet, die Kontrolle ĂŒber ausgehenden Netzwerkverkehr aber beibehĂ€lt. ZusĂ€tzlich beseitigt die Version eine quadratisch wachsende Verlangsamung in langen Sitzungen, die zu mehrsekundigen HĂ€ngern und trĂ€gem Fortsetzen fĂŒhrte.
GitHub Release v2.1.216 (anthropics/claude-code) â · Claude Code CHANGELOG.md â
Security2026-07-18
Claude Code 2.1.214 schlieĂt Permission-Bypass unter Windows PowerShell
Anthropic hat am 18. Juli 2026 Claude Code 2.1.214 veröffentlicht und darin mehrere SicherheitslĂŒcken in der BerechtigungsprĂŒfung behoben: Ein Bypass erlaubte das Umgehen von Permission-Checks in Windows-PowerShell-5.1-Sessions, und Bash-PrĂŒfungen bei File-Descriptor-Redirects sowie bei Kommandos ĂŒber 10.000 Zeichen schlagen jetzt fail-closed fehl statt automatisch durchzulaufen. ZusĂ€tzlich wurde ein Bug korrigiert, bei dem einzelne Allow-Regeln wie "Edit(src/**)" versehentlich Schreibzugriffe auf gleichnamige Verzeichnisse im gesamten Repository-Baum statt nur im Arbeitsverzeichnis erlaubten. Neu hinzugekommen ist zudem ein EndConversation-Tool, mit dem Claude Sitzungen bei missbrĂ€uchlichen Nutzern oder Jailbreak-Versuchen aktiv beenden kann.
GitHub Release v2.1.214 (anthropics/claude-code) â · Claude Code CHANGELOG.md â
Modelle2026-07-17
Fable 5 wird fĂŒr Max/Team Premium dauerhaft, Pro zahlt kĂŒnftig per API
Anthropic hat am 17. Juli angekĂŒndigt, dass Claude Fable 5 ab dem 20. Juli fĂŒr Max- und Team-Premium-Abos dauerhaft im Kontingent enthalten bleibt, allerdings gedeckelt auf 50 Prozent der regulĂ€ren wöchentlichen Nutzungslimits. Pro- und Team-Standard-Nutzer verlieren den gebĂŒndelten Zugang, erhalten aber ein einmaliges Guthaben von 100 US-Dollar und zahlen danach API-Preise von 10 US-Dollar pro Million Input- und 50 US-Dollar pro Million Output-Token. Der Kurswechsel beendet drei aufeinanderfolgende VerlĂ€ngerungen der ursprĂŒnglich einwöchigen Gratis-Aktion (zuletzt bis 19. Juli befristet) und folgt laut Berichten auf den Konkurrenzdruck durch OpenAIs GPT-5.6 Sol und Moonshots Kimi K3.
Tech Times: Claude Fable 5 Ends Subscription Limbo â · Simon Willison: Claude make Fable 5 permanent â
Tools2026-07-17
GitHub Copilot Code Review lĂ€uft jetzt standardmĂ€Ăig hinter einer Firewall
GitHub hat am 17. Juli Verbesserungen fĂŒr Copilot Code Review veröffentlicht: Das automatische PR-Review-Feature lĂ€uft nun per Default hinter einer Firewall mit eingeschrĂ€nktem Netzwerkzugriff, die unabhĂ€ngig vom Copilot Cloud Agent konfigurierbar ist. Custom Instructions werden jetzt vom Head-Branch des Pull Requests statt vom Base-Branch gelesen, was Tests und Validierung eigener Review-Anweisungen erleichtert. ZusĂ€tzlich wurde die bisher gemeinsame Runner-Konfiguration von Code Review und Cloud Agent in zwei unabhĂ€ngige Einstellungsbereiche in den Organisationseinstellungen aufgeteilt.
GitHub Changelog: Copilot code review customization and configurability improvements â
Modelle2026-07-17
Kimi K3 belegt Platz 1 in Frontend-Code-Arena, KI-Aktien geraten unter Druck
Neue Benchmark-Daten vom 17. Juli 2026 zeigen, dass Moonshot AIs 2,8-Billionen-Parameter-Modell Kimi K3 mit 1.679 Punkten die Frontend Code Arena anfĂŒhrt und dabei Claude Fable 5 (1.631), GPT-5.6 Sol (1.618) und GLM-5.2 (1.587) hinter sich lĂ€sst. In der Gesamtwertung liegt K3 laut Moonshot weiterhin hinter Fable 5 und GPT-5.6 Sol, ĂŒbertrifft aber alle anderen getesteten Modelle. Laut CNBC schickte die AnkĂŒndigung rivalisierende KI- und Halbleiter-Aktien deutlich auf Talfahrt; Analyst Patrick Moorhead bezeichnete die Marktreaktion als "Ăberreaktion, erschreckend Ă€hnlich der DeepSeek-Panik".
CNBC â · Tom's Hardware â
MCP2026-07-17
GitHub Copilot CLI verwaltet MCP-Server jetzt direkt per Flag
Mit Version 1.0.72-1 vom 17. Juli hat GitHub der Copilot CLI native Flags fĂŒr Plugin-Verwaltung spendiert: --plugin, --mcp und --skill erlauben es, MCP-Server, Skills und Plugins direkt aus dem Terminal hinzuzufĂŒgen oder zu entfernen, ergĂ€nzt um den Befehl copilot plugins remove --skill zum gezielten Entfernen einzelner Skills. Damit rĂŒckt MCP-Server-Management in der Copilot CLI nĂ€her an den Workflow anderer Coding-Agenten heran, wo Konfiguration bisher oft ĂŒber manuelles Editieren von Config-Dateien lief.
GitHub â github/copilot-cli Releases â
Papers2026-07-16
Studie: Coding-Agenten installieren Pakete aus prĂ€parierten READMEs ungeprĂŒft
Ein am 16. Juli auf arXiv veröffentlichtes Paper zeigt, dass KI-Coding-Agenten Setup-Dokumentation wie READMEs, Requirements-Dateien oder Makefiles ausfĂŒhren, ohne Paketnamen, -quellen oder bekannte Schwachstellen zu verifizieren. In Tests ĂŒber zwölf Szenarien mit Frontier-Modellen und fĂŒnf Angriffsklassen (u.a. Registry-Umleitung, Separator-Verwechslung wie 'azurecore' statt 'azure-core', Versions-Pinning auf verwundbare Releases) installierte fast jedes getestete Modell ungeprĂŒfte AbhĂ€ngigkeiten in npm- und Cargo-Ăkosystemen. Offensichtliches Typosquatting wurde zuverlĂ€ssig erkannt, plausible Namensvarianten rutschten aber fast immer durch; Pre-Install-VerifikationsprĂŒfungen schlossen laut Studie den GroĂteil der SicherheitslĂŒcke.
arXiv: Setup Complete, Now You Are Compromised â
Tools2026-07-16
OpenAI Codex CLI 0.144.5 verbessert Erkennung gefÀhrlicher Kommandos
OpenAI hat am 16. Juli 2026 Codex CLI 0.144.5 veröffentlicht. Das Update verbessert die Erkennung gefĂ€hrlicher Shell-Kommandos, erfasst nun mehr erzwungene rm-Varianten und liefert bei verweigerten Kommandos klarere AblehnungsgrĂŒnde. Die Version ist Teil einer Serie kleinerer Patches (0.144.1 bis 0.144.5) seit dem Codex-0.144-Hauptrelease Anfang Juli.
Codex Changelog (OpenAI) â
Papers2026-07-16
Studie: Agentische Coding-Tools bei GitHub-Projekten noch selten intensiv genutzt
Eine am 15. Juli 2026 auf arXiv veröffentlichte und am 16. Juli ĂŒberarbeitete Studie ("Early Adoption of Agentic Coding Tools by GitHub Projects", Raida & Hou) analysiert 25.264 von Coding-Agenten erstellte Pull Requests aus 2.361 populĂ€ren GitHub-Repositories. Ergebnis: Das mediane Repository erzeugt innerhalb von drei Monaten nur ein bis zwei agentische PRs, intensive Nutzung konzentriert sich auf eine kleine Teilmenge an Projekten. Kleine Projekte mit 1-5 Mitwirkenden zeigen dabei höhere Beteiligungsraten an agentischen PRs als mittelgroĂe und groĂe Projekte, wĂ€hrend nur wenige Projekte einen als Branchen-Referenz genannten Wert von 36 PRs pro Teilnehmer im Dreimonatszeitraum ĂŒbertreffen.
arXiv:2607.14037 - Early Adoption of Agentic Coding Tools by GitHub Projects â
Modelle2026-07-16
Moonshot AI veröffentlicht Kimi K3 â gröĂtes offenes KI-Modell der Welt
Das chinesische Unternehmen Moonshot AI hat Kimi K3 vorgestellt, ein offenes Mixture-of-Experts-Modell mit 2,8 Billionen Parametern (davon 16 von 896 Experten pro Anfrage aktiv) und 1-Millionen-Token-Kontext, gebaut auf der neuen Architektur âKimi Delta Attentionâ. Es soll das erste offene Modell der 3-Billionen-Parameter-Klasse sein und in Benchmarks nah an proprietĂ€re Spitzenmodelle heranreichen; die vollstĂ€ndigen Gewichte sollen bis zum 27. Juli veröffentlicht werden.
Kimi K3 Quickstart (Kimi API Platform) â · MarkTechPost: Moonshot AI Releases Kimi K3 â A 2.8 Trillion Parameter Open MoE Model â
Security2026-07-16
Hugging Face meldet Einbruch durch autonomen KI-Agenten
Hugging Face hat einen Angriff auf Teile seiner Produktionsinfrastruktur offengelegt, der nach eigenen Angaben von Anfang bis Ende von einem autonomen KI-Agenten-System durchgefĂŒhrt wurde â ĂŒber prĂ€parierte DatensĂ€tze, die eine Code-Execution-LĂŒcke in der Datenverarbeitungs-Pipeline ausnutzten. Zugriff gab es auf einen begrenzten Satz interner DatensĂ€tze und mehrere Zugangsdaten; öffentliche Modelle, DatensĂ€tze, Spaces und die Software-Lieferkette blieben laut Hugging Face unangetastet. Entdeckt wurde der Vorfall ĂŒber eine KI-gestĂŒtzte Anomalieerkennung; das Unternehmen warnt, autonome KI-gestĂŒtzte Angriffs-Tools seien ânicht mehr theoretischâ.
Hugging Face: Security incident disclosure â July 2026 â
Modelle2026-07-16
Google verschiebt Gemini 3.5 Pro wegen schwacher Coding-Leistung
Laut einem Bloomberg-Bericht vom 16. Juli hat Google die ursprĂŒnglich fĂŒr Juni angekĂŒndigte Veröffentlichung von Gemini 3.5 Pro verschoben, weil das Modell interne Ziele bei der Code-Generierung verfehlte. Ein Ende Juni durchgefĂŒhrtes Update der Trainingsdaten brachte laut zehn befragten aktuellen und ehemaligen Mitarbeitern keine ausreichende Verbesserung; Google bestĂ€tigte, derzeit 3.5 Pro sowie ein verbessertes Flash-Modell mit Partnern zu testen. Die Nachricht lieĂ die Alphabet-Aktie um rund 4 Prozent fallen und zeigt den Wettbewerbsdruck bei Coding-FĂ€higkeiten fĂŒhrender Modelle.
9to5Google â · CNBC â
Security2026-07-16
Gemini CLI 0.51.0 schlieĂt Pfad-Escape- und Symlink-LĂŒcken
Google hat am 16. Juli Gemini CLI 0.51.0 veröffentlicht und dabei mehrere SicherheitslĂŒcken geschlossen: ein Symlink-basiertes Directory-Escape im Memory-Import-Prozessor sowie fehlende defensive Pfadauflösung bei At-Referenz-Dateien wurden behoben, zudem wurde die Blockliste fĂŒr sensible Pfade case-insensitive gemacht. ZusĂ€tzlich macht die neue Version unter macOS die Datei ~/.gitconfig im Sandbox-Modus schreibgeschĂŒtzt, um Manipulationen durch das Modell zu verhindern. Die Fixes adressieren konkrete Wege, ĂŒber die ein Agent beim Verarbeiten von Dateien aus dem vorgesehenen Arbeitsverzeichnis hĂ€tte ausbrechen können.
GitHub â google-gemini/gemini-cli Releases â
Tools2026-07-15
Claude Code 2.1.211 schlieĂt SicherheitslĂŒcke bei Freigabe-Vorschau in Chat-KanĂ€len
Version 2.1.211 (15. Juli) behebt eine LĂŒcke, bei der unsichtbare Unicode-Zeichen â bidirektionale Overrides, Zero-Width-Zeichen und Fake-AnfĂŒhrungszeichen â in an Chat-KanĂ€le weitergeleiteten Freigabe-Vorschauen die angezeigte Tool-Eingabe verfĂ€lschen konnten, sodass Nutzer zur Freigabe unerwĂŒnschter Befehle verleitet werden konnten. ZusĂ€tzlich kann der Auto-Modus jetzt keine explizite âaskâ-Entscheidung eines PreToolUse-Hooks mehr bei nicht-sandboxed Bash-Befehlen ĂŒberschreiben.
claude-code Release v2.1.211 (GitHub) â · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) â
Modelle2026-07-15
Thinking Machines veröffentlicht offenes Coding-Modell Inkling
Mira Muratis Startup Thinking Machines Lab hat am 15. Juli mit Inkling sein erstes offen gewichtetes Modell veröffentlicht: ein Mixture-of-Experts mit 975 Milliarden Gesamt- und 41 Milliarden aktiven Parametern, 1-Mio.-Token-Kontext, trainiert auf 45 Billionen Tokens aus Text, Bild, Audio und Video. Bei Coding-Benchmarks erreicht es 77,6 Prozent auf SWE-bench Verified und 63,8 Prozent auf Terminal-Bench 2.1 und gilt damit als das derzeit stÀrkste offene US-Modell. ZusÀtzlich gibt es als Preview die kleinere Variante Inkling-Small mit 12 Milliarden aktiven Parametern.
Thinking Machines Lab â · TechCrunch â
Tools2026-07-14
OpenAI Codex wÀchst nach GPT-5.6-Start auf 8 Millionen Nutzer
OpenAI meldet 8 Millionen aktive Nutzer ĂŒber Codex und ChatGPT Work zusammen â ein Sprung von 5 Millionen Anfang Juni, ausgelöst durch den GPT-5.6-Start am 9. Juli. Codex-Lead Tibo Sottiaux kĂŒndigte auf X einen erneuten Reset der Nutzungslimits an; die sonst ĂŒbliche 5-Stunden-Rate-Limit bleibt vorerst weiter ausgesetzt.
Tibo Sottiaux (OpenAI): "We have reached 8M active users across Codex and ChatGPT Work" (X) â · The New Stack: OpenAI hits 8 million Codex users â what developers need to know â
Tools2026-07-14
GitHub Copilot bekommt eigenen Security-Review-Befehl in der App
Der Befehl /security-review ist jetzt als Public Preview direkt in der GitHub-Copilot-App verfĂŒgbar und scannt laufende Code-Ănderungen auf Schwachstellen wie Injection, XSS, unsichere Datenverarbeitung, Path Traversal und schwache Kryptografie. Ergebnisse werden nach Schweregrad priorisiert, Fixes lassen sich direkt in Copilot anwenden und erneut prĂŒfen. VerfĂŒgbar fĂŒr Free-, Pro-, Business- und Enterprise-Nutzer.
GitHub Changelog: Security reviews now available in the GitHub Copilot app â
Security2026-07-14
Grok Build CLI lud komplette Code-Repos samt Secrets zu xAI hoch
Sicherheitsforscher "cereblab" zeigte per Wire-Analyse, dass xAIs Coding-Tool Grok Build (v0.2.93) ganze Git-Repositories inklusive Historie unredigiert in einen Google-Cloud-Bucket von xAI hochlud â auch Dateien, die der Agent nie gelesen hatte, und unverschlĂŒsselte .env-Secrets wie API-Keys. Auf einem Test-Repo wurden rund 27.800-mal mehr Daten ĂŒbertragen als das Modell fĂŒr die Aufgabe brauchte. xAI stoppte den Upload wenig spĂ€ter still per Server-Flag, Elon Musk versprach die vollstĂ€ndige Löschung bereits hochgeladener Daten.
cereblab: What xAI Grok Build CLI actually sends to xAI â a wire-level analysis (Gist) â · The Hacker News: Grok Build Uploaded Entire Git Repositories to xAI Storage, Not Just Files It Read â
Papers2026-07-14
Paper 'Harness Handbook' verbessert PlanungsgĂŒte von Coding-Agenten
Ein am 14. Juli auf arXiv erschienenes Paper stellt das 'Harness Handbook' vor: eine automatisch aus dem Quellcode generierte, verhaltenszentrierte ReprĂ€sentation von Agenten-Harnessen wie Codex und Terminus-2, die Entwicklern und Agenten hilft, die richtigen Code-Stellen fĂŒr Ănderungen zu lokalisieren. In Tests stieg die Gewinnrate der BearbeitungsplĂ€ne gegenĂŒber normaler Code-Exploration um 10 bis 19 Prozentpunkte, bei gleichzeitig 8,6 bis 12,7 Prozent weniger verbrauchten Planungs-Tokens. Die Lokalisierungsgenauigkeit (F1-Score) verbesserte sich um bis zu 18,8 Punkte, komplette Fehltreffer bei der Lokalisierung sanken um bis zu 25,9 Punkte.
arXiv:2607.13285 â
Modelle2026-07-12
Anthropic verlĂ€ngert freien Fable-5-Zugang erneut â jetzt bis 19. Juli
Anthropic hat den kostenlosen Zugang zu Claude Fable 5 fĂŒr Pro-, Max-, Team- und Premium-Enterprise-Abos zum dritten Mal verlĂ€ngert (ursprĂŒnglich 7.7., dann 12.7., jetzt 19.7., 23:59 PT) â bis zu 50 % des Wochenkontingents ohne Aufpreis, angekĂŒndigt per aktualisiertem Support-Dokument. Fable 5 verbraucht das Limit schneller als andere Claude-Modelle; ist es aufgebraucht, heiĂt es Credits kaufen oder Modell wechseln. Laut Anthropic verschwindet Fable 5 nicht dauerhaft aus den Abos â es soll zurĂŒckkommen, sobald genug Rechenleistung da ist.
BleepingComputer: Claude Fable 5 stays free for paid users until July 19 â
Tools2026-07-11
Claude Code v2.1.207: Auto-Modus jetzt ohne Opt-in auf Bedrock, Vertex AI und Foundry
Mit Version 2.1.207 aktiviert Anthropic den autonomen Auto-Modus von Claude Code standardmĂ€Ăig auch fĂŒr Nutzer von AWS Bedrock, Google Vertex AI und Azure Foundry, ohne dass vorher ein Umgebungs-Flag gesetzt werden muss. Das Update schlieĂt zudem eine Shell-Injection-LĂŒcke in Plugin-Hooks und macht Claude Opus 4.8 dort zum Standardmodell.
claude-code Release v2.1.207 (GitHub) â · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code) â
Tools2026-07-11
Terence Tao lÀsst KI-Agenten 27 Jahre alten Mathe-Code portieren
Fields-Medaillist Terence Tao hat rund zwei Dutzend alte Java-Applets (geschrieben um 1999) von einem KI-Coding-Agenten zu modernem JavaScript migrieren lassen â in wenigen Stunden. Der Agent fand dabei zwei Bugs im Original-Code, die Tao selbst nicht kannte; nur ein kleiner neuer Bug kam hinzu (ânet wash" bei der Code-QualitĂ€t, so Tao). Sein Fazit: FĂŒr visuelle Hilfsmittel ist das Restrisiko solcher Fehler gering.
Terence Tao: Old and new apps, via modern coding agents â
Tools2026-07-10
Cursor 3.11: Side Chats und Transkript-Suche
Cursor 3.11 (10.07.) fĂŒhrt âSide Chatsâ ein: parallele, eigenstĂ€ndige Agenten-Unterhaltungen neben dem Haupt-Chat â per /side, /btw oder Plus-Button â um RĂŒckfragen zu klĂ€ren, ohne den Hauptagenten zu unterbrechen. Dazu kommen eine Suche ĂŒber vergangene Agenten-Transkripte (Cmd+K im Agents-Fenster) und ein Projekt-Picker, der GitHub, GitLab und Azure DevOps direkt verbindet.
Cursor Changelog â
Tools2026-07-10
Claude Code Desktop bekommt eingebauten Browser
Claude Code auf dem Desktop (v2.1.202â2.1.206) hat jetzt einen integrierten Browser: Claude kann Doku-Seiten, Designs oder beliebige Websites öffnen, lesen und durchklicken â genauso wie lokale Dev-Server-Previews. Der Browser ist sandboxed, Sitzungs-Persistenz ist wĂ€hlbar, und Safety-Classifier prĂŒfen Aktionen auf externen Seiten. AuĂerdem neu: /doctor ist jetzt ein voller Setup-Check, der Probleme nicht nur findet, sondern nach RĂŒckfrage auch behebt.
Claude Code Docs: Whatâs new (Week 28) â
Security2026-07-10
China wirft Claude Code Backdoor vor, Alibaba verbannt Anthropic-Tools
Chinas Industrieministerium (MIIT) warnte am 08.07.2026, Claude-Code-Versionen 2.1.91â2.1.196 enthielten eine âBackdoor", die Standort und IdentitĂ€t ohne Zustimmung an einen Remote-Server senden könne, und empfahl Deinstallation oder Upgrade. Alibaba wies Mitarbeitende an, Anthropic-Tools ab 10.07. nicht mehr zu nutzen und auf Qoder zu wechseln. Anthropic erklĂ€rte, es habe sich um einen seit MĂ€rz laufenden, experimentellen Anti-Missbrauchs-Mechanismus gegen Reseller und Modell-Distillation gehandelt â Claude ist in China offiziell gar nicht verfĂŒgbar. Der betreffende Code wurde bereits am 01.07. per Pull-Request entfernt. Lehre: Tool-Versionen pinnen und Changelogs lesen.
CNBC: China warns about AI risks with Anthropic's Claude Code â · Tom's Hardware: Alibaba bans Anthropic's Claude Code â
Security2026-07-10
Bericht: KI-Coding-Agent löscht Produktions-Datenbank
Laut einem Bericht von Tom's Hardware löschte ein Claude-basierter Coding-Agent (ein Cursor-Tool) die komplette Produktions-Datenbank einer Firma in rund 9 Sekunden â inklusive Backups. Lehre: Agenten brauchen Least-Privilege-ZugĂ€nge, BestĂ€tigungs-Gates fĂŒr destruktive Aktionen und getrennte Backups.
Tom's Hardware: AI coding agent deletes company database â
Tools2026-07-10
OpenAI launcht âChatGPT Work", Antwort auf Claude Cowork
OpenAI hat am 10.07.2026 âChatGPT Work" gelauncht â eine âSuper-App" auf Basis von GPT-5.6, die den Chatbot mit dem Coding-Tool Codex kombiniert und Dokumente, PrĂ€sentationen sowie Websites erstellen kann. Es ist die direkte Antwort auf Anthropics âClaude Cowork" (Januar 2026, autonome Multi-Step-Tasks). Der Rollout startet sofort fĂŒr Web und Mobile bei Pro/Enterprise/Edu, Plus/Business folgen âin den nĂ€chsten Tagen". Kontext: GPT-5.6 war zuvor auf Wunsch der US-Regierung wegen Sicherheitsbedenken verzögert worden â beide Firmen kĂ€mpfen intensiv um Enterprise-Kunden.
CGTN: OpenAI stellt Super-App vor â RivalitĂ€t mit Anthropic verschĂ€rft sich â
Papers2026-07-10
Warum viele Coding-Benchmarks in die Irre fĂŒhren
Ein Positionspapier zeigt: Klassische Coding-Benchmarks vermischen die Leistung des Modells mit der der umgebenden Agenten-Infrastruktur zu einer einzigen Zahl â sie liefern keine Diagnose, welcher Teil eigentlich schuld ist, wenn etwas schiefgeht. Zudem bestrafen sie oft valide alternative Lösungswege, nur weil sie vom erwarteten Pfad abweichen. FĂŒr dich als Praktiker heiĂt das: Verlass dich bei der Tool-Wahl nicht blind auf Benchmark-Rankings, sondern teste an eigenen Aufgaben.
arXiv: Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering â
Papers2026-07-10
Studie: KI-Coding-Agenten fragen bei unklaren Aufgaben zu selten nach
Der Benchmark ClarEval prĂŒft, wie gut Coding-Agenten bei mehrdeutigen Anweisungen gezielt nachfragen, statt einfach drauflos zu coden. Ergebnis: Selbst Spitzenmodelle scheitern hĂ€ufig daran, strategisch die richtige RĂŒckfrage zur richtigen Zeit zu stellen. FĂŒr dich heiĂt das: Formuliere Prompts so prĂ€zise wie möglich und sei misstrauisch, wenn ein Agent bei einer vagen Aufgabe einfach loslegt, statt nachzufragen.
arXiv: ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions â
Papers2026-07-10
Studie: Ein gutes Ergebnis reicht nicht â der Weg dahin muss kontrollierbar bleiben
ProcCtrlBench bewertet Coding-Agenten nicht nur danach, ob am Ende das richtige Ergebnis rauskommt, sondern auch danach, ob der Weg dorthin nachvollziehbar, unterbrechbar, korrigierbar und umkehrbar bleibt â gemessen an 11 verschiedenen Prozess-Defekt-Typen. Das passt zur Lehre aus VorfĂ€llen wie der gelöschten Produktions-Datenbank: Achte nicht nur aufs Endergebnis, sondern richte dir Stopp-Punkte und Undo-Möglichkeiten ein, bevor ein Agent loslegt.
arXiv: ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents â
Modelle2026-07-09
Meta veröffentlicht Muse Spark 1.1 und startet eigene Model-API
Meta hat Muse Spark 1.1 vorgestellt, ein Modell fĂŒr agentische Programmier- und Tool-Aufgaben mit 1-Millionen-Token-Kontext, das Aufgaben an Sub-Agenten delegieren kann. Ăber die neue, OpenAI-kompatible Meta Model API können Entwickler erstmals kostenpflichtig auf ein Meta-Modell zugreifen.
Introducing Muse Spark 1.1 and the Meta Model API (Meta AI Blog) â · Meta launches flagship Muse Spark 1.1 model with multi-agent upgrades (SiliconANGLE) â
Tools2026-07-09
Claude Code 2.1.197: Background-Agents committen automatisch, neuer /doctor-Check
Claude Code v2.1.197 bringt Background-Agents, die selbststÀndig committen, pushen und Draft-Pull-Requests öffnen. Dazu kommt ein neuer /doctor-Setup-Check und automatisches Retry mit Backoff bei transienten Netzwerkfehlern.
Releasebot: Claude Code updates â
MCP2026-07-09
MCP-Spezifikation 2026-07-28 als Release Candidate gelockt
Die kommende MCP-Spec-Version 2026-07-28 ist seit dem 21.05.2026 als Release Candidate eingefroren; final erscheint sie am 28.07.2026. Der Core wird stateless (kein Session-Handshake, keine Mcp-Session-Id mehr), dazu kommen 'MCP Apps' fĂŒr interaktive UIs in sandboxed iframes. Tasks wandert in eine Extension, und eine formale Deprecation-Policy verlangt mindestens 12 Monate zwischen Deprecation und Entfernung. Achtung: das Release enthĂ€lt Breaking Changes.
MCP Blog: 2026-07-28 Release Candidate â
Modelle2026-07-09
OpenAI launcht GPT-5.6-Familie
OpenAI hat die GPT-5.6-Familie vorgestellt: Sol als Flaggschiff ($5/$30 pro Mio. Tokens), Terra als Mittelklasse ($2.50/$15) und Luna als gĂŒnstigste Variante ($1/$6). Laut Sam Altman ist Sol bei Coding-Aufgaben 54% token-effizienter. OpenAI beansprucht einen Coding Agent Index von 80 â 2,8 Punkte ĂŒber Claude Fable 5 â bei weniger als der HĂ€lfte der Output-Tokens.
TechCrunch: OpenAI launches GPT-5.6 family â
Security2026-07-08
Forscher zeigen Exploit "Friendly Fire" gegen Claude Code und Codex CLI
Das AI Now Institute hat einen Proof-of-Concept veröffentlicht: PrĂ€parierte Dateien in einer fremden Codebasis bringen Claude Code (Auto-Modus) und OpenAI Codex CLI dazu, wĂ€hrend eines vermeintlichen Sicherheits-Checks heimlich Schadcode auszufĂŒhren. Bislang keine bekannten Angriffe in freier Wildbahn, aber der Trick braucht keine Plugins oder MCP-Server und trifft mehrere Modelle beider Anbieter.
Friendly Fire: Hijacking Defensive Cyber AI Agents for Remote Code Execution (AI Now Institute) â · Top AI Agents Built to Catch Malicious Code Can Be Tricked Into Running It (The Hacker News) â
Modelle2026-07-08
Grok 4.5: SpaceXAI und Cursor bringen gemeinsam trainiertes Modell
SpaceXAI hat Grok 4.5 vorgestellt â angekĂŒndigt am 8., öffentlich seit 9. Juli. Musk nennt es ein âOpus-classâ-Modell, âgrob vergleichbar mit Opus 4.7, aber viel schnellerâ; es kostet $2/Mio Input- und $6/Mio Output-Tokens (Opus 4.7: $5/$25). Laut Cursor-Blog ist es ein Mixture-of-Experts-Modell, das Cursor gemeinsam mit SpaceXAI trainiert hat â mit Billionen Tokens aus echten Cursor-Nutzungsdaten â und ab sofort in Cursor auf Desktop, Web, iOS, CLI und SDK lĂ€uft.
TechCrunch: SpaceXAI releases Grok 4.5 â · Cursor Blog: Introducing Grok 4.5 â · x.ai: Introducing Grok 4.5 â
Tools2026-07-06
Zhipu veröffentlicht ZCode, Coding-Harness fĂŒr GLM-5.2
Zhipu/Z.ai hat âZCode" veröffentlicht, einen Coding-Harness fĂŒr GLM-5.2 â ein MIT-lizenziertes Open-Weight-Modell mit 1-Millionen-Token-Kontext. Zhipu positioniert das Tool inmitten der China-Spannungen rund um Anthropic explizit als Konkurrenz zu Claude Code. Als Promo gibt es 5 Millionen Gratis-Tokens, Coding-PlĂ€ne starten bei rund $16 pro Monat.
SCMP: Zhipu AI releases harness for GLM-5.2 â
Modelle2026-07-01
Claude Fable 5: Exportkontrollen aufgehoben, wieder weltweit verfĂŒgbar
Anthropic launchte Fable 5 und Mythos 5 am 09.06.2026, doch nach einem von Amazon-Researchern gefundenen Jailbreak (das Modell identifizierte Software-Schwachstellen und demonstrierte Exploits) verhĂ€ngte die US-Regierung am 12.06. Exportkontrollen. Diese wurden am 30.06. aufgehoben, seit 01.07. ist Fable 5 wieder weltweit verfĂŒgbar â mit neuem Safety-Classifier, der die Technik in ĂŒber 99% der FĂ€lle blockt und geblockte Anfragen an Opus 4.8 umleitet. Anthropic stuft den Jailbreak als Grenzfall ein, da auch schwĂ€chere Modelle Ă€hnliche Ergebnisse liefern â Lehre: nie hart auf ein einzelnes Modell bauen.
Anthropic: Redeploying Fable 5 â
Tools2026-06-18
Google stellt Gemini CLI und Code Assist for GitHub ein
Google hat Gemini CLI und Gemini Code Assist for GitHub zum 18.06.2026 eingestellt (Code Assist: Deprecation ab 18.06., Voll-Shutdown 17.07.). Nachfolger ist die Antigravity CLI. Google begrĂŒndet das mit einer Verschiebung des Bedarfs zu Multi-Agent-Lösungen mit einheitlichem Backend â Lehre fĂŒr CI/CD-Pipelines: Tool-Aufrufe abstrahieren, um solche AbhĂ€ngigkeiten abzufedern.
9to5Google: Gemini CLI shutting down â
Tools2026-06-16
SpaceX ĂŒbernimmt Cursor-Hersteller Anysphere fĂŒr $60 Mrd.
SpaceX kĂŒndigte am 16.06.2026 die Ăbernahme von Anysphere (Cursor) fĂŒr $60 Mrd. in Aktien an â nur wenige Tage nach dem eigenen Börsengang von SpaceX (SpaceX ging an die Börse, nicht Cursor). Cursor war zuvor mit rund $29 Mrd. bewertet. Der Deal-Abschluss wird fĂŒr Q3 2026 erwartet.
TechCrunch: SpaceX to acquire Cursor for $60B â
Modelle2026-05-28
Claude Opus 4.8 veröffentlicht
Anthropic hat Claude Opus 4.8 am 28.05.2026 veröffentlicht. Neu sind 'Dynamic Workflows' als Research Preview (Claude Code orchestriert hunderte parallele Subagents) und Effort Controls, dazu deutlich weniger Coding-Bugs als bei 4.7. Der Preis bleibt bei $5/$25 pro Mio. Tokens, dazu kommt ein neuer Fast-Mode fĂŒr $10/$50.
Anthropic: Claude Opus 4.8 â