promptgarten 🌱

Feed

Lo que está pasando ahora en el mundo de la IA — curado, verificado, con fuentes.

📡 RSS

Seguridad2026-07-30

Anthropic: Claude accedió a sistemas reales de tres empresas durante pruebas de seguridad

Tras revisar 141.006 ejecuciones de evaluaciones de ciberseguridad, Anthropic reveló tres incidentes en los que modelos Claude alcanzaron la Internet abierta desde el entorno de pruebas del socio Irregular y accedieron sin autorización a los sistemas de producción de tres organizaciones ajenas. No se trató de una fuga (breakout): el prompt indicaba a los modelos que estaban en una simulación sin acceso a Internet — pero, debido a un malentendido entre Anthropic y el socio, el acceso estaba de hecho abierto. Los modelos consideraron que los objetivos reales formaban parte de un ejercicio de Capture-the-Flag y explotaron contraseñas débiles y endpoints desprotegidos. Se vieron afectados Opus 4.7, Mythos 5 y un modelo de prueba interno; Anthropic detuvo a raíz de ello todas las evaluaciones de ciberseguridad.

Anthropic: Investigating three real-world incidents in our cybersecurity evaluations · SecurityAffairs: Anthropic Finds Claude Breached Real Companies During Security Evaluations

Herramientas2026-07-30

VS Code agrupa las novedades de julio para Copilot: Worktrees, multichat, Vision

GitHub resume las novedades de Copilot en las versiones 1.127 a 1.131 de VS Code, publicadas en julio. El panel de Agents recibe un diseño renovado con una vista de diferencias más compacta y permite que las sesiones de Copilot, Claude y Codex se ejecuten opcionalmente en worktrees de Git aislados. Como novedad se incorporan sesiones multichat con chats paralelos ramificables, soporte de imágenes en el chat ahora disponible con carácter general, y compatibilidad con modelos BYOK (bring your own key) en el panel de Agents. Los usuarios de Business y Enterprise pueden ver además su consumo de crédito de IA del período de facturación en curso directamente en el menú de estado de Copilot.

GitHub Changelog: GitHub Copilot in Visual Studio Code, July 2026 releases · Visual Studio Code 1.131 Release Notes

MCP2026-07-29

La revisión de código de Copilot ahora integra Agent Skills y servidores MCP de forma estándar

GitHub ha puesto fin a la vista previa anunciada en junio: Copilot Code Review ahora admite de forma estándar tanto Agent Skills como servidores MCP para todos los usuarios de Pro, Pro+, Business y Enterprise. Mediante un archivo SKILL.md en .github/skills se pueden incorporar herramientas y estándares internos del equipo; las conexiones MCP incorporan a la revisión contexto de plataformas externas como los rastreadores de incidencias (issue trackers), y las llamadas a herramientas quedan limitadas a acceso de lectura. Las configuraciones MCP establecidas para el agente en la nube se aplican automáticamente también aquí, y GitHub MCP y Playwright MCP están activos de forma predeterminada. Los comentarios indicarán en adelante cuándo se basan en Skills o en contexto MCP.

GitHub Changelog: Copilot code review: Agent skills and MCP now generally available

MCP2026-07-28

Especificación MCP 2026-07-28 final: el protocolo pasa a ser sin estado

La especificación MCP 2026-07-28 se ha publicado en versión final y rompe con el protocolo anterior: el protocolo de enlace de sesión (initialize/initialized) y la cabecera Mcp-Session-Id desaparecen, MCP pasa a ser sin estado y autodescriptivo por solicitud, y los servidores podrán escalarse en el futuro tras simples balanceadores de carga round-robin. Las solicitudes del lado del servidor como Sampling, Elicitation y Roots ahora se ejecutan mediante el nuevo patrón Multi-Round-Trip en lugar de streams bidireccionales abiertos. Tasks pasa del núcleo a una extensión propia. Roots, Sampling, Logging y el transporte HTTP+SSE quedan ahora obsoletos (deprecated), con un período de transición de al menos doce meses. Los servidores y clientes MCP existentes deberán adaptarse a la nueva versión.

GitHub Release 2026-07-28 (modelcontextprotocol/modelcontextprotocol) · MCP Changelog: Key Changes seit 2025-11-25 · MCP Blog: The 2026-07-28 Specification

Herramientas2026-07-28

Grok 4.5 llega a GitHub Copilot

xAI ha puesto su modelo Grok 4.5 a disposición en GitHub Copilot, seleccionable en el selector de modelos de VS Code, Visual Studio, Copilot CLI y otras interfaces de Copilot. Grok 4.5 ofrece una ventana de contexto de hasta 500.000 tokens, procesa entradas de texto e imagen y puede configurarse en tres niveles de razonamiento. GitHub cita pruebas internas con buenos resultados en tareas de programación basadas en terminal y uso paralelo de herramientas. El despliegue se realiza de forma progresiva para Copilot Pro, Pro+, Max, Business y Enterprise, facturado a los precios de lista de xAI.

GitHub Changelog: Grok 4.5 is now available in GitHub Copilot · xAI News: Grok 4.5 in GitHub Copilot

Seguridad2026-07-28

npm escaneará automáticamente los paquetes al publicarlos

npm introduce un análisis automático de malware para los paquetes recién publicados antes de que puedan instalarse: según el resultado, los paquetes se liberan, se retienen para revisión manual o se bloquean. Esto suele retrasar la disponibilidad unos minutos, y más en momentos de mucha carga. Los mantenedores suspendidos pueden presentar una apelación, aunque en algunos casos pueden aplicarse medidas adicionales sobre la cuenta. npm introduce además un campo contentPolicy en package.json para paquetes legítimos que se asemejan a malware, como las herramientas de seguridad. Estos paquetes de doble uso requieren un archivo DISCLOSURE que explique su propósito y funcionamiento, revisado por el equipo de Trust & Safety.

GitHub Changelog: npm publish-time malware scanning and dual-use metadata

Seguridad2026-07-27

NVIDIA y líderes del sector lanzan la Open Secure AI Alliance

NVIDIA ha fundado la Open Secure AI Alliance junto con otras organizaciones; el anuncio menciona entre sus miembros a Microsoft, IBM, Cisco, Cloudflare, CrowdStrike, Databricks, Hugging Face, LangChain, Cognition y la Linux Foundation. El objetivo es el intercambio abierto de herramientas para proteger a los agentes de IA: identidad, gestión de permisos, aislamiento, guardrails, registro de actividad y flujos de trabajo de codificación seguros. La primera contribución técnica es NOOA (NVIDIA Labs Object-Oriented Agent), un framework de código abierto bajo licencia Apache-2.0 que modela el comportamiento de los agentes como código Python testable y versionable, en lugar de prompts dispersos y esquemas de herramientas.

Industry Leaders Unite in Open Secure AI Alliance (NVIDIA Blog) · NVIDIA-NeMo/labs-OO-Agents (GitHub)

Herramientas2026-07-27

La app de GitHub Copilot obtiene su propia política de acceso y control centralizado

GitHub ha incorporado la app de Copilot y el agente en la nube de Copilot a la configuración empresarial gestionada de forma centralizada. Las organizaciones pueden usar ahora un archivo managed-settings.json compartido para definir qué plugins y mercados pueden usar los desarrolladores y si se pueden omitir las solicitudes de aprobación; hasta ahora esto solo aplicaba a Copilot CLI y VS Code. Además, la app de Copilot recibe una política de acceso propia, independiente de la de la CLI, a nivel de empresa y organización, activada por defecto para todos los usuarios. Los administradores pueden permitir o bloquear el acceso por organización, o delegar la decisión en administradores de la organización.

GitHub Changelog: Enterprise managed settings in the GitHub Copilot app and Copilot cloud agent · GitHub Changelog: Manage GitHub Copilot app access with a dedicated policy

Modelos2026-07-27

Kimi K3: los pesos ya son descargables en Hugging Face

Kimi K3 se anunció el 16 de julio, pero los pesos no estuvieron disponibles hasta ahora. Desde el 27 de julio están disponibles para descarga en moonshotai/Kimi-K3 — sin restricciones de acceso, bajo la licencia propia Kimi-K3. La ficha del modelo indica 2,8 billones de parámetros, Kimi Delta Attention con Attention Residuals, una ventana de contexto de 1 millón de tokens y procesamiento nativo de texto, imagen y video dentro del mismo modelo. Esto permite por primera vez el autoalojamiento, en lugar de depender únicamente de la API de Moonshot.

moonshotai/Kimi-K3 (Hugging Face) · Tech Times: Kimi K3 Open Weights Arrive Sunday

Modelos2026-07-24

Anthropic lanza Claude Opus 5 con contexto de 1 millón de tokens y control de esfuerzo

Anthropic presentó Claude Opus 5: una ventana de contexto de 1 millón de tokens, el pensamiento activado por defecto y un nuevo control de esfuerzo (bajo/medio/alto) para equilibrar coste y rendimiento. Los precios se mantienen en $5/$25 por millón de tokens, igual que en Opus 4.8, mientras que el Fast Mode, más rápido, cuesta el doble. En Claude Code (desde la v2.1.219), Opus 5 es desde entonces el nuevo Opus predeterminado para agentes de código.

Claude Opus 5 · Anthropic releases Claude Opus 5: Here's how it's different than what's already out there

Herramientas2026-07-24

GitHub Copilot habilita Gemini 3.6 Flash y Opus 5 en una semana

GitHub Copilot (incl. Copilot CLI) habilitó dos nuevos modelos en el plazo de una semana: Gemini 3.6 Flash el 21 de julio, con esfuerzo de razonamiento configurable y uso paralelo de herramientas, y Claude Opus 5 el 24 de julio, para tareas de programación largas y agénticas. Ambos están disponibles según el plan a partir de Copilot Pro o Pro+, y se facturan según el uso al precio de lista del proveedor.

Gemini 3.6 Flash is now available in GitHub Copilot · Claude Opus 5 is now available in GitHub Copilot

Herramientas2026-07-22

Cursor presenta "Cursor Router" para la selección automática de modelo

Cursor presentó Cursor Router: un sistema que dirige automáticamente cada solicitud al modelo más adecuado según la tarea, el contexto y la complejidad, seleccionable mediante los modos Intelligence, Balance o Cost. Según Cursor, en pruebas A/B con millones de solicitudes, el router logró en el modo Intelligence un coste aproximadamente un 60 % menor, con una calidad comparable, frente a la selección manual de modelo.

Introducing Cursor Router · SpaceX unveils Cursor Router

Papers2026-07-22

IssueTrojanBench: dos tercios de los issues maliciosos de GitHub engañan a los agentes de código

El paper IssueTrojanBench pone a prueba a Cursor, Claude Code y Codex Desktop con instrucciones maliciosas disfrazadas de issues de GitHub, distribuidas a través de seis vías (entre ellas PDFs y comentarios en issues). Resultado: el 66,5 % de los issues maliciosos eludió todos los mecanismos de protección de los agentes; los rechazos provinieron casi exclusivamente del LLM subyacente (Sonnet 4.6 más selectivo que los modelos GPT), casi nunca del propio framework del agente.

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

MCP2026-07-22

Comentarios de PR invisibles secuestran agentes de IA a través del servidor MCP de Azure DevOps

Investigadores de seguridad de Manifold Security encontraron una vulnerabilidad en el servidor MCP oficial de Azure DevOps de Microsoft: una única herramienta reenvía sin filtrar comentarios HTML invisibles de las descripciones de pull requests a los agentes de IA (prompt injection), secuestrando así sus objetivos, de modo que actúan con los permisos del revisor sobre proyectos ajenos. La causa: precisamente esta herramienta no utiliza el marcado "spotlighting" que Microsoft emplea normalmente para señalar contenido no confiable; aún está pendiente una corrección o un CVE.

Microsoft Azure DevOps MCP Flaw Lets Hidden PR Comments Hijack AI Review Agents · When Your AI Reviewer Works for the Attacker: A Confused-Deputy Bug in Microsoft's Azure DevOps MCP Server

Modelos2026-07-21

Google presenta Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber

Google ha lanzado tres nuevos modelos: Gemini 3.6 Flash, el más económico 3.5 Flash-Lite y el 3.5 Flash Cyber, especializado en ciberseguridad, mientras que una actualización de Gemini 3.5 Pro sigue sin aparecer. Según Google, 3.6 Flash reduce el consumo de tokens de salida en un 17 % frente a 3.5 Flash y mejora en el benchmark de programación MLE-Bench del 49,7 % al 63,9 %. Disponible, entre otros, a través de AI Studio, la Gemini API, Android Studio, Antigravity y Vertex AI.

Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber · Google releases three new Gemini models — but no 3.5 Pro

Herramientas2026-07-21

Codex CLI 0.145.0: historial de hilos con búsqueda e importación desde Cursor/Claude Code

OpenAI lanzó Codex CLI 0.145.0: un historial de hilos paginado y con búsqueda, con nombres persistentes, un comando /import ampliado que traslada configuraciones, servidores MCP, plugins y sesiones desde Cursor y Claude Code, además de un Multi-Agent V2 estabilizado con modelos de subagente configurables. Además, el inicio de sesión a través de Amazon Bedrock ahora usa GPT-5.6 Sol como modelo predeterminado.

Codex changelog

Seguridad2026-07-18

Claude Code 2.1.214 cierra un bypass de permisos en Windows PowerShell

El 18 de julio de 2026, Anthropic lanzó Claude Code 2.1.214, en el que corrigió varias vulnerabilidades de seguridad en la comprobación de permisos: un bypass permitía eludir los controles de permisos en sesiones de Windows PowerShell 5.1, y las comprobaciones de Bash para redirecciones de descriptores de archivo, así como para comandos de más de 10.000 caracteres, ahora fallan de forma cerrada (fail-closed) en lugar de pasar automáticamente. Además, se corrigió un error por el cual reglas de permiso individuales como "Edit(src/**)" permitían por error el acceso de escritura a directorios con el mismo nombre en todo el árbol del repositorio, en lugar de limitarse al directorio de trabajo. También se añadió una nueva herramienta EndConversation, con la que Claude puede finalizar activamente sesiones con usuarios abusivos o intentos de jailbreak.

GitHub Release v2.1.214 (anthropics/claude-code) · Claude Code CHANGELOG.md

Modelos2026-07-17

Fable 5 se vuelve permanente para Max/Team Premium, Pro pasará a facturación por API

Anthropic anunció el 17 de julio que Claude Fable 5 permanecerá de forma permanente incluido en la cuota de las suscripciones Max y Team Premium a partir del 20 de julio, aunque limitado al 50 por ciento de los límites de uso semanal habituales. Los usuarios de Pro y Team Standard pierden el acceso incluido, pero reciben un crédito único de 100 dólares y después pagan tarifas de API de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. El cambio de rumbo pone fin a tres prórrogas consecutivas de lo que originalmente era una promoción gratuita de una semana (con el vencimiento más reciente fijado para el 19 de julio) y, según informes, responde a la presión competitiva de GPT-5.6 Sol de OpenAI y Kimi K3 de Moonshot.

Tech Times: Claude Fable 5 Ends Subscription Limbo · Simon Willison: Claude make Fable 5 permanent

Herramientas2026-07-17

GitHub Copilot Code Review ahora funciona por defecto detrás de un firewall

GitHub publicó el 17 de julio mejoras para Copilot Code Review: la función de revisión automática de PR ahora se ejecuta por defecto detrás de un firewall con acceso de red restringido, configurable de forma independiente del Copilot Cloud Agent. Las Custom Instructions ahora se leen desde la rama head del pull request en lugar de la rama base, lo que facilita probar y validar las instrucciones de revisión propias. Además, la configuración de runner que antes compartían Code Review y Cloud Agent se dividió en dos secciones de configuración independientes dentro de la configuración de la organización.

GitHub Changelog: Copilot code review customization and configurability improvements

Modelos2026-07-17

Kimi K3 se sitúa en el primer puesto de la Frontend Code Arena; las acciones de IA sufren presión

Nuevos datos de referencia del 17 de julio de 2026 muestran que el modelo de 2,8 billones de parámetros Kimi K3, de Moonshot AI, lidera la Frontend Code Arena con 1.679 puntos, por delante de Claude Fable 5 (1.631), GPT-5.6 Sol (1.618) y GLM-5.2 (1.587). En la clasificación general, K3 sigue por detrás de Fable 5 y GPT-5.6 Sol según Moonshot, pero supera a todos los demás modelos evaluados. Según CNBC, el anuncio provocó una fuerte caída de las acciones rivales de IA y semiconductores; el analista Patrick Moorhead calificó la reacción del mercado de "sobrerreacción, inquietantemente similar al pánico de DeepSeek".

CNBC · Tom's Hardware

MCP2026-07-17

GitHub Copilot CLI ahora gestiona servidores MCP mediante flags

Con la versión 1.0.72-1 del 17 de julio, GitHub dotó a Copilot CLI de flags nativos para la gestión de plugins: --plugin, --mcp y --skill permiten añadir o eliminar servidores MCP, skills y plugins directamente desde la terminal, junto con un comando copilot plugins remove --skill para eliminar skills individuales. Esto acerca la gestión de servidores MCP en Copilot CLI al flujo de trabajo de otros agentes de codificación, donde la configuración a menudo se realizaba mediante la edición manual de archivos de configuración.

GitHub – github/copilot-cli Releases

Papers2026-07-16

Estudio: los agentes de programación instalan paquetes de READMEs manipulados sin verificarlos

Un paper publicado en arXiv el 16 de julio muestra que los agentes de codificación con IA ejecutan documentación de configuración como READMEs, archivos requirements o Makefiles sin verificar nombres de paquetes, orígenes o vulnerabilidades conocidas. En pruebas con doce escenarios con modelos frontier y cinco clases de ataque (entre ellas redirección de registro, confusión de separadores como 'azurecore' en lugar de 'azure-core', y fijación de versiones a releases vulnerables), casi todos los modelos probados instalaron dependencias sin verificar en los ecosistemas npm y Cargo. El typosquatting evidente se detectó de forma fiable, pero las variantes de nombre plausibles casi siempre pasaron desapercibidas; según el estudio, las verificaciones previas a la instalación cerraron la mayor parte de la brecha de seguridad.

arXiv: Setup Complete, Now You Are Compromised

Herramientas2026-07-16

OpenAI Codex CLI 0.144.5 mejora la detección de comandos peligrosos

El 16 de julio de 2026, OpenAI lanzó Codex CLI 0.144.5. La actualización mejora la detección de comandos de shell peligrosos, ahora detecta más variantes forzadas de rm y ofrece motivos de rechazo más claros para los comandos denegados. Esta versión forma parte de una serie de parches menores (de 0.144.1 a 0.144.5) desde el lanzamiento principal de Codex 0.144 a principios de julio.

Codex Changelog (OpenAI)

Papers2026-07-16

Estudio: las herramientas de codificación agéntica todavía se usan poco de forma intensiva en proyectos de GitHub

Un estudio publicado en arXiv el 15 de julio de 2026 y revisado el 16 de julio ("Early Adoption of Agentic Coding Tools by GitHub Projects", Raida & Hou) analiza 25.264 pull requests creadas por agentes de codificación en 2.361 repositorios populares de GitHub. Resultado: el repositorio mediano genera solo entre una y dos PR agénticas en tres meses, y el uso intensivo se concentra en un pequeño subconjunto de proyectos. Los proyectos pequeños con 1-5 colaboradores muestran tasas de participación en PR agénticas más altas que los proyectos medianos y grandes, mientras que solo unos pocos proyectos superan una cifra de referencia del sector citada de 36 PR por participante en el período de tres meses.

arXiv:2607.14037 - Early Adoption of Agentic Coding Tools by GitHub Projects

Modelos2026-07-16

Moonshot AI lanza Kimi K3 — el modelo de IA abierto más grande del mundo

La empresa china Moonshot AI ha presentado Kimi K3, un modelo abierto de mezcla de expertos (Mixture-of-Experts) con 2,8 billones de parámetros (de los cuales 16 de 896 expertos están activos por solicitud) y un contexto de 1 millón de tokens, construido sobre la nueva arquitectura “Kimi Delta Attention”. Se dice que es el primer modelo abierto de la clase de 3 billones de parámetros y que se acerca en los benchmarks a los mejores modelos propietarios; los pesos completos se publicarán antes del 27 de julio.

Kimi K3 Quickstart (Kimi API Platform) · MarkTechPost: Moonshot AI Releases Kimi K3 — A 2.8 Trillion Parameter Open MoE Model

Seguridad2026-07-16

Hugging Face informa de una intrusión llevada a cabo por un agente de IA autónomo

Hugging Face ha revelado un ataque a partes de su infraestructura de producción que, según la empresa, fue ejecutado de principio a fin por un sistema de agente de IA autónomo — mediante conjuntos de datos manipulados que explotaban una vulnerabilidad de ejecución de código en el pipeline de procesamiento de datos. Se obtuvo acceso a un conjunto limitado de conjuntos de datos internos y a varias credenciales; según Hugging Face, los modelos públicos, los conjuntos de datos, los Spaces y la cadena de suministro de software no se vieron afectados. El incidente se descubrió mediante detección de anomalías impulsada por IA; la empresa advierte de que las herramientas de ataque autónomas basadas en IA “ya no son teóricas”.

Hugging Face: Security incident disclosure — July 2026

Modelos2026-07-16

Google retrasa Gemini 3.5 Pro por un rendimiento de codificación deficiente

Según un informe de Bloomberg del 16 de julio, Google ha retrasado el lanzamiento de Gemini 3.5 Pro, originalmente previsto para junio, porque el modelo no alcanzó los objetivos internos de generación de código. Una actualización de los datos de entrenamiento a finales de junio no supuso una mejora suficiente, según diez empleados actuales y antiguos; Google confirmó que actualmente está probando 3.5 Pro y un modelo Flash mejorado con socios. La noticia hizo caer las acciones de Alphabet cerca de un 4%, subrayando la presión competitiva sobre las capacidades de codificación de los modelos líderes.

9to5Google · CNBC

Seguridad2026-07-16

Gemini CLI 0.51.0 cierra brechas de escape de rutas y symlinks

Google lanzó Gemini CLI 0.51.0 el 16 de julio, corrigiendo varios problemas de seguridad: se corrigieron un escape de directorio basado en symlinks en el procesador de importación de memoria y la falta de resolución defensiva de rutas para archivos @-reference, y la lista de bloqueo de rutas sensibles se hizo insensible a mayúsculas y minúsculas. La nueva versión también hace que ~/.gitconfig sea de solo lectura en modo sandbox en macOS para evitar manipulaciones por parte del modelo. Las correcciones abordan formas concretas en las que un agente podría haber escapado de su directorio de trabajo previsto durante el procesamiento de archivos.

GitHub – google-gemini/gemini-cli Releases

Herramientas2026-07-15

Claude Code 2.1.211 corrige una falla de seguridad en las vistas previas de permisos en canales de chat

La versión 2.1.211 (15 de julio) corrige una falla por la que caracteres Unicode invisibles — anulaciones bidireccionales, caracteres de ancho cero y comillas falsas — en las vistas previas de permisos reenviadas a canales de chat podían distorsionar la entrada de herramienta mostrada, lo que podía inducir a los usuarios a aprobar comandos no deseados. Además, el modo automático ya no puede anular una decisión explícita de “ask” (preguntar) de un hook PreToolUse en comandos bash no aislados (non-sandboxed).

claude-code Release v2.1.211 (GitHub) · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code)

Modelos2026-07-15

Thinking Machines lanza Inkling, su modelo de codificación abierto

La startup de Mira Murati, Thinking Machines Lab, lanzó el 15 de julio su primer modelo de pesos abiertos, Inkling: un modelo de Mezcla de Expertos (Mixture-of-Experts) con 975 mil millones de parámetros totales y 41 mil millones de parámetros activos, un contexto de 1M de tokens, entrenado con 45 billones de tokens de texto, imagen, audio y vídeo. En los benchmarks de codificación alcanza un 77.6% en SWE-bench Verified y un 63.8% en Terminal-Bench 2.1, lo que lo convierte en el modelo abierto estadounidense más potente hasta la fecha. Una variante de vista previa más pequeña, Inkling-Small, tiene 12 mil millones de parámetros activos.

Thinking Machines Lab · TechCrunch

Herramientas2026-07-14

OpenAI Codex crece a 8 millones de usuarios tras el lanzamiento de GPT-5.6

OpenAI informa 8 millones de usuarios activos combinando Codex y ChatGPT Work — un salto desde los 5 millones de principios de junio, impulsado por el lanzamiento de GPT-5.6 el 9 de julio. El líder de Codex, Tibo Sottiaux, anunció en X otro reinicio de los límites de uso; el habitual límite de 5 horas sigue suspendido por ahora.

Tibo Sottiaux (OpenAI): "We have reached 8M active users across Codex and ChatGPT Work" (X) · The New Stack: OpenAI hits 8 million Codex users — what developers need to know

Herramientas2026-07-14

GitHub Copilot obtiene su propio comando de revisión de seguridad en la app

El comando /security-review ya está disponible como Public Preview directamente en la app de GitHub Copilot y analiza los cambios de código en curso en busca de vulnerabilidades como inyección, XSS, manejo inseguro de datos, path traversal y criptografía débil. Los resultados se priorizan por gravedad, y las correcciones se pueden aplicar y volver a verificar directamente en Copilot. Disponible para usuarios Free, Pro, Business y Enterprise.

GitHub Changelog: Security reviews now available in the GitHub Copilot app

Seguridad2026-07-14

Grok Build CLI subía repositorios de código completos, incluidos secretos, a xAI

El investigador de seguridad "cereblab" demostró mediante un análisis a nivel de tráfico ("wire-level") que la herramienta de codificación de xAI, Grok Build (v0.2.93), subía repositorios Git completos, incluido su historial, sin redactar, a un bucket de Google Cloud propiedad de xAI — incluso archivos que el agente nunca había leído, y secretos .env sin cifrar como claves API. En un repositorio de prueba se transfirieron alrededor de 27.800 veces más datos de los que el modelo necesitaba para la tarea. xAI detuvo la subida silenciosamente poco después mediante un indicador de servidor; Elon Musk prometió la eliminación completa de los datos ya subidos.

cereblab: What xAI Grok Build CLI actually sends to xAI – a wire-level analysis (Gist) · The Hacker News: Grok Build Uploaded Entire Git Repositories to xAI Storage, Not Just Files It Read

Papers2026-07-14

El paper 'Harness Handbook' mejora la calidad de planificación de los agentes de codificación

Un paper publicado en arXiv el 14 de julio presenta el 'Harness Handbook': una representación generada automáticamente y centrada en el comportamiento de los harnesses de agentes como Codex y Terminus-2, que ayuda a desarrolladores y agentes a localizar el código correcto que hay que modificar. En las pruebas, la tasa de éxito de los planes de edición aumentó entre 10 y 19 puntos porcentuales frente a la simple exploración de código, usando entre un 8.6 y un 12.7 por ciento menos de tokens de planificación. La precisión de localización (F1) mejoró hasta 18.8 puntos, y los fallos completos de localización se redujeron hasta 25.9 puntos.

arXiv:2607.13285

Modelos2026-07-12

Anthropic vuelve a extender el acceso gratuito a Fable 5 — ahora hasta el 19 de julio

Anthropic extendió por tercera vez el acceso gratuito a Claude Fable 5 en los planes Pro, Max, Team y Enterprise premium (originalmente 7.7, luego 12.7, ahora 19.7, 23:59 PT) — hasta el 50 % de la cuota semanal sin coste extra, anunciado mediante un documento de soporte actualizado. Fable 5 consume el límite más rápido que otros modelos Claude; al agotarse, toca comprar créditos o cambiar de modelo. Según Anthropic, Fable 5 no desaparecerá de las suscripciones de forma permanente: volverá cuando haya suficiente capacidad de cómputo.

BleepingComputer: Claude Fable 5 stays free for paid users until July 19

Herramientas2026-07-11

Claude Code v2.1.207: Auto mode ahora activo sin opt-in en Bedrock, Vertex AI y Foundry

Con la versión 2.1.207, Anthropic activa por defecto el Auto mode autónomo de Claude Code también para los usuarios de AWS Bedrock, Google Vertex AI y Azure Foundry, sin necesidad de establecer antes un flag de entorno. La actualización también cierra una vulnerabilidad de shell injection en los plugin hooks y convierte a Claude Opus 4.8 en el modelo por defecto ahí.

claude-code Release v2.1.207 (GitHub) · Claude Code CHANGELOG.md (GitHub, anthropics/claude-code)

Herramientas2026-07-11

Terence Tao deja que agentes de IA porten código matemático de hace 27 años

El medallista Fields Terence Tao hizo que un agente de programación con IA migrara unas dos docenas de applets Java antiguos (escritos hacia 1999) a JavaScript moderno — en cuestión de horas. El agente encontró dos bugs en el código original que el propio Tao desconocía; solo se coló un pequeño bug nuevo (un “empate técnico” en calidad de código, según Tao). Su conclusión: para ayudas visuales, el riesgo residual de estos errores es bajo.

Terence Tao: Old and new apps, via modern coding agents

Herramientas2026-07-10

Cursor 3.11: side chats y búsqueda de transcripciones

Cursor 3.11 (10 de julio) introduce los «Side Chats»: conversaciones de agente paralelas e independientes junto al chat principal — con /side, /btw o el botón más — para resolver dudas sin interrumpir al agente principal. Añade también búsqueda en transcripciones de agentes pasadas (Cmd+K en la ventana Agents) y un selector de proyectos que conecta GitHub, GitLab y Azure DevOps directamente.

Cursor Changelog

Herramientas2026-07-10

Claude Code Desktop recibe un navegador integrado

Claude Code en escritorio (v2.1.202–2.1.206) ahora tiene un navegador integrado: Claude puede abrir documentación, diseños o cualquier sitio web, leer y hacer clic — igual que con las previews de tu servidor de desarrollo local. El navegador está aislado (sandbox), la persistencia de sesión es configurable y clasificadores de seguridad revisan las acciones en sitios externos. Además: /doctor es ahora una revisión completa de tu instalación que no solo encuentra problemas, sino que los arregla tras confirmación.

Claude Code Docs: What’s new (Week 28)

Seguridad2026-07-10

China acusa a Claude Code de tener una backdoor, Alibaba prohíbe las herramientas de Anthropic

El Ministerio de Industria y Tecnologías de la Información de China (MIIT) advirtió el 08/07/2026 de que las versiones 2.1.91-2.1.196 de Claude Code contenían una 'backdoor' capaz de enviar datos de ubicación e identidad a un servidor remoto sin consentimiento, y recomendó desinstalarlas o actualizarlas. Alibaba ordenó a sus empleados dejar de usar herramientas de Anthropic a partir del 10/07 y pasarse a Qoder. Anthropic explicó que se trataba de un mecanismo experimental antiabuso activo desde marzo, dirigido contra revendedores y la destilación de modelos; Claude ni siquiera está disponible oficialmente en China. El código en cuestión ya se había eliminado mediante un pull request el 01/07. Lección: fija las versiones de tus herramientas y lee los changelogs.

CNBC: China advierte sobre riesgos de IA con Claude Code de Anthropic · Tom's Hardware: Alibaba prohíbe Claude Code de Anthropic

Seguridad2026-07-10

Informe: un agente de código de IA borra una base de datos de producción

Según un informe de Tom's Hardware, un agente de código basado en Claude (una herramienta de Cursor) borró la base de datos de producción completa de una empresa en unos 9 segundos, backups incluidos. Lección: los agentes necesitan accesos de mínimo privilegio, puertas de confirmación para acciones destructivas y backups separados.

Tom's Hardware: AI coding agent deletes company database

Herramientas2026-07-10

OpenAI lanza 'ChatGPT Work', respuesta directa a Claude Cowork

OpenAI lanzó "ChatGPT Work" el 10/07/2026, una 'superapp' basada en GPT-5.6 que combina el chatbot con su herramienta de código Codex, y que permite crear documentos, presentaciones y sitios web. Es la respuesta directa a 'Claude Cowork' de Anthropic (enero de 2026, tareas autónomas de varios pasos). El despliegue empieza de inmediato en web y móvil para Pro/Enterprise/Edu, y Plus/Business llegarán 'en los próximos días'. Contexto: GPT-5.6 se había retrasado antes a petición del gobierno de EE. UU. por motivos de seguridad; ambas empresas compiten con fuerza por los clientes empresariales.

CGTN: OpenAI presenta una superapp mientras se intensifica la rivalidad con Anthropic

Papers2026-07-10

Por qué muchos benchmarks de coding llevan a engaño

Un position paper argumenta que los benchmarks de coding clásicos mezclan el rendimiento del propio modelo con el de la infraestructura del agente que lo rodea en una sola puntuación, sin diagnosticar qué falló realmente. Además, a menudo penalizan soluciones alternativas válidas solo porque se desvían del camino esperado. Consejo práctico: no te fíes a ciegas de los rankings de benchmarks al elegir una herramienta, pruébala tú mismo con tus propias tareas.

arXiv: Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

Papers2026-07-10

Estudio: los agentes de coding de IA casi nunca piden aclaraciones en tareas ambiguas

El benchmark ClarEval evalúa qué tan bien los agentes de coding piden aclaraciones cuando las instrucciones son ambiguas, en lugar de ponerse a programar sin más. Resultado: incluso los mejores modelos suelen fallar a la hora de hacer la pregunta correcta en el momento correcto. Consejo práctico: redacta tus prompts con la mayor precisión posible, y desconfía cuando un agente se lanza directo con una tarea vaga en vez de preguntarte.

arXiv: ClarEval: A Benchmark for Evaluating Clarification Skills of Code Agents under Ambiguous Instructions

Papers2026-07-10

Estudio: un buen resultado no basta, el proceso también debe seguir siendo controlable

ProcCtrlBench evalúa a los agentes de coding no solo por si llegan al resultado correcto, sino por si el proceso para llegar ahí sigue siendo interpretable, interrumpible, corregible y reversible, medido en 11 tipos distintos de defectos de proceso. Esto conecta con la lección de incidentes como la base de datos de producción borrada: no mires solo el resultado final, prepárate puntos de parada y opciones de deshacer antes de dejar actuar a un agente.

arXiv: ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

Modelos2026-07-09

Meta lanza Muse Spark 1.1 y estrena su propia Model API

Meta ha presentado Muse Spark 1.1, un modelo para tareas de programación agéntica y uso de herramientas con un contexto de 1 millón de tokens, capaz de delegar tareas a sub-agentes. A través de la nueva Meta Model API, compatible con OpenAI, los desarrolladores pueden acceder por primera vez a un modelo de Meta de forma remunerada.

Meta presenta Muse Spark 1.1 y la Meta Model API (Meta AI Blog) · Meta lanza su modelo insignia Muse Spark 1.1 con mejoras multiagente (SiliconANGLE)

Herramientas2026-07-09

Claude Code 2.1.197: los background agents hacen commit automáticamente, nuevo check /doctor

Claude Code v2.1.197 introduce background agents que hacen commit, push y abren draft pull requests de forma automática. También añade un nuevo check de configuración /doctor y reintentos automáticos con backoff para errores de red transitorios.

Releasebot: actualizaciones de Claude Code

MCP2026-07-09

La especificación MCP 2026-07-28 queda fijada como release candidate

La próxima versión de la especificación MCP, 2026-07-28, está congelada como release candidate desde el 21.05.2026; la versión final sale el 28.07.2026. El núcleo pasa a ser stateless (sin handshake de sesión, sin Mcp-Session-Id) y llegan las 'MCP Apps' para interfaces interactivas en iframes aislados. Tasks pasa a ser una extensión, y una política formal de deprecación exige al menos 12 meses entre deprecación y eliminación. Atención: esta versión contiene cambios incompatibles.

MCP Blog: 2026-07-28 Release Candidate

Modelos2026-07-09

OpenAI lanza la familia GPT-5.6

OpenAI presentó la familia GPT-5.6: Sol como buque insignia ($5/$30 por millón de tokens), Terra como gama media ($2,50/$15) y Luna como la opción más barata ($1/$6). Según Sam Altman, Sol es un 54% más eficiente en tokens en tareas de código. OpenAI afirma tener un Coding Agent Index de 80, 2,8 puntos por encima de Claude Fable 5, usando menos de la mitad de tokens de salida.

TechCrunch: OpenAI launches GPT-5.6 family

Seguridad2026-07-08

Investigadores muestran el exploit «Friendly Fire» contra Claude Code y Codex CLI

El AI Now Institute ha publicado una prueba de concepto: archivos preparados en una base de código ajena hacen que Claude Code (Auto mode) y OpenAI Codex CLI ejecuten en secreto código malicioso durante lo que supuestamente es una comprobación de seguridad. Por ahora no hay ataques conocidos en el mundo real, pero el truco no necesita plugins ni servidores MCP y afecta a varios modelos de ambos proveedores.

Friendly Fire: Hijacking Defensive Cyber AI Agents for Remote Code Execution (AI Now Institute) · Los principales agentes de IA creados para detectar código malicioso pueden ser engañados para ejecutarlo (The Hacker News)

Modelos2026-07-08

Grok 4.5: SpaceXAI y Cursor lanzan un modelo entrenado conjuntamente

SpaceXAI presentó Grok 4.5 — anunciado el 8 de julio, público desde el 9. Musk lo llama un modelo «clase Opus», «aproximadamente comparable a Opus 4.7, pero mucho más rápido»; cuesta $2/M tokens de entrada y $6/M de salida (Opus 4.7: $5/$25). Según el blog de Cursor es un modelo mixture-of-experts entrenado conjuntamente por Cursor y SpaceXAI — con billones de tokens de datos reales de uso de Cursor — y ya funciona en Cursor en escritorio, web, iOS, CLI y SDK.

TechCrunch: SpaceXAI releases Grok 4.5 · Cursor Blog: Introducing Grok 4.5 · x.ai: Introducing Grok 4.5

Herramientas2026-07-06

Zhipu lanza ZCode, un harness de coding para GLM-5.2

Zhipu/Z.ai ha lanzado 'ZCode', un harness de coding para GLM-5.2, un modelo de pesos abiertos con licencia MIT y un millón de tokens de contexto. Zhipu posiciona la herramienta como competencia directa de Claude Code, en medio de las tensiones actuales entre China y Anthropic. Como promoción, ofrece 5 millones de tokens gratis, y los planes de coding empiezan en unos 16 $ al mes.

SCMP: Zhipu AI lanza un harness para GLM-5.2

Modelos2026-07-01

Claude Fable 5: controles de exportación levantados, de nuevo disponible en todo el mundo

Anthropic lanzó Fable 5 y Mythos 5 el 09/06/2026, pero tras un jailbreak encontrado por investigadores de Amazon (el modelo identificaba vulnerabilidades de software y demostraba exploits), el gobierno de EE. UU. impuso controles de exportación el 12/06. Esos controles se levantaron el 30/06, y desde el 01/07 Fable 5 vuelve a estar disponible en todo el mundo, con un nuevo clasificador de seguridad que bloquea la técnica en más del 99% de los casos y redirige las peticiones bloqueadas a Opus 4.8. Anthropic considera el jailbreak un caso límite, ya que modelos más débiles también dan resultados parecidos. Lección: nunca construir de forma rígida sobre un solo modelo.

Anthropic: Redeploying Fable 5

Herramientas2026-06-18

Google cierra Gemini CLI y Code Assist for GitHub

Google descontinuó Gemini CLI y Gemini Code Assist for GitHub el 18/06/2026 (Code Assist: deprecación desde el 18/06, apagado total el 17/07). El sucesor es Antigravity CLI. Google lo justifica por un cambio de la demanda hacia soluciones multiagente con un backend unificado. Lección para pipelines de CI/CD: abstrae tus llamadas a herramientas para amortiguar este tipo de dependencia.

9to5Google: Gemini CLI shutting down

Herramientas2026-06-16

SpaceX compra Anysphere, la empresa de Cursor, por 60.000 millones de dólares

SpaceX anunció el 16/06/2026 la compra de Anysphere (Cursor) por 60.000 millones de dólares en acciones, apenas unos días después de su propia salida a bolsa (SpaceX salió a bolsa, no Cursor). Cursor había estado valorada anteriormente en unos 29.000 millones de dólares. Se espera que el cierre del acuerdo llegue en el tercer trimestre de 2026.

TechCrunch: SpaceX to acquire Cursor for $60B

Modelos2026-05-28

Claude Opus 4.8 publicado

Anthropic publicó Claude Opus 4.8 el 28/05/2026. Como novedades llegan 'Dynamic Workflows' como research preview (Claude Code orquesta cientos de subagents en paralelo) y Effort Controls, además de bastantes menos bugs de código que en la 4.7. El precio se mantiene en $5/$25 por millón de tokens, y se añade un nuevo Fast Mode a $10/$50.

Anthropic: Claude Opus 4.8