promptgarten 🌱

¿Qué uso y cuándo? — Modelos y herramientas comparados

Siete situaciones típicas, un clic: te mostramos la herramienta, el modelo y un ejemplo para reproducir. Después encontrarás todos los modelos actuales de los grandes proveedores y qué usa cada herramienta por defecto.

Stand / as of: 2026-07-28 · Benchmark overview → · 📊 Model timeline →

🧭 ¿QUÉ QUIERES HACER? — HAZ CLIC EN TU ESCENARIO

Inteligencia por dólar: todos los modelos principales de un vistazo

Cada punto es un modelo. Hacia la derecha es más caro (precio por 1 millón de tokens, combinado 3:1 entrada:salida, escala logarítmica), hacia arriba es más inteligente (Índice de Inteligencia de Artificial Analysis, v4.1). Arriba a la izquierda está el punto óptimo.

0.5 $1 $2 $5 $10 $20 $25354555Precio por 1M de tokens (combinado 3:1, escala logarítmica)Índice de Inteligencia (Artificial Analysis v4.1)Opus 5Fable 5GPT-5.6 SolKimi K3Opus 4.8GPT-5.6 TerraGrok 4.5Sonnet 5GPT-5.6 LunaMuse Spark 1.1Gemini 3.5 FlashGemini 3.1 ProQwen3.7-MaxDeepSeek-V4-ProRey del ratioKimi K2.5GLM-4.7Mistral Medium 3.5Haiku 4.5
FronteraMáxima capacidad — cuando el resultado importa más que el precio.
Precio-rendimientoMucha inteligencia por el dinero — la zona del día a día para la mayoría de las tareas.
EconómicoBarato para volumen, tareas simples y experimentos — a menudo pesos abiertos.
Pesos abiertos (autoalojable)

Precios = precios oficiales de lista de la API (sin batch/caché), Índice = Índice de Inteligencia de Artificial Analysis v4.1 en la configuración probada allí (normalmente el razonamiento más alto). Actualizado: 17/07/2026 — las cifras cambian rápido.

🎬 EN VÍDEO CORTO

El diagrama en 10 segundos: más caro a la derecha, más listo hacia arriba — y dónde está el punto óptimo.

El ranking: inteligencia por dólar

Índice de Inteligencia dividido por el precio combinado (3 partes de entrada + 1 parte de salida, por 1 millón de tokens). Más alto = más capacidad de razonamiento por dólar. Esto no dice nada sobre el máximo absoluto — para eso está el índice en sí.

#MODELOINTELIGENCIA/$ÍNDICEPRECIO (COMBINADO)
1DeepSeek-V4-Pro · DeepSeek81.444.270,54 $
2GLM-4.7 · Zhipu/Z.ai33.733.701,00 $
3Kimi K2.5 · Moonshot29.535.371,20 $
4Muse Spark 1.1 · Meta25.350.622,00 $
5GPT-5.6 Luna · OpenAI22.851.242,25 $
6Grok 4.5 · xAI17.953.833,00 $
7Gemini 3.5 Flash · Google14.950.203,38 $
8Sonnet 5 (Intro-Preis) · Anthropic13.353.354,00 $
9Qwen3.7-Max · Alibaba12.345.993,75 $
10Haiku 4.5 · Anthropic11.923.712,00 $
11Gemini 3.1 Pro · Google10.346.464,50 $
12Mistral Medium 3.5 · Mistral10.029.953,00 $
13GPT-5.6 Terra · OpenAI9.854.955,63 $
14Kimi K3 · Moonshot9.557.116,00 $
15Opus 5 · Anthropic6.160.6910,00 $
16Opus 4.8 · Anthropic5.655.6910,00 $
17GPT-5.6 Sol · OpenAI5.258.8911,25 $
18Fable 5 · Anthropic3.059.8620,00 $
  • Grok 4.5: el precio se aplica hasta 200K de contexto — por encima se duplica (ratio entonces ~9,0).
  • Gemini 3.1 Pro: el precio se aplica hasta un prompt de 200K — por encima 4 $/18 $ (ratio entonces ~6,2).
  • Qwen3.7-Max: actualmente hay un descuento del 50 % por tiempo limitado (ratio entonces ~24,5) — aquí cuenta el precio de lista.
  • Sonnet 5: precio de lanzamiento hasta el 31/08/2026, después 3 $/15 $ (ratio 8,9).
  • Mistral Large 3 (0,50 $/1,50 $) y Llama 4 Maverick (desde ~0,27 $/0,85 $ en proveedores de hosting) no aparecen en el ranking porque Artificial Analysis no publica un índice para ellos.
  • Fuentes: páginas oficiales de precios de los proveedores + artificialanalysis.ai, todas consultadas el 17/07/2026.

Los modelos de los grandes proveedores

Los modelos actuales de Anthropic, OpenAI, Google, xAI — y ahora también Moonshot (Kimi), DeepSeek, Zhipu (GLM), Meta, Alibaba (Qwen) y Mistral. Con precio, contexto, puntos fuertes y para qué sirven.

ANTHROPIC

Fable 5

El modelo más capaz de Anthropic disponible de forma amplia — creado para las tareas de razonamiento más exigentes y para agentes de ejecución prolongada (según Anthropic).

🧠 1M tokens💶 10 $ / 50 $ por MTok (a fecha de julio de 2026)
  • El nivel de capacidad más alto según Anthropic, para ejecuciones largas y autónomas de agentes
  • Contexto de 1M de tokens por defecto
  • Verifica su propio trabajo con más frecuencia que los modelos más pequeños
  • Desde el 20/07/2026 incluido de forma permanente en Max y Team Premium (al 50 % de los límites habituales); Pro y Team Standard reciben 100 $ de saldo único y después pagan tarifas de API.
  • ⚠️ El modelo más caro de la generación actual de Claude (10 $/50 $, a fecha de julio de 2026)
  • ⚠️ No es el modelo por defecto en Claude Code — tienes que seleccionarlo explícitamente (`/model fable`)

Úsalo para tareas muy grandes, de varias horas, en las que hay mucho en juego.

Opus 5

Para codificación agéntica compleja y trabajo empresarial — se acerca a la inteligencia de frontera de Fable 5, pero a mitad de precio (según Anthropic).

🧠 1M de tokens💶 5 $ / 25 $ por MTok (a julio de 2026)
  • Según Anthropic, de última generación en los benchmarks de codificación (Frontier-Bench, GDPval-AA) y más fuerte en investigación/trabajo de conocimiento que Opus 4.8
  • Control de esfuerzo en cinco niveles (bajo a máximo) para equilibrar inteligencia y consumo de tokens
  • Índice de inteligencia de 60,69 (Artificial Analysis v4.1, configuración de esfuerzo máximo) — lo que lo sitúa numéricamente un poco por delante de Fable 5 (59,86)
  • Desde Claude Code v2.1.219 (24 de julio de 2026), nuevo Opus estándar en Claude Code y nuevo modelo predeterminado en Claude Max
  • Contexto de 1M tokens por defecto, salida máxima de 128K
  • ⚠️ El modo rápido (Fast Mode) cuesta el doble (10 $ / 50 $ por MTok) y solo funciona a través de la API de Anthropic o del crédito de suscripción — no en Amazon Bedrock, Google Clouds Agent Platform, Microsoft Foundry ni Claude Platform on AWS
  • ⚠️ Más caro que Sonnet 5 en tareas cotidianas

Se usa para tareas de codificación agéntica complejas y trabajo de conocimiento empresarial cuando se busca una calidad cercana a la de Fable 5 sin pagar su precio.

Opus 4.8

Para trabajo de codificación agéntica compleja y trabajo empresarial — un modelo premium para codificación seria y trabajo de conocimiento (según Anthropic).

🧠 1M tokens💶 5 $ / 25 $ por MTok (a fecha de julio de 2026)
  • Recomendado para decisiones arquitectónicas complejas y razonamiento en varios pasos
  • Contexto de 1M de tokens
  • ⚠️ Más caro que Sonnet 5 para tareas cotidianas similares
  • ⚠️ Sustituido por Opus 5: mismo precio, índice de inteligencia más alto. Anthropic ya no incluye Opus 4.8 en su tabla comparativa principal y ofrece una guía de migración — sin embargo, no está obsoleto y, por ahora, no tiene fecha de retirada.

Para proyectos nuevos, Opus 5 es la mejor opción: mismo precio, generación más reciente. Opus 4.8 sigue siendo útil cuando no se desea cambiar flujos de trabajo existentes.

Sonnet 5

La mejor combinación de velocidad e inteligencia — la generación de Sonnet más agéntica hasta la fecha (según Anthropic).

🧠 1M tokens💶 2 $ / 10 $ por MTok hasta el 31.08.2026, después 3 $ / 15 $ (a fecha de julio de 2026)
  • Realiza bien la mayoría de las tareas de codificación
  • Más económico que Opus
  • Modelo por defecto en Claude Code para cuentas Pro/Team estándar
  • ⚠️ Más débil que Opus/Fable en cuestiones arquitectónicas muy complejas

Úsalo como modelo cotidiano para la mayoría de las tareas de codificación.

Haiku 4.5

El modelo más rápido con inteligencia cercana a la frontera — una versión ligera del modelo más potente de Anthropic a un precio más económico (según Anthropic).

🧠 200K tokens💶 1 $ / 5 $ por MTok (a fecha de julio de 2026)
  • El modelo Claude más económico
  • Muy rápido
  • 73,3 % SWE-bench Verified, según los propios datos de Anthropic
  • ⚠️ Ventana de contexto más pequeña (200K en lugar de 1M)
  • ⚠️ Más débil que Sonnet/Opus en tareas muy complejas

Úsalo para experimentar de forma económica y para tareas sencillas y bien delimitadas.

OPENAI

GPT-5.6 Sol

Modelo de frontera para trabajo profesional complejo — modelo insignia para razonamiento y codificación complejos (según OpenAI).

🧠 ~1,05M tokens💶 5 $ / 30 $ por MTok, entrada cacheada 0,50 $ (a fecha de julio de 2026)
  • El modelo más potente de la familia GPT-5.6
  • Modelo por defecto en Codex CLI (esfuerzo de razonamiento "medium")
  • ⚠️ El modelo más caro de la familia 5.6

Úsalo para tareas en las que el detalle y la precisión importan.

GPT-5.6 Terra

Equilibra inteligencia y coste — corresponde aproximadamente al nivel de modelo «mini» de familias GPT-5 anteriores (según OpenAI).

🧠 ~1,05M tokens💶 2,50 $ / 15 $ por MTok, entrada cacheada 0,25 $ (a fecha de julio de 2026)
  • Buen punto intermedio entre coste y capacidad
  • Recomendado en Codex CLI como „everyday workhorse"
  • ⚠️ Más débil que Sol en las tareas más difíciles

Úsalo como modelo cotidiano cuando Sol resulte demasiado caro.

GPT-5.6 Luna

Optimizado para cargas de trabajo sensibles al coste — corresponde aproximadamente al nivel de modelo «nano» (según OpenAI).

🧠 ~1,05M tokens💶 1 $ / 6 $ por MTok, entrada cacheada 0,10 $ (a fecha de julio de 2026)
  • El modelo más económico de la familia 5.6
  • Recomendado en Codex CLI para «trabajo claro y repetible»
  • ⚠️ OpenAI lo posiciona únicamente para trabajo claro y repetible

Úsalo para tareas de codificación sencillas y repetitivas a gran escala.

GPT-5.3-Codex

El modelo de codificación agéntica más capaz hasta la fecha — optimizado para tareas de codificación agéntica en Codex o entornos similares (según OpenAI).

🧠 400K tokens💶 1,75 $ / 14 $ por MTok, entrada cacheada 0,175 $ (a fecha de julio de 2026)
  • Optimizado específicamente para codificación agéntica
  • Más económico que Sol con un rendimiento de codificación sólido
  • ⚠️ Marcado como obsoleto (deprecated) en Codex con inicio de sesión de ChatGPT — disponibilidad irregular (a fecha de julio de 2026)

Úsalo cuando quieras una calidad optimizada específicamente para codificación agéntica en lugar de un modelo de propósito general.

GOOGLE

Gemini 3.5 Flash

El modelo más inteligente para un rendimiento de frontera sostenido en tareas agénticas y de codificación (según Google).

🧠 ~1M tokens (salida hasta 65K)💶 1,50 $ / 9 $ por MTok, Batch/Flex 0,75 $ / 4,50 $ (a fecha de julio de 2026)
  • Google lo posiciona como el modelo «más inteligente» — a pesar de llevar el nombre Flash
  • Cuenta con un nivel gratuito
  • Más económico que el propio modelo Pro de Google
  • ⚠️ Fecha límite de conocimiento: enero de 2025

Úsalo como la recomendación principal de Google para tareas de codificación agéntica.

Gemini 3.1 Flash-Lite

Rendimiento de clase frontera que iguala a modelos más grandes, a una fracción del coste — el modelo más eficiente en coste para tareas agénticas de alto volumen (según Google).

🧠 ~1M tokens (salida hasta 65K)💶 0,25 $ (Texto/Imagen/Video) o bien 0,50 $ (Audio) / 1,50 $ por MTok (a fecha de julio de 2026)
  • El modelo más económico de toda la comparativa
  • Cuenta con un nivel gratuito
  • ⚠️ No está pensado para tareas complejas

Úsalo para traducción, procesamiento de datos sencillo y ejecuciones de agentes simples de alto volumen.

Gemini 3.1 Pro

Inteligencia avanzada, resolución de problemas complejos y sólidas capacidades agénticas y de vibe coding (según Google) — todavía en estado preview.

🧠 ~1M tokens (salida hasta 65K)💶 2–4 $ / 12–18 $ por MTok, escalonado según la longitud del prompt (a fecha de julio de 2026)
  • El modelo más capaz de Google para tareas complejas de varios pasos
  • Sólidas capacidades de vibe coding según Google
  • ⚠️ Todavía en estado preview, sin nivel gratuito
  • ⚠️ Más caro que Flash (con otro escalón de precio para prompts de más de 200K)

Úsalo para problemas complejos de varios pasos en los que Flash no sea suficiente.

XAI

Grok 4.5

xAI: „For everything else, including code, use Grok 4.5. It is the most intelligent and fastest model we’ve built." Cursor lo coentrena y lo llama su modelo insignia.

🧠 500K tokens💶 2 $ / 6 $ por MTok, entrada cacheada 0,50 $ (a fecha de julio de 2026)
  • Coentrenado por Cursor como su modelo insignia asociado
  • Más económico que la mayoría de los modelos de gama alta de otros proveedores
  • ⚠️ Ventana de contexto más pequeña que la competencia (500K en lugar de 1M)

Úsalo en Cursor para las tareas más difíciles — según xAI, su modelo más inteligente y rápido.

Grok 4.3

No se ha encontrado ninguna declaración oficial de posicionamiento — aparece en la misma página de modelos de xAI que Grok 4.5, como modelo hermano más económico y con mayor contexto.

🧠 1M tokens💶 1,25 $ / 2,50 $ por MTok (a fecha de julio de 2026)
  • Mayor contexto que Grok 4.5 (1M en lugar de 500K)
  • Más económico que Grok 4.5
  • ⚠️ Apenas documentado — no se ha encontrado un posicionamiento propio ni una página de modelo dedicada

Úsalo como alternativa más económica de xAI con más contexto, cuando Grok 4.5 resulte demasiado caro.

MOONSHOT AI

Kimi K3

Recién lanzado (16/07/2026): según Moonshot, el modelo de pesos abiertos más grande del mundo (2,8 billones de parámetros, MoE) — puesto 3 en el Índice de Inteligencia, justo detrás de Fable 5 y GPT-5.6 Sol.

🧠 1M de tokens (salida de hasta 1M posible)💶 3 $ / 15 $ por MTok, entrada con acierto de caché 0,30 $ (actualizado: julio de 2026)
  • Índice de Inteligencia 57,11 — puesto 3 de todos los modelos (Artificial Analysis, 17/07/2026)
  • Investigación web agéntica: BrowseComp 91,2 (dato de Moonshot)
  • Precio plano en todo el contexto de 1M, caché automático
  • ⚠️ A fecha del 17/07/2026, los pesos aún NO se pueden descargar — el lanzamiento abierto está anunciado recién para el 27/07/2026
  • ⚠️ El razonamiento (thinking) está siempre activo — las respuestas rápidas y baratas no son lo suyo

Úsalo para tareas exigentes de agentes e investigación cuando quieras rendimiento frontera más barato que Fable/Sol.

Kimi K2.5

El predecesor: MoE de 1 billón de parámetros, pesos abiertos (Modified MIT), sigue disponible y bastante más barato.

🧠 256K tokens💶 0,60 $ / 3 $ por MTok, acierto de caché 0,10 $ (actualizado: julio de 2026)
  • SWE-bench Verified 76,8 % (dato de Moonshot) a precio económico
  • Pesos abiertos — autoalojable
  • Multimodal + búsqueda agéntica
  • ⚠️ Índice 35,37 — notablemente por debajo de K3 y de los modelos frontera

Úsalo para codificación agéntica barata o autoalojamiento con un rendimiento decente.

DEEPSEEK

DeepSeek-V4-Pro

El rey de la relación calidad-precio de esta comparativa: inteligencia por dólar inigualada (ratio 81) — pesos abiertos bajo licencia MIT.

🧠 1M de tokens (salida de hasta 384K)💶 0,435 $ / 0,87 $ por MTok, entrada con acierto de caché ~99 % más barata (actualizado: julio de 2026)
  • Con diferencia, la mejor relación inteligencia por dólar (índice 44,27 a 0,54 $ combinado)
  • SWE-bench Verified 80,6 % (dato de DeepSeek, modo Pro-Max)
  • API compatible con OpenAI Y Anthropic, pesos abiertos (MIT)
  • ⚠️ El rendimiento máximo absoluto queda por debajo de los modelos frontera
  • ⚠️ Las cifras de los benchmarks son datos del fabricante, no validados de forma independiente

Úsalo si quieres procesar mucho volumen de forma barata — o quieres autoalojar un modelo potente.

ZHIPU / Z.AI

GLM-4.7

El caballo de batalla open source de China para programar: MoE de 358B bajo licencia MIT, fuerte en codificación agéntica y generación de frontend.

🧠 200K tokens (salida de hasta 128K)💶 0,60 $ / 2,20 $ por MTok; la variante Flash es gratis (actualizado: julio de 2026)
  • SWE-bench Verified 73,8 % (dato de Zhipu) a precio económico
  • Pesos abiertos (MIT) — autoalojamiento vía vLLM/SGLang, 44 variantes cuantizadas
  • Variante Flash gratuita para probar
  • ⚠️ Índice 33,70 — para el razonamiento complejo, otros se llevan la corona
  • ⚠️ Zhipu ya tiene una serie GLM-5 más reciente — 4.7 ya no es el modelo insignia de la casa

Úsalo para codificación agéntica barata, generación web/frontend o como base para autoalojamiento.

META

Muse Spark 1.1

El primer modelo frontera de pesos cerrados de Meta (09/07/2026) — a través de la nueva Meta Model API, creado para la orquestación agéntica entre apps, servidores MCP y skills.

🧠 1M de tokens (con compactación de contexto integrada)💶 1,25 $ / 4,25 $ por MTok, entrada en caché 0,15 $ (actualizado: julio de 2026)
  • Índice 50,62 a solo 2 $ combinado — cuarta mejor relación inteligencia por dólar
  • Orquestación agéntica (apps/MCP/skills, zero-shot) como posicionamiento principal
  • API compatible con el SDK de OpenAI, 20 $ de crédito inicial
  • ⚠️ NO son pesos abiertos — una ruptura con la tradición Llama de Meta
  • ⚠️ Los benchmarks públicos se publican en parte solo como imágenes de gráficos

Úsalo para agentes multiapp y orquestación de herramientas a buen precio.

Llama 4 Maverick

El actual buque insignia de pesos abiertos de Meta (MoE de 400B, nativamente multimodal) — funciona muy barato en proveedores de hosting como Together, Groq o Fireworks.

🧠 ~1M de tokens💶 desde ~0,27 $ / 0,85 $ por MTok según el proveedor de hosting (Together AI, actualizado: julio de 2026)
  • La entrada más barata de esta comparativa
  • Pesos abiertos + autoalojamiento
  • Multimodal, 12 idiomas
  • ⚠️ No figura en el índice de Artificial Analysis — comparabilidad limitada
  • ⚠️ La licencia Llama 4 Community no cumple con la OSI (restricciones a partir de 700M de usuarios)

Úsalo para procesamiento masivo al precio mínimo o para tu propio hosting.

ALIBABA (QWEN)

Qwen3.7-Max

El buque insignia de agentes de Alibaba ("designed for the agent era") — por primera vez propietario en lugar de pesos abiertos, con razonamiento híbrido al mismo precio.

🧠 1M de tokens (salida de hasta 65K)💶 2,50 $ / 7,50 $ por MTok precio de lista; actualmente con un −50 % temporal (actualizado: julio de 2026)
  • SWE-bench Verified 80,4 % y GPQA Diamond 92,4 (datos de Alibaba)
  • Agentik de largo alcance a lo largo de cientos de pasos como enfoque principal
  • Muy fuerte en tareas multilingües (WMT24++ 85,8)
  • ⚠️ Sin autoalojamiento — una ruptura con la tradición de pesos abiertos de Qwen
  • ⚠️ El índice 45,99 queda por debajo de los modelos frontera occidentales

Úsalo para cadenas de agentes largas y tareas multilingües — sobre todo durante la promoción de descuento.

MISTRAL

Mistral Large 3

El buque insignia europeo de pesos abiertos (MoE de 675B, Apache 2.0) — visión, function calling y opción de hosting en la UE.

🧠 256K tokens💶 0,50 $ / 1,50 $ por MTok (página del modelo; una FAQ más antigua todavía indica 2 $/6 $) (actualizado: julio de 2026)
  • Pesos abiertos Apache 2.0 — la licencia más libre entre los grandes
  • Muy barato para su tamaño
  • Hosting en la UE/soberanía de datos
  • ⚠️ No figura en el índice de Artificial Analysis
  • ⚠️ Las cifras de los benchmarks se publican en su mayoría solo como imágenes de gráficos

Úsalo si el open source, el hosting en la UE o la licencia Apache son decisivos para ti.

Mistral Medium 3.5

El especialista en programación de Mistral: 128B dense, Modified MIT, con una puntuación SWE-bench fuerte para su tamaño.

🧠 256K tokens💶 1,50 $ / 7,50 $ por MTok (actualizado: julio de 2026)
  • SWE-bench Verified 77,6 % (dato de Mistral)
  • Pesos abiertos (Modified MIT)
  • Suficientemente compacto para hosting propio
  • ⚠️ Índice 29,95 — más débil que los gigantes MoE en razonamiento amplio

Úsalo para agentes de codificación en tu propia infraestructura.

Claude Docs: Models Overview · Claude Docs: Pricing · Anthropic: Claude Sonnet 5 Launch · OpenAI Docs: Pricing · OpenAI Docs: GPT-5.6 Sol · Google AI: Gemini Models · Google AI: Gemini Pricing · xAI Docs: Models · Moonshot AI: Kimi K3 Pricing · DeepSeek API Docs: Pricing · Z.ai Docs: Pricing · Meta Model API (Developer) · Alibaba Cloud Model Studio: Pricing · Mistral Docs: Models · Artificial Analysis: Intelligence Index · Claude Docs: migración a Claude Opus 5

Duelos de modelos

No «cuál es el mejor modelo», sino «qué modelo para esta tarea concreta». Cuatro comparativas directas, basadas en precios y en las propias declaraciones de los proveedores — incluida la respuesta a la pregunta más importante: cuándo NO merece la pena el modelo más caro. Precios y cifras: a fecha de julio de 2026.

⚔️ Haiku 4.5 vs. Sonnet 5

¿Es la tarea mecánica e inequívoca — o necesitas un modelo que piense por sí mismo?

Claude Haiku 4.5

para tareas mecánicas y bien delimitadas, sin margen de interpretación — la instrucción es inequívoca, no hay nada que decidir, solo que ejecutar.

  • Generar mensajes de commit a partir de un diff
  • Filtrar 100 líneas de log en busca de un patrón de error conocido
  • Renombrar un campo JSON de forma consistente en 40 archivos

Claude Sonnet 5

cuando construyes una función, depuras en varios pasos, o primero necesitas entender cómo funciona el código antes de modificarlo.

  • Construir una función nueva que afecta a varios archivos y módulos
  • Perseguir un error cuya causa no aparece en el mensaje de error
  • Entender código ajeno y luego extenderlo de forma limpia

💸 Cuándo NO merece la pena: Regla general: usar Sonnet 5 para ediciones simples e inequívocas es tirar el dinero — Sonnet cuesta $2/$10 por MTok (entrada/salida, precio de lanzamiento hasta el 31.08.2026) o $3/$15 después, mientras que Haiku 4.5 cuesta solo $1/$5 (a fecha de julio de 2026) — es decir, entre 2 y 3 veces más por una tarea que Haiku resuelve igual de bien. A la inversa, Haiku falla en cuanto los requisitos son implícitos: «hazlo más limpio» sin definir qué significa «limpio», una decisión de arquitectura entre dos enfoques igualmente válidos, o una tarea en la que primero necesitas entender el contexto del código para saber siquiera qué hacer.

📊 SWE-bench Verified: 73,3 % — Anthropic afirma que Haiku 4.5 obtiene un 73,3 % en SWE-bench Verified — cerca de modelos considerablemente más caros. Es un dato propio de Anthropic, no una prueba independiente, pero demuestra que Haiku es sólido en tareas de codificación bien especificadas, no solo «rápido y barato». (a fecha de julio de 2026)

Anthropic: Claude Haiku · Anthropic-Plattform: Preise · documentación de Claude Code: costes

⚔️ Sonnet 5 vs. Opus 4.8 / Fable 5

¿Es suficiente el caballo de batalla estándar — o necesitas el modelo de gama alta?

Claude Sonnet 5

como opción por defecto para el trabajo de codificación cotidiano. La propia guía de Anthropic para Claude Code dice: „Sonnet handles most coding tasks well and costs less than Opus."

  • Funciones y correcciones de errores cotidianas en un proyecto en marcha
  • Revisiones de código y refactorizaciones habituales
  • Sesiones de depuración que no requieren horas de autocorrección autónoma

Claude Opus 4.8 / Fable 5

para decisiones arquitectónicas complejas, errores difíciles que se extienden por muchos archivos y subsistemas, o ejecuciones largas y autónomas de agentes con mucha autocorrección.

  • Planificar un rediseño de arquitectura que afecta a varios módulos a la vez
  • Perseguir un error que se extiende por más de 10 archivos y varios subsistemas
  • Una ejecución autónoma de varias horas, en la que el modelo investiga, actúa y verifica su propio resultado por sí mismo — según Anthropic, el punto fuerte de Fable 5: „sustains long autonomous sessions, investigates before acting, and verifies its work more often than smaller models."

💸 Cuándo NO merece la pena: Regla general: usar el modelo de gama alta para ediciones cotidianas es quemar dinero. Sonnet 5 cuesta $2/$10 por MTok (entrada/salida, precio de lanzamiento hasta el 31.08.2026) o $3/$15 después. Opus 4.8 cuesta $5/$25 — entre 1,7 y 2,5 veces el precio de Sonnet, según qué nivel de precio compares. Fable 5 cuesta $10/$50 — entre 3,3 y 5 veces (todas las cifras a fecha de julio de 2026). La propia guía de Anthropic reserva Opus para „complex architectural decisions or multi-step reasoning"; Fable 5 no es el modelo por defecto en ningún tipo de cuenta y debe seleccionarse explícitamente con `/model fable` — no está pensado para trabajo rutinario.

Anthropic: Claude Opus · Anthropic-Plattform: Einführung Fable 5 · Anthropic-Plattform: Preise · documentación de Claude Code: elección de modelo · documentación de Claude Code: costes

⚔️ Gemini 3.5 Flash vs. Gemini 3.1 Pro Preview

¿El modelo rápido al que el propio Google llama «más inteligente» — o el más caro modelo insignia en preview?

Gemini 3.5 Flash

como opción por defecto para tareas agénticas y de codificación. El propio Google lo posiciona como „most intelligent model for sustained frontier performance on agentic and coding tasks" — no el modelo Pro.

  • Flujos de trabajo de codificación agéntica con muchas llamadas a herramientas encadenadas
  • Tareas que requieren búsqueda y grounding (Google lo llama „superior search and grounding")
  • El primer intento para casi cualquier cosa para la que antes habrías recurrido automáticamente a «Pro»

Gemini 3.1 Pro Preview

cuando quieres probar específicamente el posicionamiento de Pro de Google para la resolución de problemas complejos — y aceptas el estado preview. Atención: Flash y Pro comparten el mismo contexto de 1M.

  • Sesiones de resolución de problemas complejos, para las que Google posiciona expresamente a Pro — sabiendo que los prompts de más de 200.000 tokens entran en el nivel de precio más caro en Pro
  • Sesiones exploratorias, para las que Google describe a Pro como „the best model family … for multimodal understanding, agentic capabilities, and vibe-coding"

💸 Cuándo NO merece la pena: Dato curioso (a fecha de julio de 2026): en la propia documentación de modelos de Google, precisamente el rápido modelo Flash aparece listado como „most intelligent model", mientras que el modelo Pro sigue en estado preview y cuesta notablemente más por token: Flash $1,50/$9 por MTok (entrada/salida) frente a Pro $2–4/$12–18 (escalonado según la longitud del prompt). Regla general: para la mayoría de las tareas de codificación, el sobreprecio de Pro Preview es difícil de justificar ahora mismo — pagas más por un modelo que el propio Google no clasifica como el más inteligente. Ambos modelos comparten el mismo contexto de ~1M — un contexto largo no es, por tanto, un argumento a favor de Pro; con prompts de más de 200k, Pro se vuelve incluso más caro, mientras que Flash se mantiene plano. Pro solo merece la pena cuando necesitas específicamente su posicionamiento para la resolución de problemas complejos.

Google AI: resumen de los modelos Gemini · Google AI: Preise · Google AI: Gemini 3.5 Flash · Google AI: Gemini 3.1 Pro Preview

⚔️ Abo vs. API-Preise (Pay-per-Token)

¿Costes fijos con límite — o pago según el uso sin techo?

Suscripción (p. ej., Claude Pro/Max, ChatGPT Plus/Pro, suscripción de Cursor)

cuando quieres costes previsibles y con límite, y usas la herramienta con regularidad pero no de forma extrema — un precio fijo mensual en lugar de una factura variable.

  • Uso personal diario de Claude Code o Cursor como desarrollador individual
  • Puestos de equipo con un presupuesto mensual previsible en lugar de una factura de API variable

API / Pay-per-Token

cuando tu consumo varía mucho, ejecutas trabajos por lotes automatizados, o necesitas más volumen del que permite el límite de una suscripción.

  • Grandes procesamientos por lotes durante la noche — la Batch API ofrece un 50 % de descuento en entrada y salida en todos los modelos de Claude (a fecha de julio de 2026)
  • Un paso de CI que llama automáticamente unas pocas veces al día a un modelo económico como Haiku 4.5
  • Contextos grandes repetidos mediante prompt caching — un acierto de caché cuesta solo 0,1x el precio normal de entrada, es decir, un 90 % menos (a fecha de julio de 2026)

💸 Cuándo NO merece la pena: Regla general: el pago por token en la API rara vez merece la pena para usuarios ocasionales — con un uso irregular y bajo, una suscripción de precio fijo suele ser más barata, y no tienes que vigilar los tokens. A la inversa, una suscripción es la elección equivocada para el procesamiento masivo por lotes: los límites de las suscripciones están pensados para el uso interactivo por sesiones, no para miles de llamadas automatizadas — para eso, la API con descuento por lotes (50 % en Claude) y prompt caching (hasta un 90 % de descuento en contextos repetidos) resulta claramente más económica (a fecha de julio de 2026).

Anthropic-Plattform: Preise (Batch, Caching) · Claude: Pricing (Abos)

💶 CALCULADORA DE PRECIOS — ¿CUÁNTO CUESTA TU SETUP AL MES?

≈ COSTE MENSUAL (30 DÍAS, PRECIOS DE LISTA)

DeepSeek-V4-Pro
$15.66
GLM-4.7
$24.60
Kimi K2.5
$27.00
Haiku 4.5
$45.00
GPT-5.6 Luna
$48.00
Muse Spark 1.1
$50.25
Gemini 3.5 Flash
$72.00
Grok 4.5
$78.00
Gemini 3.1 Pro
$96.00
Qwen3.7-Max
$97.50
GPT-5.6 Terra
$120
Sonnet 5
$135
Kimi K3
$135
Opus 4.8
$225
GPT-5.6 Sol
$240
Fable 5
$450

Sonnet 5: precio de lanzamiento 2/10 $ hasta el 31.08.2026 — la calculadora usa el precio regular 3/15 $. Gemini 3.1 Pro: precio hasta prompts de 200k; por encima, 4/18 $.
Precios de lista de las páginas oficiales (a fecha de julio de 2026), sin caché/descuentos/suscripciones — el coste real puede variar. Fuentes: Anthropic Pricing · OpenAI Models · Gemini API Pricing · xAI Models · Kimi Pricing · DeepSeek Pricing · Z.ai Pricing · Meta Model API · Alibaba Model Studio

Dentro de la herramienta: ¿qué modelo para qué?

Cada herramienta tiene un modelo por defecto y sus propias recomendaciones para tareas concretas. Así cambias de modelo — y cuándo merece la pena hacerlo.

Claude Code

El modelo predeterminado depende de la cuenta (generalmente Opus 5 o Sonnet 5 desde Claude Code v2.1.219) — se cambia con `/model <name>` o el selector mediante `/model`.

Tareas de codificación cotidianas

sonnet maneja bien la mayoría de las tareas y cuesta menos que Opus (según Anthropic).

Decisiones arquitectónicas complejas

opus recomendado para tareas de razonamiento complejo (según Anthropic).

Tareas sencillas de subagentes

haiku rápido y eficiente para tareas sencillas (según Anthropic).

documentación de Claude Code: Model Config · documentación de Claude Code: Costs

Codex CLI

El valor por defecto es GPT-5.6 Sol con esfuerzo de razonamiento «medium» — se cambia con `/model` o `codex --model <id>`.

Trabajo de detalle y precisión

5.6 Sol „para el detalle y el acabado" — si tienes dudas, empieza con Sol (según OpenAI).

Caballo de batalla cotidiano

5.6 Terra compite con GPT-5.5 a un coste menor (según OpenAI).

Trabajo claro y repetible

5.6 Luna el coste más bajo de la familia (según OpenAI).

OpenAI: modelos Codex · OpenAI: Codex CLI Quickstart

Cursor

El modelo se elige mediante el selector; «Auto» equilibra automáticamente inteligencia, coste y fiabilidad.

Tareas cotidianas

Auto «bueno para tareas cotidianas» (según Cursor).

Tareas complejas de varios pasos

Premium / Grok 4.5 Premium selecciona los modelos más capaces; Grok 4.5 es el propio modelo insignia de Cursor (según Cursor).

Codificación interactiva rápida

Composer El modelo rápido y eficiente en coste de Cursor, creado para codificación interactiva (según Cursor).

Cursor Docs: Models · Cursor Help: Available Models

Aider

No hay un modelo por defecto único y documentado actualmente — indicas tu modelo mediante `--model` o una variable de entorno con la clave de API.

Elegir un modelo

--model <name> Aider es deliberadamente independiente del modelo — funciona con casi cualquier LLM (según la documentación de Aider).

Listar los modelos de un proveedor

--list-models anthropic/ muestra los modelos disponibles de un proveedor antes de elegir.

Ajustes finos (p. ej., presupuesto de thinking)

.aider.model.settings.yml ajustes de modelo avanzados y persistentes por proyecto.

Aider Docs: LLMs · Aider Docs: Anthropic

Antigravity CLI

Todos los planes incluyen los dos modelos principales de Gemini (3.5 Flash, 3.1 Pro) — se cambia con `/model`; los modelos de terceros (Claude, GPT-OSS) están disponibles en todos los planes excepto Enterprise.

Tareas cotidianas rápidas

Gemini 3.5 Flash disponible en todos los planes, posicionado para tareas agénticas y de codificación (según Google).

Problemas más complejos

Gemini 3.1 Pro inteligencia más avanzada, también disponible en todos los planes (según Google).

Usar modelos de terceros

Claude Opus/Sonnet 4.6 (no en Enterprise) disponible en Free, Google AI Plus, Pro y Ultra; el plan Enterprise es el único que no los ofrece.

documentación de Antigravity: modelos · documentación de Antigravity: planes

Las herramientas cara a cara

Claude Code

CLI + extensiones de IDE + webOpen Source: noSuscripción a Claude o costes de API

Trabajo agéntico en la terminal: tareas largas, automatización, loops, subagentes.

  • Subagentes, hooks y conexión MCP integrados
  • Artifacts: páginas en vivo que se pueden compartir directamente desde la sesión
  • Modelo por defecto según la suscripción (Opus 4.8 o Sonnet 5, contexto de 1M de tokens con Sonnet 5) — se cambia con /model
  • ⚠️ Sin editor gráfico — el enfoque terminal-first es cuestión de gustos
  • ⚠️ Dependencia del ecosistema de Claude

documentación de Claude Code: What's new · documentación de Claude Code: Subagents

Cursor

IDE (basado en VS Code)Open Source: noSuscripción

Enfoque IDE-first: ver, hacer clic, editar — con agentes trabajando en segundo plano.

  • Los agentes en segundo plano y en la nube siguen trabajando mientras editas
  • Composer para cambios en varios archivos
  • Automatizaciones: los agentes se activan con eventos del repositorio o temporizadores
  • ⚠️ Código cerrado, modelo de suscripción
  • ⚠️ Adquisición por parte de SpaceX anunciada (16.06.2026) — hay que seguir de cerca su futuro

Cursor Changelog · TechCrunch: SpaceX to acquire Cursor

OpenAI Codex CLI

CLIOpen Source: Suscripción a ChatGPT o API

Para quien vive en el ecosistema de OpenAI y quiere una CLI abierta.

  • Subagentes: hasta 6 en paralelo
  • Idas y vueltas rápidas mediante un WebSocket persistente
  • Incluido en la aplicación de escritorio de ChatGPT
  • ⚠️ Sus puntos fuertes dependen en gran medida de la gama de modelos de OpenAI
  • ⚠️ Más joven que la competencia, el ecosistema todavía está creciendo

OpenAI Codex Changelog

Aider

CLIOpen Source: gratis — solo pagas tu API de modelo

Control total: tu propio modelo, tus propias claves, flujo de trabajo nativo de git.

  • Independiente del modelo — funciona con casi cualquier LLM
  • Nativo de git: auto-commits limpios por cada cambio
  • Totalmente de código abierto, sin dependencia de un proveedor
  • ⚠️ Menos comodidad de automatización que las grandes suites
  • ⚠️ La configuración y la elección del modelo corren de tu cuenta

Aider — sitio oficial

Antigravity CLI

CLIOpen Source: noCuenta de Google — cuota Free/Pro/Ultra (sin clave de API propia)

Sucesor de Gemini CLI para usuarios individuales: un agente de terminal dentro del ecosistema de Google con MCP, plugins y skills.

  • Sucesor oficialmente designado por Google de Gemini CLI para usuarios individuales
  • Soporte completo de MCP (stdio + remoto), además de su propio sistema de plugins/skills (`agy plugin`, `/skills`)
  • Modo no interactivo (`agy -p`) para scripts, igual que en las demás CLIs
  • ⚠️ Producto muy joven (repositorio desde mayo de 2026) — sin archivo de licencia de código abierto en el repositorio (`license: null`)
  • ⚠️ La cuota gratuita solo se describe de forma cualitativa ("meaningful"/"generous"), sin cifras concretas

Google Blog: Transition von Gemini CLI zu Antigravity CLI · documentación de Antigravity CLI: referencia de comandos

Fuentes: All claims come from the linked official sources; the loop fixes reported errors. 🐛 button bottom right.