promptgarten 🌱

我该在什么时候用什么?—— 模型与工具对比

七种常见场景,一键直达:我们为你展示对应的工具、模型,以及一个可以直接照做的示例。接下来你会看到各大厂商目前所有的模型,以及每个工具默认使用的是哪一个。

Stand / as of: 2026-07-28 · Benchmark overview → · 📊 Model timeline →

🧭 你想做什么?—— 点击你的场景

每美元智能:所有主流模型一览

每个点代表一个模型。越靠右越贵(每 100 万 token 的价格,输入:输出按 3:1 混合计算,对数坐标),越靠上越聪明(Artificial Analysis 的智能指数,v4.1)。左上角是最佳平衡点。

0.5 $1 $2 $5 $10 $20 $25354555每 1M token 价格(3:1 混合,对数坐标)智能指数(Artificial Analysis v4.1)Opus 5Fable 5GPT-5.6 SolKimi K3Opus 4.8GPT-5.6 TerraGrok 4.5Sonnet 5GPT-5.6 LunaMuse Spark 1.1Gemini 3.5 FlashGemini 3.1 ProQwen3.7-MaxDeepSeek-V4-Pro性价比之王Kimi K2.5GLM-4.7Mistral Medium 3.5Haiku 4.5
前沿最强能力——当结果比价格更重要时选择。
性价比花小钱办大事——大多数日常任务的主力区间。
经济型适合大批量、简单任务和实验,价格便宜——通常是开源权重模型。
开源权重(可自行部署)

价格为各厂商官方 API 标价(不含批处理/缓存折扣),指数为 Artificial Analysis Intelligence Index v4.1,采用其测试时使用的配置(通常为最高推理强度)。数据截至 2026 年 7 月 17 日——数字变化很快。

🎬 短视频版

10 秒看懂图表:越右越贵,越上越聪明——最佳选择在哪里。

排行榜:每美元智能

用智能指数除以混合价格(每 100 万 token,3 份输入 + 1 份输出)。数值越高,代表每美元获得的思考能力越多。这不代表绝对最强——那要看指数本身。

#模型智能/美元指数价格(混合)
1DeepSeek-V4-Pro · DeepSeek81.444.270.54 美元
2GLM-4.7 · Zhipu/Z.ai33.733.701.00 美元
3Kimi K2.5 · Moonshot29.535.371.20 美元
4Muse Spark 1.1 · Meta25.350.622.00 美元
5GPT-5.6 Luna · OpenAI22.851.242.25 美元
6Grok 4.5 · xAI17.953.833.00 美元
7Gemini 3.5 Flash · Google14.950.203.38 美元
8Sonnet 5 (Intro-Preis) · Anthropic13.353.354.00 美元
9Qwen3.7-Max · Alibaba12.345.993.75 美元
10Haiku 4.5 · Anthropic11.923.712.00 美元
11Gemini 3.1 Pro · Google10.346.464.50 美元
12Mistral Medium 3.5 · Mistral10.029.953.00 美元
13GPT-5.6 Terra · OpenAI9.854.955.63 美元
14Kimi K3 · Moonshot9.557.116.00 美元
15Opus 5 · Anthropic6.160.6910,00 $
16Opus 4.8 · Anthropic5.655.6910.00 美元
17GPT-5.6 Sol · OpenAI5.258.8911.25 美元
18Fable 5 · Anthropic3.059.8620.00 美元
  • Grok 4.5:该价格适用于 200K 以内的上下文——超过后价格翻倍(此时比率约为 9.0)。
  • Gemini 3.1 Pro:该价格适用于 200K 以内的提示词——超过后为 4 美元/18 美元(此时比率约为 6.2)。
  • Qwen3.7-Max:目前有限时 50% 优惠活动(此时比率约为 24.5)——此处按标价计算。
  • Sonnet 5:优惠价截至 2026 年 8 月 31 日,之后为 3 美元/15 美元(比率 8.9)。
  • Mistral Large 3(0.50 美元/1.50 美元)和 Llama 4 Maverick(在托管平台上起价约 0.27 美元/0.85 美元)未列入排行榜,因为 Artificial Analysis 没有为它们提供指数。
  • 数据来源:各厂商官方定价页面 + artificialanalysis.ai,均于 2026 年 7 月 17 日查询。

各大厂商的模型

来自 Anthropic、OpenAI、Google、xAI 的最新模型——现在还包括 Moonshot(Kimi)、DeepSeek、智谱(GLM)、Meta、阿里巴巴(通义千问)和 Mistral。附价格、上下文长度、优势和适用场景。

ANTHROPIC

Fable 5

Anthropic 能力最强、且广泛可用的模型——专为最苛刻的推理任务和长时间运行的智能体任务打造(据 Anthropic 介绍)。

🧠 1M Token💶 10 $ / 50 $ 每 MTok(截至 2026 年 7 月)
  • 据 Anthropic 介绍,能力等级最高,适合长时间的自主智能体运行
  • 默认 1M Token 上下文
  • 比更小的模型更频繁地检查自己的工作成果
  • 自 2026 年 7 月 20 日起永久包含在 Max 与 Team Premium 中(额度为常规上限的 50%);Pro 和 Team Standard 获得一次性 100 美元额度,之后按 API 价格计费。
  • ⚠️ 当前 Claude 系列中最贵的模型(10 $/50 $,截至 2026 年 7 月)
  • ⚠️ 在 Claude Code 中不是默认模型——需要手动选择(`/model fable`)

适用于风险高、耗时数小时的超大型任务。

Opus 5

面向复杂的智能体编码和企业工作——智能水平接近Fable 5的前沿水准,但价格只有一半(据Anthropic介绍)。

🧠 1M Token💶 5美元 / 25美元 每MTok (截至2026年7月)
  • 据Anthropic介绍,在编码基准测试(Frontier-Bench、GDPval-AA)中达到业界领先水平,在调研/知识型工作方面比Opus 4.8更强
  • 五级努力程度调节器(从低到最高),用于权衡智能水平与Token消耗
  • 智能指数60.69(Artificial Analysis v4.1,最高努力程度配置)——按数值计算甚至略高于Fable 5(59.86)
  • 自Claude Code v2.1.219(2026年7月24日)起,成为Claude Code中新的标准Opus模型,也是Claude Max上新的默认模型
  • 默认1M Token上下文,最大输出128K
  • ⚠️ 快速模式(Fast Mode)价格翻倍(10美元/50美元每MTok),且只能通过Anthropic API或订阅额度使用——不支持Amazon Bedrock、Google Clouds Agent Platform、Microsoft Foundry或Claude Platform on AWS
  • ⚠️ 在日常任务中比Sonnet 5更贵

适用于复杂的智能体编码任务和企业知识型工作,适合追求接近Fable 5质量但不想支付其价格的场景。

Opus 4.8

用于复杂的智能体编程和企业级工作——一款面向严肃编程和知识工作的高端模型(据 Anthropic 介绍)。

🧠 1M Token💶 5 $ / 25 $ 每 MTok(截至 2026 年 7 月)
  • 推荐用于复杂的架构决策和多步推理
  • 1M Token 上下文
  • ⚠️ 在类似的日常任务上比 Sonnet 5 更贵
  • ⚠️ 已被 Opus 5 取代:价格相同,智能指数更高。Anthropic 不再将 Opus 4.8 列入主要对比表,并提供了迁移指南——但它并未被弃用,目前也没有停用日期。

对于新项目,Opus 5 是更好的选择:价格相同,版本更新。如果不想更改现有工作流程,Opus 4.8 仍然适用。

Sonnet 5

速度与智能的最佳结合——迄今为止最具智能体特质的 Sonnet 系列(据 Anthropic 介绍)。

🧠 1M Token💶 2 $ / 10 $ 每 MTok(至 31.08.2026),此后为 3 $ / 15 $(截至 2026 年 7 月)
  • 能很好地完成大多数编程任务
  • 比 Opus 便宜
  • Pro/Team 标准账户在 Claude Code 中的默认模型
  • ⚠️ 在非常复杂的架构问题上不如 Opus/Fable

作为处理大多数编程任务的日常模型使用。

Haiku 4.5

具有接近前沿智能水平、速度最快的模型——以更低的价格提供 Anthropic 最强模型的轻量版本(据 Anthropic 介绍)。

🧠 200K Token💶 1 $ / 5 $ 每 MTok(截至 2026 年 7 月)
  • 最便宜的 Claude 模型
  • 速度非常快
  • 根据 Anthropic 自己的数据,在 SWE-bench Verified 上达到 73.3%
  • ⚠️ 上下文窗口更小(200K 而非 1M)
  • ⚠️ 在非常复杂的任务上不如 Sonnet/Opus

适用于低成本实验,以及简单、边界清晰的任务。

OPENAI

GPT-5.6 Sol

面向复杂专业工作的前沿模型——用于复杂推理和编程的旗舰模型(据 OpenAI 介绍)。

🧠 ~1.05M Token💶 5 $ / 30 $ 每 MTok,缓存输入 0.50 $(截至 2026 年 7 月)
  • GPT-5.6 系列中最强的模型
  • Codex CLI 中的默认模型(推理强度为“medium”)
  • ⚠️ 5.6 系列中最贵的模型

适用于注重细节和精确度的任务。

GPT-5.6 Terra

在智能水平和成本之间取得平衡——大致相当于早期 GPT-5 系列中的 mini 级别模型(据 OpenAI 介绍)。

🧠 ~1.05M Token💶 2.50 $ / 15 $ 每 MTok,缓存输入 0.25 $(截至 2026 年 7 月)
  • 在成本与能力之间取得了不错的平衡
  • 在 Codex CLI 中被推荐为“日常主力模型”
  • ⚠️ 在最难的任务上不如 Sol

当 Sol 太贵时,可作为日常模型使用。

GPT-5.6 Luna

针对成本敏感型工作负载优化——大致相当于 nano 级别模型(据 OpenAI 介绍)。

🧠 ~1.05M Token💶 1 $ / 6 $ 每 MTok,缓存输入 0.10 $(截至 2026 年 7 月)
  • 5.6 系列中最便宜的模型
  • 在 Codex CLI 中被推荐用于“清晰、可重复的工作”
  • ⚠️ OpenAI 仅将其定位于清晰、可重复的工作

适用于大批量、简单且重复性的编程任务。

GPT-5.3-Codex

迄今为止能力最强的智能体编程模型——针对 Codex 或类似环境中的智能体编程任务进行了优化(据 OpenAI 介绍)。

🧠 400K Token💶 1.75 $ / 14 $ 每 MTok,缓存输入 0.175 $(截至 2026 年 7 月)
  • 专门针对智能体编程进行了优化
  • 在保持强劲编程表现的同时比 Sol 更便宜
  • ⚠️ 在使用 ChatGPT 登录的 Codex 中被标记为已弃用——可用性不一致(截至 2026 年 7 月)

如果你想要专门针对智能体编程优化的质量,而不是通用模型,就用它。

GOOGLE

Gemini 3.5 Flash

在智能体和编程任务上具备持续前沿表现的最智能模型(据 Google 介绍)。

🧠 ~1M Token(输出最高 65K)💶 1.50 $ / 9 $ 每 MTok,Batch/Flex 0.75 $ / 4.50 $(截至 2026 年 7 月)
  • 尽管名字里带“Flash”,Google 仍将其定位为“最智能”的模型
  • 提供免费额度
  • 比 Google 自家的 Pro 模型更便宜
  • ⚠️ 知识截止日期为 2025 年 1 月

作为 Google 对智能体编程任务的首选推荐使用。

Gemini 3.1 Flash-Lite

以极低的成本达到与更大模型相当的前沿级性能——用于大批量智能体任务时性价比最高的模型(据 Google 介绍)。

🧠 ~1M Token(输出最高 65K)💶 0.25 $(文本/图像/视频)或 0.50 $(音频)/ 1.50 $ 每 MTok(截至 2026 年 7 月)
  • 本次对比中最便宜的模型
  • 提供免费额度
  • ⚠️ 并非面向复杂任务定位

适用于翻译、简单数据处理,以及大批量、简单的智能体运行任务。

Gemini 3.1 Pro

先进的智能水平、复杂问题解决能力,以及强大的智能体和 Vibe Coding 能力(据 Google 介绍)——目前仍处于预览阶段。

🧠 ~1M Token(输出最高 65K)💶 2–4 $ / 12–18 $ 每 MTok,按提示词长度分级(截至 2026 年 7 月)
  • Google 处理复杂多步任务能力最强的模型
  • 据 Google 介绍,具备强大的 Vibe Coding 能力
  • ⚠️ 仍处于预览阶段,没有免费额度
  • ⚠️ 比 Flash 更贵(提示词超过 200K 时还会再分一档)

适用于 Flash 力所不及的复杂多步问题。

XAI

Grok 4.5

xAI:“For everything else, including code, use Grok 4.5. It is the most intelligent and fastest model we’ve built.” Cursor 与其共同训练,并将其称为自己的旗舰模型。

🧠 500K Token💶 2 $ / 6 $ 每 MTok,缓存输入 0.50 $(截至 2026 年 7 月)
  • 由 Cursor 共同训练,作为其旗舰合作模型
  • 比其他厂商的多数顶级模型更便宜
  • ⚠️ 上下文窗口比同类竞品更小(500K 而非 1M)

在 Cursor 中用于最难的任务——据 xAI 介绍,这是他们最智能、最快的模型。

Grok 4.3

未找到官方定位说明——在与 Grok 4.5 相同的 xAI 模型页面上,被列为价格更低、上下文更大的姊妹模型。

🧠 1M Token💶 1.25 $ / 2.50 $ 每 MTok(截至 2026 年 7 月)
  • 比 Grok 4.5 拥有更大的上下文(1M 而非 500K)
  • 比 Grok 4.5 更便宜
  • ⚠️ 文档极少——未找到独立的定位说明或模型页面

当 Grok 4.5 太贵时,可作为上下文更大、价格更低的 xAI 替代方案使用。

MOONSHOT AI

Kimi K3

全新发布(2026 年 7 月 16 日):据 Moonshot 称,是全球最大的开源权重模型(2.8 万亿参数,MoE 架构)——智能指数排名第 3,仅次于 Fable 5 和 GPT-5.6 Sol。

🧠 1M token(输出最多可达 1M)💶 每 MTok 3 美元/15 美元,缓存命中输入 0.30 美元(截至 2026 年 7 月)
  • 智能指数 57.11——所有模型中排名第 3(Artificial Analysis,2026 年 7 月 17 日)
  • 智能体网页搜索能力:BrowseComp 91.2(Moonshot 数据)
  • 整个 1M 上下文范围内价格统一,自动缓存
  • ⚠️ 截至 2026 年 7 月 17 日,权重尚不可下载——开源发布计划于 2026 年 7 月 27 日
  • ⚠️ 思考模式始终开启——不适合追求又快又便宜的回答

适合复杂的智能体和研究任务,当你想要比 Fable/Sol 更便宜的前沿性能时选它。

Kimi K2.5

前代模型:1 万亿参数 MoE,开源权重(Modified MIT 协议),仍可使用,价格明显更便宜。

🧠 256K token💶 每 MTok 0.60 美元/3 美元,缓存命中 0.10 美元(截至 2026 年 7 月)
  • SWE-bench Verified 76.8%(Moonshot 数据),价格实惠
  • 开源权重——可自行部署
  • 多模态 + 智能体搜索
  • ⚠️ 指数 35.37——明显低于 K3 和前沿模型

适合低成本的智能体编程,或需要自行部署且性能尚可的场景。

DEEPSEEK

DeepSeek-V4-Pro

本页的性价比之王:每美元智能无人能及(比率 81)——采用 MIT 许可的开源权重。

🧠 1M token(输出最多可达 384K)💶 每 MTok 0.435 美元/0.87 美元,缓存命中输入便宜约 99%(截至 2026 年 7 月)
  • 遥遥领先的每美元智能比(指数 44.27,混合价 0.54 美元)
  • SWE-bench Verified 80.6%(DeepSeek 数据,Pro-Max 模式)
  • 同时兼容 OpenAI 和 Anthropic 的 API,开源权重(MIT)
  • ⚠️ 绝对性能水平低于前沿模型
  • ⚠️ 基准测试数据来自厂商自述,未经独立验证

适合需要低成本处理大量任务,或想自行部署一个强大模型的场景。

ZHIPU / Z.AI

GLM-4.7

中国的开源编程主力:358B MoE 架构,MIT 许可,擅长智能体编程和前端生成。

🧠 200K token(输出最多可达 128K)💶 每 MTok 0.60 美元/2.20 美元;Flash 版本免费(截至 2026 年 7 月)
  • SWE-bench Verified 73.8%(智谱数据),价格实惠
  • 开源权重(MIT)——可通过 vLLM/SGLang 自行部署,提供 44 种量化版本
  • 免费的 Flash 版本可供试用
  • ⚠️ 指数 33.70——在复杂推理方面不如其他模型
  • ⚠️ 智谱已推出更新的 GLM-5 系列——4.7 已不再是自家的旗舰模型

适合低成本智能体编程、网页/前端生成,或作为自行部署的基础模型。

META

Muse Spark 1.1

Meta 首个闭源前沿模型(2026 年 7 月 9 日)——通过全新的 Meta Model API 提供,专为跨应用、MCP 服务器和技能的智能体编排而设计。

🧠 1M token(内置上下文压缩)💶 每 MTok 1.25 美元/4.25 美元,缓存输入 0.15 美元(截至 2026 年 7 月)
  • 指数 50.62,混合价仅 2 美元——每美元智能比排名第 4
  • 核心定位是智能体编排(应用/MCP/技能,零样本)
  • 兼容 OpenAI SDK 的 API,提供 20 美元起始额度
  • ⚠️ 并非开源权重——打破了 Meta 的 Llama 传统
  • ⚠️ 部分公开基准测试仅以图表图片形式发布

适合以合理价格构建多应用智能体和工具编排。

Llama 4 Maverick

Meta 目前的开源权重旗舰模型(400B MoE,原生多模态)——在 Together、Groq 或 Fireworks 等托管平台上运行成本极低。

🧠 约 1M token💶 根据托管平台不同,起价约每 MTok 0.27 美元/0.85 美元(Together AI,截至 2026 年 7 月)
  • 本页中价格最低的模型
  • 开源权重 + 可自行部署
  • 多模态,支持 12 种语言
  • ⚠️ 未列入 Artificial Analysis 指数——可比性有限
  • ⚠️ Llama 4 社区许可证不符合 OSI 标准(用户超过 7 亿时有额外限制)

适合以最低成本进行大批量处理,或用于自行部署。

ALIBABA (QWEN)

Qwen3.7-Max

阿里巴巴的智能体旗舰模型(「为智能体时代而设计」)——首次采用闭源而非开源权重,同价提供混合推理能力。

🧠 1M token(输出最多可达 65K)💶 标价每 MTok 2.50 美元/7.50 美元;目前限时优惠 -50%(截至 2026 年 7 月)
  • SWE-bench Verified 80.4%,GPQA Diamond 92.4(阿里巴巴数据)
  • 核心专注于长达数百步骤的长程智能体任务
  • 多语言能力极强(WMT24++ 85.8)
  • ⚠️ 不支持自行部署——打破了通义千问的开源权重传统
  • ⚠️ 指数 45.99,低于西方前沿模型

适合长链智能体任务和多语言场景——尤其是在优惠期间。

MISTRAL

Mistral Large 3

欧洲的开源权重旗舰模型(675B MoE,Apache 2.0 协议)——支持视觉、函数调用,并可选择在欧盟境内托管。

🧠 256K token💶 每 MTok 0.50 美元/1.50 美元(模型页面数据;较旧的 FAQ 仍写着 2 美元/6 美元)(截至 2026 年 7 月)
  • Apache 2.0 开源权重——在各大厂商中许可最自由
  • 相对其规模非常便宜
  • 支持欧盟托管/数据主权
  • ⚠️ 未列入 Artificial Analysis 指数
  • ⚠️ 基准测试数据大多仅以图表图片形式发布

适合看重开源、欧盟托管或 Apache 许可证的场景。

Mistral Medium 3.5

Mistral 的编程专用模型:128B 稠密架构,Modified MIT 协议,以其规模而言 SWE-bench 分数很出色。

🧠 256K token💶 每 MTok 1.50 美元/7.50 美元(截至 2026 年 7 月)
  • SWE-bench Verified 77.6%(Mistral 数据)
  • 开源权重(Modified MIT)
  • 体量足够小,适合自行部署
  • ⚠️ 指数 29.95——在广泛推理能力上弱于 MoE 巨头模型

适合在自有基础设施上运行的编程智能体。

Claude Docs: Models Overview · Claude Docs: Pricing · Anthropic: Claude Sonnet 5 Launch · OpenAI Docs: Pricing · OpenAI Docs: GPT-5.6 Sol · Google AI: Gemini Models · Google AI: Gemini Pricing · xAI Docs: Models · Moonshot AI: Kimi K3 Pricing · DeepSeek API Docs: Pricing · Z.ai Docs: Pricing · Meta Model API (Developer) · Alibaba Cloud Model Studio: Pricing · Mistral Docs: Models · Artificial Analysis: Intelligence Index · Claude Docs:迁移至 Claude Opus 5

模型对决

问题不是“哪个模型最好”,而是“这一件具体任务该用哪个模型”。四组直接对比,依据价格和厂商自身说法整理而成——并回答了最关键的问题:什么时候更贵的模型并不划算。价格和数字:截至 2026 年 7 月。

⚔️ Haiku 4.5 vs. Sonnet 5

这个任务是机械且明确的——还是你需要一个会“动脑子”的模型?

Claude Haiku 4.5

适用于机械、边界清晰、没有解读空间的任务——指令明确,没有什么需要判断的,只需要执行。

  • 根据 diff 生成提交信息
  • 在 100 行日志中按已知错误模式进行过滤
  • 在 40 个文件中统一重命名某个 JSON 字段

Claude Sonnet 5

适用于构建功能、进行多步骤调试,或者在修改代码之前需要先弄清楚代码是如何运作的情况。

  • 构建一个涉及多个文件和模块的新功能
  • 排查一个错误原因不在报错信息中的 bug
  • 理解陌生代码,然后干净利落地对其进行扩展

💸 什么时候不值得: 经验法则:把 Sonnet 5 用在简单、明确的编辑任务上是在浪费钱——Sonnet 的价格是 $2/$10 每 MTok(输入/输出,推出价有效期至 31.08.2026),之后为 $3/$15,而 Haiku 4.5 只要 $1/$5(截至 2026 年 7 月)——对于一个 Haiku 同样能出色完成的任务,价格却贵了 2 到 3 倍。反过来,一旦需求变得隐晦,Haiku 就会力不从心:比如“把这个改得更干净一点”却没有定义什么是“干净”、需要在两种都合理的方案之间做架构取舍,或者一个任务需要你先理解代码上下文才知道到底该做什么。

📊 SWE-bench Verified:73.3% —— Anthropic 官方数据显示,Haiku 4.5 在 SWE-bench Verified 上达到 73.3%——接近那些价格明显更高的模型。这是 Anthropic 自己给出的数据,并非独立测试结果,但也说明:在表述清晰的编程任务上,Haiku 的表现很强,而不只是“快且便宜”。(截至 2026 年 7 月)

Anthropic: Claude Haiku · Anthropic-Plattform: Preise · Claude Code 文档:成本

⚔️ Sonnet 5 vs. Opus 4.8 / Fable 5

标准主力模型就够用了——还是你需要旗舰模型?

Claude Sonnet 5

作为处理日常编程工作的默认选择。Anthropic 针对 Claude Code 的官方指导是:“Sonnet handles most coding tasks well and costs less than Opus.”

  • 在正在进行的项目中处理日常功能开发和 bug 修复
  • 代码评审和常规重构
  • 不需要数小时自主自我纠错的调试会话

Claude Opus 4.8 / Fable 5

适用于复杂的架构决策、跨越多个文件和子系统的棘手 bug,或是需要大量自我纠错的长时间自主智能体运行任务。

  • 规划一次同时影响多个模块的架构重新设计
  • 排查一个横跨 10 多个文件和多个子系统的 bug
  • 一次长达数小时的自主运行,模型自己进行调研、执行操作并验证自己的结果——据 Anthropic 介绍,这正是 Fable 5 的强项:“sustains long autonomous sessions, investigates before acting, and verifies its work more often than smaller models.”

💸 什么时候不值得: 经验法则:用旗舰模型来处理日常编辑,就是在烧钱。Sonnet 5 的价格是 $2/$10 每 MTok(输入/输出,推出价有效期至 31.08.2026),之后为 $3/$15。Opus 4.8 的价格是 $5/$25——是 Sonnet 的 1.7 到 2.5 倍,具体取决于你比较的是哪个价格档位。Fable 5 的价格是 $10/$50——是 Sonnet 的 3.3 到 5 倍(所有数字截至 2026 年 7 月)。Anthropic 自己的指导原则把 Opus 保留给“complex architectural decisions or multi-step reasoning”;Fable 5 在任何账户类型下都不是默认模型,必须通过 `/model fable` 手动选择——它并非为常规工作而定位。

Anthropic: Claude Opus · Anthropic-Plattform: Einführung Fable 5 · Anthropic-Plattform: Preise · Claude Code 文档:模型选择 · Claude Code 文档:成本

⚔️ Gemini 3.5 Flash vs. Gemini 3.1 Pro Preview

这款被 Google 自己称为“最智能”的快速模型——还是价格更高的预览版旗舰模型?

Gemini 3.5 Flash

作为处理智能体和编程任务的默认选择。Google 自己将其定位为“most intelligent model for sustained frontier performance on agentic and coding tasks”——而不是 Pro 模型。

  • 包含大量连续工具调用的智能体编程工作流
  • 需要搜索和事实核查(grounding)能力的任务(Google 称之为“superior search and grounding”)
  • 几乎所有以前你会下意识选择“Pro”的场景,现在都可以先用它试试

Gemini 3.1 Pro Preview

当你想专门测试 Google 为复杂问题解决而定位的 Pro 模型时使用——并且能接受它仍处于预览阶段。注意:Flash 和 Pro 拥有相同的 1M 上下文长度。

  • Google 明确将 Pro 定位于复杂问题解决场景——但要知道,超过 200,000 Token 的提示词在 Pro 上会进入更贵的价格档位
  • Google 将 Pro 描述为“the best model family … for multimodal understanding, agentic capabilities, and vibe-coding”的探索性场景

💸 什么时候不值得: 一个有趣的事实(截至 2026 年 7 月):在 Google 自己的模型文档中,被列为“most intelligent model”的偏偏是速度更快的 Flash 模型,而 Pro 模型不仅仍处于预览阶段,每个 Token 的价格还明显更高:Flash 为 $1.50/$9 每 MTok(输入/输出),而 Pro 为 $2–4/$12–18(按提示词长度分级)。经验法则:对于大多数编程任务而言,目前很难为 Pro 预览版的加价找到理由——你多付的钱,买的是一个连 Google 自己都不认为是最智能的模型。两款模型拥有相同的约 1M 上下文——所以长上下文并不是选择 Pro 的理由;提示词超过 200k 时 Pro 还会变得更贵,而 Flash 保持不变。只有当你确实需要 Pro 针对复杂问题解决的定位时,选它才划算。

Google AI:Gemini 模型概览 · Google AI: Preise · Google AI: Gemini 3.5 Flash · Google AI: Gemini 3.1 Pro Preview

⚔️ 订阅 vs. API 计费(按 Token 付费)

有额度上限的固定费用——还是没有上限的按量计费?

订阅(例如 Claude Pro/Max、ChatGPT Plus/Pro、Cursor 订阅)

适用于你想要可预测、有上限的费用,并且使用频率稳定但不算极端的情况——每月固定价格,而不是波动的账单。

  • 个人开发者每天使用 Claude Code 或 Cursor
  • 团队席位需要可预测的月度预算,而不是波动的 API 账单

API / 按 Token 付费

适用于用量波动很大、需要跑自动化批处理任务,或者需要的用量超出订阅额度上限的情况。

  • 夜间大批量处理——所有 Claude 模型的 Batch API 对输入和输出都提供 50% 的折扣(截至 2026 年 7 月)
  • 每天自动调用几次 Haiku 4.5 这类便宜模型的 CI 步骤
  • 通过 Prompt Caching 反复使用大段上下文——命中缓存的价格只是正常输入价格的 0.1 倍,也就是便宜 90%(截至 2026 年 7 月)

💸 什么时候不值得: 经验法则:对偶尔使用的用户来说,按 Token 付费的 API 很少划算——使用不规律、量又小的情况下,固定价格的订阅通常更便宜,而且你也不用时刻盯着 Token 用量。反过来,订阅对大批量处理来说是错误的选择:订阅额度是为交互式会话使用设计的,不是为成千上万次自动化调用设计的——这种场景下,带有批处理折扣(Claude 为 50%)和 Prompt Caching(对重复上下文最高可省 90%)的 API 明显更划算(截至 2026 年 7 月)。

Anthropic-Plattform: Preise (Batch, Caching) · Claude: Pricing (Abos)

💶 价格计算器——你的用量每月要花多少?

≈ 每月费用(30 天,按目录价)

DeepSeek-V4-Pro
$15.66
GLM-4.7
$24.60
Kimi K2.5
$27.00
Haiku 4.5
$45.00
GPT-5.6 Luna
$48.00
Muse Spark 1.1
$50.25
Gemini 3.5 Flash
$72.00
Grok 4.5
$78.00
Gemini 3.1 Pro
$96.00
Qwen3.7-Max
$97.50
GPT-5.6 Terra
$120
Sonnet 5
$135
Kimi K3
$135
Opus 4.8
$225
GPT-5.6 Sol
$240
Fable 5
$450

Sonnet 5:2026-08-31 前为推广价 $2/$10——计算器使用常规价 $3/$15。 Gemini 3.1 Pro:价格适用于 200k 以内的提示;超过为 $4/$18。
价格来自各官方定价页(截至 2026 年 7 月),不含缓存/折扣/订阅——实际费用可能不同。来源: Anthropic Pricing · OpenAI Models · Gemini API Pricing · xAI Models · Kimi Pricing · DeepSeek Pricing · Z.ai Pricing · Meta Model API · Alibaba Model Studio

工具内部:什么任务用什么模型?

每个工具都有自己的默认模型,以及针对特定任务的推荐用法。这里介绍如何切换模型——以及什么时候值得切换。

Claude Code

默认模型取决于账户(自Claude Code v2.1.219起大多为Opus 5或Sonnet 5)——可通过`/model <name>`或`/model`选择器进行切换。

日常编程任务

sonnet 能很好地处理大多数任务,且比 Opus 便宜(据 Anthropic 介绍)。

复杂的架构决策

opus 推荐用于复杂的推理任务(据 Anthropic 介绍)。

简单的子智能体任务

haiku 对简单任务而言快速且高效(据 Anthropic 介绍)。

Claude Code 文档:Model Config · Claude Code 文档:Costs

Codex CLI

默认模型是 GPT-5.6 Sol,推理强度为“medium”——可以用 `/model` 或 `codex --model <id>` 切换。

注重细节和精确度的工作

5.6 Sol “用于细节打磨”——如果拿不准,先从 Sol 开始(据 OpenAI 介绍)。

日常主力模型

5.6 Terra 以更低成本媲美 GPT-5.5 的表现(据 OpenAI 介绍)。

清晰、可重复的工作

5.6 Luna 该系列中成本最低(据 OpenAI 介绍)。

OpenAI:Codex 模型 · OpenAI: Codex CLI Quickstart

Cursor

通过选择器来选模型;“Auto”会自动在智能水平、成本和可靠性之间做平衡。

日常任务

Auto “适合日常任务”(据 Cursor 介绍)。

复杂的多步骤任务

Premium / Grok 4.5 Premium 会选用能力最强的模型;Grok 4.5 是 Cursor 自己的旗舰模型(据 Cursor 介绍)。

快速的交互式编程

Composer Cursor 快速、性价比高的模型,专为交互式编程打造(据 Cursor 介绍)。

Cursor Docs: Models · Cursor Help: Available Models

Aider

目前没有统一记录在案的默认模型——你需要通过 `--model` 或 API 密钥环境变量来指定自己的模型。

选择模型

--model <name> Aider 刻意做到与模型无关——几乎可以搭配任何 LLM 运行(据 Aider 文档介绍)。

列出某个厂商的模型

--list-models anthropic/ 在选择之前列出某个厂商的可用模型。

精细设置(例如思考预算 Thinking-Budget)

.aider.model.settings.yml 针对单个项目的持久化高级模型设置。

Aider Docs: LLMs · Aider Docs: Anthropic

Antigravity CLI

所有套餐都包含两款 Gemini 核心模型(3.5 Flash、3.1 Pro)——用 `/model` 切换;除 Enterprise 外,所有套餐都有第三方模型(Claude、GPT-OSS)。

快速的日常任务

Gemini 3.5 Flash 所有套餐均可使用,定位于智能体和编程任务(据 Google 介绍)。

更复杂的问题

Gemini 3.1 Pro 智能水平更高,同样所有套餐均可使用(据 Google 介绍)。

使用第三方模型

Claude Opus/Sonnet 4.6(Enterprise 除外) 在 Free、Google AI Plus、Pro 和 Ultra 均可使用;只有 Enterprise 套餐不提供。

Antigravity 文档:模型 · Antigravity 文档:套餐

工具直接对比

Claude Code

CLI + IDE 扩展 + WebOpen Source: Claude 订阅或 API 费用

在终端中进行智能体工作:长任务、自动化、循环任务、子智能体。

  • 内置子智能体、Hooks 和 MCP 接入
  • Artifacts:可直接从会话生成的可分享实时页面
  • 默认模型取决于订阅类型(Opus 4.8 或 Sonnet 5,Sonnet 5 支持 1M Token 上下文)——可通过 /model 切换
  • ⚠️ 没有图形化编辑器——以终端为核心的方式见仁见智
  • ⚠️ 绑定在 Claude 生态系统中

Claude Code 文档:What's new · Claude Code 文档:Subagents

Cursor

IDE(基于 VS Code)Open Source: 订阅

以 IDE 为核心:所见即所得,点击编辑——同时有智能体在后台运行。

  • 后台和云端智能体会在你编辑时持续工作
  • Composer 用于多文件改动
  • Automations:智能体可根据仓库事件或定时器自动启动
  • ⚠️ 闭源,订阅制
  • ⚠️ 已宣布被 SpaceX 收购(16.06.2026)——未来走向有待观察

Cursor Changelog · TechCrunch: SpaceX to acquire Cursor

OpenAI Codex CLI

CLIOpen Source: ChatGPT 订阅或 API

适合生活在 OpenAI 生态系统中、又想要一个开放式 CLI 的人。

  • 子智能体:最多可 6 个并行运行
  • 通过持久 WebSocket 实现快速往返通信
  • 已捆绑集成到 ChatGPT 桌面应用中
  • ⚠️ 其优势高度依赖 OpenAI 的模型阵容
  • ⚠️ 比同类产品更年轻,生态系统仍在发展中

OpenAI Codex Changelog

Aider

CLIOpen Source: 免费——你只需支付自己使用的模型 API 费用

完全掌控:自选模型、自备密钥、原生 Git 工作方式。

  • 与模型无关——几乎可以搭配任何 LLM 运行
  • 原生 Git 支持:每次改动都会生成清晰的自动提交
  • 完全开源,不绑定任何厂商
  • ⚠️ 自动化的便利程度不如大型套件产品
  • ⚠️ 配置和选择模型都需要你自己动手

Aider — 官方网站

Antigravity CLI

CLIOpen Source: Google 账户——Free/Pro/Ultra 额度(不支持自带 API 密钥)

面向个人用户、作为 Gemini CLI 的继任者:Google 生态系统中的终端智能体,支持 MCP、插件和 Skills。

  • 被 Google 官方指定为面向个人用户的 Gemini CLI 继任产品
  • 完整的 MCP 支持(stdio + 远程)以及自有的插件/Skill 系统(`agy plugin`、`/skills`)
  • 与其他 CLI 一样,提供用于脚本的非交互模式(`agy -p`)
  • ⚠️ 产品非常新(仓库始建于 2026 年 5 月)——仓库中没有开源许可证文件(`license: null`)
  • ⚠️ 免费额度仅有定性描述(“meaningful”/“generous”),没有具体数字

Google Blog: Transition von Gemini CLI zu Antigravity CLI · Antigravity CLI 文档:命令参考

来源: All claims come from the linked official sources; the loop fixes reported errors. 🐛 button bottom right.