我该在什么时候用什么?—— 模型与工具对比
七种常见场景,一键直达:我们为你展示对应的工具、模型,以及一个可以直接照做的示例。接下来你会看到各大厂商目前所有的模型,以及每个工具默认使用的是哪一个。
Stand / as of: 2026-07-28 · Benchmark overview → · 📊 Model timeline →
🧭 你想做什么?—— 点击你的场景
每美元智能:所有主流模型一览
每个点代表一个模型。越靠右越贵(每 100 万 token 的价格,输入:输出按 3:1 混合计算,对数坐标),越靠上越聪明(Artificial Analysis 的智能指数,v4.1)。左上角是最佳平衡点。
价格为各厂商官方 API 标价(不含批处理/缓存折扣),指数为 Artificial Analysis Intelligence Index v4.1,采用其测试时使用的配置(通常为最高推理强度)。数据截至 2026 年 7 月 17 日——数字变化很快。
🎬 短视频版
10 秒看懂图表:越右越贵,越上越聪明——最佳选择在哪里。
排行榜:每美元智能
用智能指数除以混合价格(每 100 万 token,3 份输入 + 1 份输出)。数值越高,代表每美元获得的思考能力越多。这不代表绝对最强——那要看指数本身。
| # | 模型 | 智能/美元 |
|---|---|---|
| 1 | DeepSeek-V4-Pro ✳ · DeepSeek | 81.4 |
| 2 | GLM-4.7 ✳ · Zhipu/Z.ai | 33.7 |
| 3 | Kimi K2.5 ✳ · Moonshot | 29.5 |
| 4 | Muse Spark 1.1 · Meta | 25.3 |
| 5 | GPT-5.6 Luna · OpenAI | 22.8 |
| 6 | Grok 4.5 · xAI | 17.9 |
| 7 | Gemini 3.5 Flash · Google | 14.9 |
| 8 | Sonnet 5 (Intro-Preis) · Anthropic | 13.3 |
| 9 | Qwen3.7-Max · Alibaba | 12.3 |
| 10 | Haiku 4.5 · Anthropic | 11.9 |
| 11 | Gemini 3.1 Pro · Google | 10.3 |
| 12 | Mistral Medium 3.5 ✳ · Mistral | 10.0 |
| 13 | GPT-5.6 Terra · OpenAI | 9.8 |
| 14 | Kimi K3 · Moonshot | 9.5 |
| 15 | Opus 5 · Anthropic | 6.1 |
| 16 | Opus 4.8 · Anthropic | 5.6 |
| 17 | GPT-5.6 Sol · OpenAI | 5.2 |
| 18 | Fable 5 · Anthropic | 3.0 |
- Grok 4.5:该价格适用于 200K 以内的上下文——超过后价格翻倍(此时比率约为 9.0)。
- Gemini 3.1 Pro:该价格适用于 200K 以内的提示词——超过后为 4 美元/18 美元(此时比率约为 6.2)。
- Qwen3.7-Max:目前有限时 50% 优惠活动(此时比率约为 24.5)——此处按标价计算。
- Sonnet 5:优惠价截至 2026 年 8 月 31 日,之后为 3 美元/15 美元(比率 8.9)。
- Mistral Large 3(0.50 美元/1.50 美元)和 Llama 4 Maverick(在托管平台上起价约 0.27 美元/0.85 美元)未列入排行榜,因为 Artificial Analysis 没有为它们提供指数。
- 数据来源:各厂商官方定价页面 + artificialanalysis.ai,均于 2026 年 7 月 17 日查询。
各大厂商的模型
来自 Anthropic、OpenAI、Google、xAI 的最新模型——现在还包括 Moonshot(Kimi)、DeepSeek、智谱(GLM)、Meta、阿里巴巴(通义千问)和 Mistral。附价格、上下文长度、优势和适用场景。
ANTHROPIC
Fable 5
Anthropic 能力最强、且广泛可用的模型——专为最苛刻的推理任务和长时间运行的智能体任务打造(据 Anthropic 介绍)。
- ✅ 据 Anthropic 介绍,能力等级最高,适合长时间的自主智能体运行
- ✅ 默认 1M Token 上下文
- ✅ 比更小的模型更频繁地检查自己的工作成果
- ✅ 自 2026 年 7 月 20 日起永久包含在 Max 与 Team Premium 中(额度为常规上限的 50%);Pro 和 Team Standard 获得一次性 100 美元额度,之后按 API 价格计费。
- ⚠️ 当前 Claude 系列中最贵的模型(10 $/50 $,截至 2026 年 7 月)
- ⚠️ 在 Claude Code 中不是默认模型——需要手动选择(`/model fable`)
→ 适用于风险高、耗时数小时的超大型任务。
Opus 5
面向复杂的智能体编码和企业工作——智能水平接近Fable 5的前沿水准,但价格只有一半(据Anthropic介绍)。
- ✅ 据Anthropic介绍,在编码基准测试(Frontier-Bench、GDPval-AA)中达到业界领先水平,在调研/知识型工作方面比Opus 4.8更强
- ✅ 五级努力程度调节器(从低到最高),用于权衡智能水平与Token消耗
- ✅ 智能指数60.69(Artificial Analysis v4.1,最高努力程度配置)——按数值计算甚至略高于Fable 5(59.86)
- ✅ 自Claude Code v2.1.219(2026年7月24日)起,成为Claude Code中新的标准Opus模型,也是Claude Max上新的默认模型
- ✅ 默认1M Token上下文,最大输出128K
- ⚠️ 快速模式(Fast Mode)价格翻倍(10美元/50美元每MTok),且只能通过Anthropic API或订阅额度使用——不支持Amazon Bedrock、Google Clouds Agent Platform、Microsoft Foundry或Claude Platform on AWS
- ⚠️ 在日常任务中比Sonnet 5更贵
→ 适用于复杂的智能体编码任务和企业知识型工作,适合追求接近Fable 5质量但不想支付其价格的场景。
Opus 4.8
用于复杂的智能体编程和企业级工作——一款面向严肃编程和知识工作的高端模型(据 Anthropic 介绍)。
- ✅ 推荐用于复杂的架构决策和多步推理
- ✅ 1M Token 上下文
- ⚠️ 在类似的日常任务上比 Sonnet 5 更贵
- ⚠️ 已被 Opus 5 取代:价格相同,智能指数更高。Anthropic 不再将 Opus 4.8 列入主要对比表,并提供了迁移指南——但它并未被弃用,目前也没有停用日期。
→ 对于新项目,Opus 5 是更好的选择:价格相同,版本更新。如果不想更改现有工作流程,Opus 4.8 仍然适用。
Sonnet 5
速度与智能的最佳结合——迄今为止最具智能体特质的 Sonnet 系列(据 Anthropic 介绍)。
- ✅ 能很好地完成大多数编程任务
- ✅ 比 Opus 便宜
- ✅ Pro/Team 标准账户在 Claude Code 中的默认模型
- ⚠️ 在非常复杂的架构问题上不如 Opus/Fable
→ 作为处理大多数编程任务的日常模型使用。
Haiku 4.5
具有接近前沿智能水平、速度最快的模型——以更低的价格提供 Anthropic 最强模型的轻量版本(据 Anthropic 介绍)。
- ✅ 最便宜的 Claude 模型
- ✅ 速度非常快
- ✅ 根据 Anthropic 自己的数据,在 SWE-bench Verified 上达到 73.3%
- ⚠️ 上下文窗口更小(200K 而非 1M)
- ⚠️ 在非常复杂的任务上不如 Sonnet/Opus
→ 适用于低成本实验,以及简单、边界清晰的任务。
OPENAI
GPT-5.6 Sol
面向复杂专业工作的前沿模型——用于复杂推理和编程的旗舰模型(据 OpenAI 介绍)。
- ✅ GPT-5.6 系列中最强的模型
- ✅ Codex CLI 中的默认模型(推理强度为“medium”)
- ⚠️ 5.6 系列中最贵的模型
→ 适用于注重细节和精确度的任务。
GPT-5.6 Terra
在智能水平和成本之间取得平衡——大致相当于早期 GPT-5 系列中的 mini 级别模型(据 OpenAI 介绍)。
- ✅ 在成本与能力之间取得了不错的平衡
- ✅ 在 Codex CLI 中被推荐为“日常主力模型”
- ⚠️ 在最难的任务上不如 Sol
→ 当 Sol 太贵时,可作为日常模型使用。
GPT-5.6 Luna
针对成本敏感型工作负载优化——大致相当于 nano 级别模型(据 OpenAI 介绍)。
- ✅ 5.6 系列中最便宜的模型
- ✅ 在 Codex CLI 中被推荐用于“清晰、可重复的工作”
- ⚠️ OpenAI 仅将其定位于清晰、可重复的工作
→ 适用于大批量、简单且重复性的编程任务。
GPT-5.3-Codex
迄今为止能力最强的智能体编程模型——针对 Codex 或类似环境中的智能体编程任务进行了优化(据 OpenAI 介绍)。
- ✅ 专门针对智能体编程进行了优化
- ✅ 在保持强劲编程表现的同时比 Sol 更便宜
- ⚠️ 在使用 ChatGPT 登录的 Codex 中被标记为已弃用——可用性不一致(截至 2026 年 7 月)
→ 如果你想要专门针对智能体编程优化的质量,而不是通用模型,就用它。
Gemini 3.5 Flash
在智能体和编程任务上具备持续前沿表现的最智能模型(据 Google 介绍)。
- ✅ 尽管名字里带“Flash”,Google 仍将其定位为“最智能”的模型
- ✅ 提供免费额度
- ✅ 比 Google 自家的 Pro 模型更便宜
- ⚠️ 知识截止日期为 2025 年 1 月
→ 作为 Google 对智能体编程任务的首选推荐使用。
Gemini 3.1 Flash-Lite
以极低的成本达到与更大模型相当的前沿级性能——用于大批量智能体任务时性价比最高的模型(据 Google 介绍)。
- ✅ 本次对比中最便宜的模型
- ✅ 提供免费额度
- ⚠️ 并非面向复杂任务定位
→ 适用于翻译、简单数据处理,以及大批量、简单的智能体运行任务。
Gemini 3.1 Pro
先进的智能水平、复杂问题解决能力,以及强大的智能体和 Vibe Coding 能力(据 Google 介绍)——目前仍处于预览阶段。
- ✅ Google 处理复杂多步任务能力最强的模型
- ✅ 据 Google 介绍,具备强大的 Vibe Coding 能力
- ⚠️ 仍处于预览阶段,没有免费额度
- ⚠️ 比 Flash 更贵(提示词超过 200K 时还会再分一档)
→ 适用于 Flash 力所不及的复杂多步问题。
XAI
Grok 4.5
xAI:“For everything else, including code, use Grok 4.5. It is the most intelligent and fastest model we’ve built.” Cursor 与其共同训练,并将其称为自己的旗舰模型。
- ✅ 由 Cursor 共同训练,作为其旗舰合作模型
- ✅ 比其他厂商的多数顶级模型更便宜
- ⚠️ 上下文窗口比同类竞品更小(500K 而非 1M)
→ 在 Cursor 中用于最难的任务——据 xAI 介绍,这是他们最智能、最快的模型。
Grok 4.3
未找到官方定位说明——在与 Grok 4.5 相同的 xAI 模型页面上,被列为价格更低、上下文更大的姊妹模型。
- ✅ 比 Grok 4.5 拥有更大的上下文(1M 而非 500K)
- ✅ 比 Grok 4.5 更便宜
- ⚠️ 文档极少——未找到独立的定位说明或模型页面
→ 当 Grok 4.5 太贵时,可作为上下文更大、价格更低的 xAI 替代方案使用。
MOONSHOT AI
Kimi K3
全新发布(2026 年 7 月 16 日):据 Moonshot 称,是全球最大的开源权重模型(2.8 万亿参数,MoE 架构)——智能指数排名第 3,仅次于 Fable 5 和 GPT-5.6 Sol。
- ✅ 智能指数 57.11——所有模型中排名第 3(Artificial Analysis,2026 年 7 月 17 日)
- ✅ 智能体网页搜索能力:BrowseComp 91.2(Moonshot 数据)
- ✅ 整个 1M 上下文范围内价格统一,自动缓存
- ⚠️ 截至 2026 年 7 月 17 日,权重尚不可下载——开源发布计划于 2026 年 7 月 27 日
- ⚠️ 思考模式始终开启——不适合追求又快又便宜的回答
→ 适合复杂的智能体和研究任务,当你想要比 Fable/Sol 更便宜的前沿性能时选它。
Kimi K2.5
前代模型:1 万亿参数 MoE,开源权重(Modified MIT 协议),仍可使用,价格明显更便宜。
- ✅ SWE-bench Verified 76.8%(Moonshot 数据),价格实惠
- ✅ 开源权重——可自行部署
- ✅ 多模态 + 智能体搜索
- ⚠️ 指数 35.37——明显低于 K3 和前沿模型
→ 适合低成本的智能体编程,或需要自行部署且性能尚可的场景。
DEEPSEEK
DeepSeek-V4-Pro
本页的性价比之王:每美元智能无人能及(比率 81)——采用 MIT 许可的开源权重。
- ✅ 遥遥领先的每美元智能比(指数 44.27,混合价 0.54 美元)
- ✅ SWE-bench Verified 80.6%(DeepSeek 数据,Pro-Max 模式)
- ✅ 同时兼容 OpenAI 和 Anthropic 的 API,开源权重(MIT)
- ⚠️ 绝对性能水平低于前沿模型
- ⚠️ 基准测试数据来自厂商自述,未经独立验证
→ 适合需要低成本处理大量任务,或想自行部署一个强大模型的场景。
ZHIPU / Z.AI
GLM-4.7
中国的开源编程主力:358B MoE 架构,MIT 许可,擅长智能体编程和前端生成。
- ✅ SWE-bench Verified 73.8%(智谱数据),价格实惠
- ✅ 开源权重(MIT)——可通过 vLLM/SGLang 自行部署,提供 44 种量化版本
- ✅ 免费的 Flash 版本可供试用
- ⚠️ 指数 33.70——在复杂推理方面不如其他模型
- ⚠️ 智谱已推出更新的 GLM-5 系列——4.7 已不再是自家的旗舰模型
→ 适合低成本智能体编程、网页/前端生成,或作为自行部署的基础模型。
META
Muse Spark 1.1
Meta 首个闭源前沿模型(2026 年 7 月 9 日)——通过全新的 Meta Model API 提供,专为跨应用、MCP 服务器和技能的智能体编排而设计。
- ✅ 指数 50.62,混合价仅 2 美元——每美元智能比排名第 4
- ✅ 核心定位是智能体编排(应用/MCP/技能,零样本)
- ✅ 兼容 OpenAI SDK 的 API,提供 20 美元起始额度
- ⚠️ 并非开源权重——打破了 Meta 的 Llama 传统
- ⚠️ 部分公开基准测试仅以图表图片形式发布
→ 适合以合理价格构建多应用智能体和工具编排。
Llama 4 Maverick
Meta 目前的开源权重旗舰模型(400B MoE,原生多模态)——在 Together、Groq 或 Fireworks 等托管平台上运行成本极低。
- ✅ 本页中价格最低的模型
- ✅ 开源权重 + 可自行部署
- ✅ 多模态,支持 12 种语言
- ⚠️ 未列入 Artificial Analysis 指数——可比性有限
- ⚠️ Llama 4 社区许可证不符合 OSI 标准(用户超过 7 亿时有额外限制)
→ 适合以最低成本进行大批量处理,或用于自行部署。
ALIBABA (QWEN)
Qwen3.7-Max
阿里巴巴的智能体旗舰模型(「为智能体时代而设计」)——首次采用闭源而非开源权重,同价提供混合推理能力。
- ✅ SWE-bench Verified 80.4%,GPQA Diamond 92.4(阿里巴巴数据)
- ✅ 核心专注于长达数百步骤的长程智能体任务
- ✅ 多语言能力极强(WMT24++ 85.8)
- ⚠️ 不支持自行部署——打破了通义千问的开源权重传统
- ⚠️ 指数 45.99,低于西方前沿模型
→ 适合长链智能体任务和多语言场景——尤其是在优惠期间。
MISTRAL
Mistral Large 3
欧洲的开源权重旗舰模型(675B MoE,Apache 2.0 协议)——支持视觉、函数调用,并可选择在欧盟境内托管。
- ✅ Apache 2.0 开源权重——在各大厂商中许可最自由
- ✅ 相对其规模非常便宜
- ✅ 支持欧盟托管/数据主权
- ⚠️ 未列入 Artificial Analysis 指数
- ⚠️ 基准测试数据大多仅以图表图片形式发布
→ 适合看重开源、欧盟托管或 Apache 许可证的场景。
Mistral Medium 3.5
Mistral 的编程专用模型:128B 稠密架构,Modified MIT 协议,以其规模而言 SWE-bench 分数很出色。
- ✅ SWE-bench Verified 77.6%(Mistral 数据)
- ✅ 开源权重(Modified MIT)
- ✅ 体量足够小,适合自行部署
- ⚠️ 指数 29.95——在广泛推理能力上弱于 MoE 巨头模型
→ 适合在自有基础设施上运行的编程智能体。
Claude Docs: Models Overview ↗ · Claude Docs: Pricing ↗ · Anthropic: Claude Sonnet 5 Launch ↗ · OpenAI Docs: Pricing ↗ · OpenAI Docs: GPT-5.6 Sol ↗ · Google AI: Gemini Models ↗ · Google AI: Gemini Pricing ↗ · xAI Docs: Models ↗ · Moonshot AI: Kimi K3 Pricing ↗ · DeepSeek API Docs: Pricing ↗ · Z.ai Docs: Pricing ↗ · Meta Model API (Developer) ↗ · Alibaba Cloud Model Studio: Pricing ↗ · Mistral Docs: Models ↗ · Artificial Analysis: Intelligence Index ↗ · Claude Docs:迁移至 Claude Opus 5 ↗
模型对决
问题不是“哪个模型最好”,而是“这一件具体任务该用哪个模型”。四组直接对比,依据价格和厂商自身说法整理而成——并回答了最关键的问题:什么时候更贵的模型并不划算。价格和数字:截至 2026 年 7 月。
⚔️ Haiku 4.5 vs. Sonnet 5
这个任务是机械且明确的——还是你需要一个会“动脑子”的模型?Claude Haiku 4.5
适用于机械、边界清晰、没有解读空间的任务——指令明确,没有什么需要判断的,只需要执行。
- 根据 diff 生成提交信息
- 在 100 行日志中按已知错误模式进行过滤
- 在 40 个文件中统一重命名某个 JSON 字段
Claude Sonnet 5
适用于构建功能、进行多步骤调试,或者在修改代码之前需要先弄清楚代码是如何运作的情况。
- 构建一个涉及多个文件和模块的新功能
- 排查一个错误原因不在报错信息中的 bug
- 理解陌生代码,然后干净利落地对其进行扩展
💸 什么时候不值得: 经验法则:把 Sonnet 5 用在简单、明确的编辑任务上是在浪费钱——Sonnet 的价格是 $2/$10 每 MTok(输入/输出,推出价有效期至 31.08.2026),之后为 $3/$15,而 Haiku 4.5 只要 $1/$5(截至 2026 年 7 月)——对于一个 Haiku 同样能出色完成的任务,价格却贵了 2 到 3 倍。反过来,一旦需求变得隐晦,Haiku 就会力不从心:比如“把这个改得更干净一点”却没有定义什么是“干净”、需要在两种都合理的方案之间做架构取舍,或者一个任务需要你先理解代码上下文才知道到底该做什么。
📊 SWE-bench Verified:73.3% —— Anthropic 官方数据显示,Haiku 4.5 在 SWE-bench Verified 上达到 73.3%——接近那些价格明显更高的模型。这是 Anthropic 自己给出的数据,并非独立测试结果,但也说明:在表述清晰的编程任务上,Haiku 的表现很强,而不只是“快且便宜”。(截至 2026 年 7 月)
Anthropic: Claude Haiku ↗ · Anthropic-Plattform: Preise ↗ · Claude Code 文档:成本 ↗
⚔️ Sonnet 5 vs. Opus 4.8 / Fable 5
标准主力模型就够用了——还是你需要旗舰模型?Claude Sonnet 5
作为处理日常编程工作的默认选择。Anthropic 针对 Claude Code 的官方指导是:“Sonnet handles most coding tasks well and costs less than Opus.”
- 在正在进行的项目中处理日常功能开发和 bug 修复
- 代码评审和常规重构
- 不需要数小时自主自我纠错的调试会话
Claude Opus 4.8 / Fable 5
适用于复杂的架构决策、跨越多个文件和子系统的棘手 bug,或是需要大量自我纠错的长时间自主智能体运行任务。
- 规划一次同时影响多个模块的架构重新设计
- 排查一个横跨 10 多个文件和多个子系统的 bug
- 一次长达数小时的自主运行,模型自己进行调研、执行操作并验证自己的结果——据 Anthropic 介绍,这正是 Fable 5 的强项:“sustains long autonomous sessions, investigates before acting, and verifies its work more often than smaller models.”
💸 什么时候不值得: 经验法则:用旗舰模型来处理日常编辑,就是在烧钱。Sonnet 5 的价格是 $2/$10 每 MTok(输入/输出,推出价有效期至 31.08.2026),之后为 $3/$15。Opus 4.8 的价格是 $5/$25——是 Sonnet 的 1.7 到 2.5 倍,具体取决于你比较的是哪个价格档位。Fable 5 的价格是 $10/$50——是 Sonnet 的 3.3 到 5 倍(所有数字截至 2026 年 7 月)。Anthropic 自己的指导原则把 Opus 保留给“complex architectural decisions or multi-step reasoning”;Fable 5 在任何账户类型下都不是默认模型,必须通过 `/model fable` 手动选择——它并非为常规工作而定位。
Anthropic: Claude Opus ↗ · Anthropic-Plattform: Einführung Fable 5 ↗ · Anthropic-Plattform: Preise ↗ · Claude Code 文档:模型选择 ↗ · Claude Code 文档:成本 ↗
⚔️ Gemini 3.5 Flash vs. Gemini 3.1 Pro Preview
这款被 Google 自己称为“最智能”的快速模型——还是价格更高的预览版旗舰模型?Gemini 3.5 Flash
作为处理智能体和编程任务的默认选择。Google 自己将其定位为“most intelligent model for sustained frontier performance on agentic and coding tasks”——而不是 Pro 模型。
- 包含大量连续工具调用的智能体编程工作流
- 需要搜索和事实核查(grounding)能力的任务(Google 称之为“superior search and grounding”)
- 几乎所有以前你会下意识选择“Pro”的场景,现在都可以先用它试试
Gemini 3.1 Pro Preview
当你想专门测试 Google 为复杂问题解决而定位的 Pro 模型时使用——并且能接受它仍处于预览阶段。注意:Flash 和 Pro 拥有相同的 1M 上下文长度。
- Google 明确将 Pro 定位于复杂问题解决场景——但要知道,超过 200,000 Token 的提示词在 Pro 上会进入更贵的价格档位
- Google 将 Pro 描述为“the best model family … for multimodal understanding, agentic capabilities, and vibe-coding”的探索性场景
💸 什么时候不值得: 一个有趣的事实(截至 2026 年 7 月):在 Google 自己的模型文档中,被列为“most intelligent model”的偏偏是速度更快的 Flash 模型,而 Pro 模型不仅仍处于预览阶段,每个 Token 的价格还明显更高:Flash 为 $1.50/$9 每 MTok(输入/输出),而 Pro 为 $2–4/$12–18(按提示词长度分级)。经验法则:对于大多数编程任务而言,目前很难为 Pro 预览版的加价找到理由——你多付的钱,买的是一个连 Google 自己都不认为是最智能的模型。两款模型拥有相同的约 1M 上下文——所以长上下文并不是选择 Pro 的理由;提示词超过 200k 时 Pro 还会变得更贵,而 Flash 保持不变。只有当你确实需要 Pro 针对复杂问题解决的定位时,选它才划算。
Google AI:Gemini 模型概览 ↗ · Google AI: Preise ↗ · Google AI: Gemini 3.5 Flash ↗ · Google AI: Gemini 3.1 Pro Preview ↗
⚔️ 订阅 vs. API 计费(按 Token 付费)
有额度上限的固定费用——还是没有上限的按量计费?订阅(例如 Claude Pro/Max、ChatGPT Plus/Pro、Cursor 订阅)
适用于你想要可预测、有上限的费用,并且使用频率稳定但不算极端的情况——每月固定价格,而不是波动的账单。
- 个人开发者每天使用 Claude Code 或 Cursor
- 团队席位需要可预测的月度预算,而不是波动的 API 账单
API / 按 Token 付费
适用于用量波动很大、需要跑自动化批处理任务,或者需要的用量超出订阅额度上限的情况。
- 夜间大批量处理——所有 Claude 模型的 Batch API 对输入和输出都提供 50% 的折扣(截至 2026 年 7 月)
- 每天自动调用几次 Haiku 4.5 这类便宜模型的 CI 步骤
- 通过 Prompt Caching 反复使用大段上下文——命中缓存的价格只是正常输入价格的 0.1 倍,也就是便宜 90%(截至 2026 年 7 月)
💸 什么时候不值得: 经验法则:对偶尔使用的用户来说,按 Token 付费的 API 很少划算——使用不规律、量又小的情况下,固定价格的订阅通常更便宜,而且你也不用时刻盯着 Token 用量。反过来,订阅对大批量处理来说是错误的选择:订阅额度是为交互式会话使用设计的,不是为成千上万次自动化调用设计的——这种场景下,带有批处理折扣(Claude 为 50%)和 Prompt Caching(对重复上下文最高可省 90%)的 API 明显更划算(截至 2026 年 7 月)。
Anthropic-Plattform: Preise (Batch, Caching) ↗ · Claude: Pricing (Abos) ↗
💶 价格计算器——你的用量每月要花多少?
≈ 每月费用(30 天,按目录价)
Sonnet 5:2026-08-31 前为推广价 $2/$10——计算器使用常规价 $3/$15。 Gemini 3.1 Pro:价格适用于 200k 以内的提示;超过为 $4/$18。
价格来自各官方定价页(截至 2026 年 7 月),不含缓存/折扣/订阅——实际费用可能不同。来源: Anthropic Pricing · OpenAI Models · Gemini API Pricing · xAI Models · Kimi Pricing · DeepSeek Pricing · Z.ai Pricing · Meta Model API · Alibaba Model Studio
工具内部:什么任务用什么模型?
每个工具都有自己的默认模型,以及针对特定任务的推荐用法。这里介绍如何切换模型——以及什么时候值得切换。
Claude Code
默认模型取决于账户(自Claude Code v2.1.219起大多为Opus 5或Sonnet 5)——可通过`/model <name>`或`/model`选择器进行切换。
日常编程任务
sonnet 能很好地处理大多数任务,且比 Opus 便宜(据 Anthropic 介绍)。
复杂的架构决策
opus 推荐用于复杂的推理任务(据 Anthropic 介绍)。
简单的子智能体任务
haiku 对简单任务而言快速且高效(据 Anthropic 介绍)。
Codex CLI
默认模型是 GPT-5.6 Sol,推理强度为“medium”——可以用 `/model` 或 `codex --model <id>` 切换。
注重细节和精确度的工作
5.6 Sol “用于细节打磨”——如果拿不准,先从 Sol 开始(据 OpenAI 介绍)。
日常主力模型
5.6 Terra 以更低成本媲美 GPT-5.5 的表现(据 OpenAI 介绍)。
清晰、可重复的工作
5.6 Luna 该系列中成本最低(据 OpenAI 介绍)。
Cursor
通过选择器来选模型;“Auto”会自动在智能水平、成本和可靠性之间做平衡。
日常任务
Auto “适合日常任务”(据 Cursor 介绍)。
复杂的多步骤任务
Premium / Grok 4.5 Premium 会选用能力最强的模型;Grok 4.5 是 Cursor 自己的旗舰模型(据 Cursor 介绍)。
快速的交互式编程
Composer Cursor 快速、性价比高的模型,专为交互式编程打造(据 Cursor 介绍)。
Aider
目前没有统一记录在案的默认模型——你需要通过 `--model` 或 API 密钥环境变量来指定自己的模型。
选择模型
--model <name> Aider 刻意做到与模型无关——几乎可以搭配任何 LLM 运行(据 Aider 文档介绍)。
列出某个厂商的模型
--list-models anthropic/ 在选择之前列出某个厂商的可用模型。
精细设置(例如思考预算 Thinking-Budget)
.aider.model.settings.yml 针对单个项目的持久化高级模型设置。
Antigravity CLI
所有套餐都包含两款 Gemini 核心模型(3.5 Flash、3.1 Pro)——用 `/model` 切换;除 Enterprise 外,所有套餐都有第三方模型(Claude、GPT-OSS)。
快速的日常任务
Gemini 3.5 Flash 所有套餐均可使用,定位于智能体和编程任务(据 Google 介绍)。
更复杂的问题
Gemini 3.1 Pro 智能水平更高,同样所有套餐均可使用(据 Google 介绍)。
使用第三方模型
Claude Opus/Sonnet 4.6(Enterprise 除外) 在 Free、Google AI Plus、Pro 和 Ultra 均可使用;只有 Enterprise 套餐不提供。
工具直接对比
Claude Code
在终端中进行智能体工作:长任务、自动化、循环任务、子智能体。
- ✅ 内置子智能体、Hooks 和 MCP 接入
- ✅ Artifacts:可直接从会话生成的可分享实时页面
- ✅ 默认模型取决于订阅类型(Opus 4.8 或 Sonnet 5,Sonnet 5 支持 1M Token 上下文)——可通过 /model 切换
- ⚠️ 没有图形化编辑器——以终端为核心的方式见仁见智
- ⚠️ 绑定在 Claude 生态系统中
Cursor
以 IDE 为核心:所见即所得,点击编辑——同时有智能体在后台运行。
- ✅ 后台和云端智能体会在你编辑时持续工作
- ✅ Composer 用于多文件改动
- ✅ Automations:智能体可根据仓库事件或定时器自动启动
- ⚠️ 闭源,订阅制
- ⚠️ 已宣布被 SpaceX 收购(16.06.2026)——未来走向有待观察
OpenAI Codex CLI
适合生活在 OpenAI 生态系统中、又想要一个开放式 CLI 的人。
- ✅ 子智能体:最多可 6 个并行运行
- ✅ 通过持久 WebSocket 实现快速往返通信
- ✅ 已捆绑集成到 ChatGPT 桌面应用中
- ⚠️ 其优势高度依赖 OpenAI 的模型阵容
- ⚠️ 比同类产品更年轻,生态系统仍在发展中
Aider
完全掌控:自选模型、自备密钥、原生 Git 工作方式。
- ✅ 与模型无关——几乎可以搭配任何 LLM 运行
- ✅ 原生 Git 支持:每次改动都会生成清晰的自动提交
- ✅ 完全开源,不绑定任何厂商
- ⚠️ 自动化的便利程度不如大型套件产品
- ⚠️ 配置和选择模型都需要你自己动手
Antigravity CLI
面向个人用户、作为 Gemini CLI 的继任者:Google 生态系统中的终端智能体,支持 MCP、插件和 Skills。
- ✅ 被 Google 官方指定为面向个人用户的 Gemini CLI 继任产品
- ✅ 完整的 MCP 支持(stdio + 远程)以及自有的插件/Skill 系统(`agy plugin`、`/skills`)
- ✅ 与其他 CLI 一样,提供用于脚本的非交互模式(`agy -p`)
- ⚠️ 产品非常新(仓库始建于 2026 年 5 月)——仓库中没有开源许可证文件(`license: null`)
- ⚠️ 免费额度仅有定性描述(“meaningful”/“generous”),没有具体数字
Google Blog: Transition von Gemini CLI zu Antigravity CLI ↗ · Antigravity CLI 文档:命令参考 ↗
来源: All claims come from the linked official sources; the loop fixes reported errors. 🐛 button bottom right.