主流大模型选型与价格(2026-07-13 基线版)
本文定位:在 AI 全景概览 第 1 块基础上做的深挖版——聚焦模型选型决策,含 2026 年最新 API 价格、缓存与上下文机制。 数据时效:API 调价是动态的,建议每季度核验一次。本表为 2026-07-13 搜索快照。
一、2026 年 API 价格速查(按百万 token 美元)
1.1 最低价梯队($0.05-0.30 输入)
[已在搜索结果确认的事实]
| 模型 | 输入 $ | 输出 $ | 备注 |
|---|---|---|---|
| OpenAI GPT-5 nano | $0.05 | $0.40 | OpenAI 极低成本选项 |
| Google Gemini 3 Flash-Lite | $0.10 | $0.40 | Google 最经济 |
| xAI Grok 4.1 | $0.20 | $0.50 | 极具竞争力的”特斯拉级”价格 |
| OpenAI GPT-5 mini | $0.23 | $1.84 | OpenAI 经济款 |
| DeepSeek V3.2 | $0.28 | $0.42 | 中国厂商,输出价仅为输入 1.5x |
1.2 中价位梯队($1-3 输入)
| 模型 | 输入 $ | 输出 $ | 备注 |
|---|---|---|---|
| Anthropic Claude Haiku 4.5 | $1.00 | $5.00 | Anthropic 入门款 |
| 阿里 Qwen3-Max | $1.20 | $6.00 | 阿里云最强模型 |
| OpenAI GPT-5.2 | $1.75 | $14.00 | 上下文 ≤272K,支持视觉 |
| Google Gemini 3 Pro | $2.00 | $12.00 | 文本/图像同价 |
| 阿里 Qwen3-Plus | $0.40 | $4.00 | Max 价格 1/3 |
| Anthropic Claude Sonnet 4.5 | $3.00 | $15.00 | 性价比档 |
| OpenAI GPT-4.1(2025) | $3.00 | $12.00 | 仍可用 |
1.3 高价梯队($5+ 输入)
| 模型 | 输入 $ | 输出 $ | 备注 |
|---|---|---|---|
| Anthropic Claude Opus 4.5 | $5.00 | $25.00 | 当前最贵主流模型 |
1.4 缓存(Prompt Caching)机制
[已在搜索结果确认的事实]
| 模型 | 缓存写 | 缓存读 |
|---|---|---|
| Claude Opus 4.5 | $6.25 | $0.50 |
| Claude Sonnet 4.5 | $3.75 | $0.30 |
| Claude Haiku 4.5 | $1.25 | $0.10 |
| xAI Grok 4.1 | — | $0.05 |
[推断] 当系统提示词较长(>1K tokens)且多次复用时,启用缓存可降本 70-90%。长 prompt 场景必启用。
二、上下文窗口与多模态
| 模型 | 上下文长度 | 多模态 |
|---|---|---|
| GPT-5.2 | 272K(输入) | 视觉输入 + 图像生成 |
| Claude 系列 | 200K(可扩展) | 视觉输入 |
| Gemini 3 Pro | 1M tokens | 文本/图像/视频/音频 |
| Gemini 3 Flash | 1M tokens | 同上 |
| DeepSeek V3.2 | 32K-128K | 纯文本为主 |
⚠️ 实战经验:上下文不是越大越好。>100K tokens 的请求在多数模型上响应慢、成本激增、效果反降。除非有真实长文档需求,否则优先 32K-128K 区间。
三、选型决策矩阵
3.1 按场景匹配
flowchart TD A["任务类型?"] -->|"大批量 / 低成本"| B["GPT-5 nano<br/>或 Gemini 3 Flash-Lite"] A -->|"中文场景"| C["Qwen3-Plus<br/>或 DeepSeek V3.2"] A -->|"性价比均衡"| D["DeepSeek V3.2<br/>或 xAI Grok 4.1"] A -->|"高质量复杂"| E["Claude Sonnet 4.5<br/>或 GPT-5.2"] A -->|"顶级性能"| F["Claude Opus 4.5"] A -->|"数据合规 私有化"| G["智谱 GLM-4<br/>或 DeepSeek 自建"]
3.2 按预算档匹配
| 月预算 | 推荐模型 | 典型用法 |
|---|---|---|
| < $50 | DeepSeek V3.2 | 个人副业 MVP |
| $50-300 | GPT-5 mini / Qwen3-Plus | 中小型生产系统 |
| $300-2000 | Claude Sonnet 4.5 | 中型 SaaS / 严肃项目 |
| > $2000 | Opus 4.5 + Sonnet 4.5 双轨 | 重 Reasoning + 大规模调用 |
3.3 按合规模匹配
| 数据类型 | 推荐模型 |
|---|---|
| 公开数据 / 营销文案 | 任选,海外优先 |
| 内部文档 / 客户数据 | 智谱 / Qwen / DeepSeek(可私有化) |
| 跨境业务 | Claude(境外)+ Qwen(境内)双保险 |
| 代码 | Cursor 内置(多模型切换) |
四、被低估的几个模型
[推断] 主流报道容易忽略但实战中很关键的几个:
- xAI Grok 4.1:0.50 输出 + 缓存读 $0.05,价格/性能比被低估(⚠️ 2026-07 旗舰已是 Grok 4.5,见 Grok 4.5 资料整理;4.1 价位勿再当当前决策依据)
- Gemini 3 Flash-Lite:$0.10 输入,与 nano 同档,对长上下文刚需场景友好(1M)
- 阿里 Qwen3-Plus:仅 Max 价格 1/3,国内 API 性价比之王
- DeepSeek V3.2:输出价仅 $0.42,生成量大的场景(写文章、生图描述)成本极低
五、预算管控的实操技巧
[第一性原理]
- 总是开缓存:长 system prompt + 多次调用 → 启用 prompt caching
- 区分大小模型:Reasoning 类用 Opus / Sonnet,生成类用 mini / nano
- 批量调用比单调用便宜:多数厂商对批量(batch)有 50% 折扣
- 本地化代替部分场景:开发时用本地 LLM(如 Qwen2.5-7B)可降至 0
- 严格限流:在 SDK 层加重试 + 退避 + 限流,避免天价账单
- 监控指标:Token / 请求 / 平均响应时长 / 失败率,盯 dashboard
六、常见踩坑
[第一性原理 + 经验]
- 盲目选最大模型:Sonnet 4.5 在 80% 任务上效果接近 Opus 4.5,价格 1/2
- 忽略缓存写成本:Opus 缓存写 5 还贵,别为了缓存而缓存
- 国产模型用海外 API:合规风险与延迟问题严重
- 不锁定价格表:API 调价是常事,立项时务必查最新报价
- 过度依赖单家:多模型 fallback 与流量切分是高可用必修课
七、待展开
- 国产厂商深度对比(DeepSeek V3.2 vs Qwen3-Max vs 智谱 GLM-4 vs 文心 4.0)
- 不同模型在 Prompt 注入攻击上的抗性测试
- 本地部署 vs API 调用的总拥有成本(TCO)对比