主流大模型选型与价格(2026-07-13 基线版)

AI 总索引 | AI 全景概览

本文定位:在 AI 全景概览 第 1 块基础上做的深挖版——聚焦模型选型决策,含 2026 年最新 API 价格、缓存与上下文机制。 数据时效:API 调价是动态的,建议每季度核验一次。本表为 2026-07-13 搜索快照。


一、2026 年 API 价格速查(按百万 token 美元)

1.1 最低价梯队($0.05-0.30 输入)

[已在搜索结果确认的事实]

模型输入 $输出 $备注
OpenAI GPT-5 nano$0.05$0.40OpenAI 极低成本选项
Google Gemini 3 Flash-Lite$0.10$0.40Google 最经济
xAI Grok 4.1$0.20$0.50极具竞争力的”特斯拉级”价格
OpenAI GPT-5 mini$0.23$1.84OpenAI 经济款
DeepSeek V3.2$0.28$0.42中国厂商,输出价仅为输入 1.5x

1.2 中价位梯队($1-3 输入)

模型输入 $输出 $备注
Anthropic Claude Haiku 4.5$1.00$5.00Anthropic 入门款
阿里 Qwen3-Max$1.20$6.00阿里云最强模型
OpenAI GPT-5.2$1.75$14.00上下文 ≤272K,支持视觉
Google Gemini 3 Pro$2.00$12.00文本/图像同价
阿里 Qwen3-Plus$0.40$4.00Max 价格 1/3
Anthropic Claude Sonnet 4.5$3.00$15.00性价比档
OpenAI GPT-4.1(2025)$3.00$12.00仍可用

1.3 高价梯队($5+ 输入)

模型输入 $输出 $备注
Anthropic Claude Opus 4.5$5.00$25.00当前最贵主流模型

1.4 缓存(Prompt Caching)机制

[已在搜索结果确认的事实]

模型缓存写缓存读
Claude Opus 4.5$6.25$0.50
Claude Sonnet 4.5$3.75$0.30
Claude Haiku 4.5$1.25$0.10
xAI Grok 4.1$0.05

[推断] 当系统提示词较长(>1K tokens)且多次复用时,启用缓存可降本 70-90%。长 prompt 场景必启用


二、上下文窗口与多模态

模型上下文长度多模态
GPT-5.2272K(输入)视觉输入 + 图像生成
Claude 系列200K(可扩展)视觉输入
Gemini 3 Pro1M tokens文本/图像/视频/音频
Gemini 3 Flash1M tokens同上
DeepSeek V3.232K-128K纯文本为主

⚠️ 实战经验:上下文不是越大越好。>100K tokens 的请求在多数模型上响应慢、成本激增、效果反降。除非有真实长文档需求,否则优先 32K-128K 区间。


三、选型决策矩阵

3.1 按场景匹配

flowchart TD
    A["任务类型?"] -->|"大批量 / 低成本"| B["GPT-5 nano<br/>或 Gemini 3 Flash-Lite"]
    A -->|"中文场景"| C["Qwen3-Plus<br/>或 DeepSeek V3.2"]
    A -->|"性价比均衡"| D["DeepSeek V3.2<br/>或 xAI Grok 4.1"]
    A -->|"高质量复杂"| E["Claude Sonnet 4.5<br/>或 GPT-5.2"]
    A -->|"顶级性能"| F["Claude Opus 4.5"]
    A -->|"数据合规 私有化"| G["智谱 GLM-4<br/>或 DeepSeek 自建"]

3.2 按预算档匹配

月预算推荐模型典型用法
< $50DeepSeek V3.2个人副业 MVP
$50-300GPT-5 mini / Qwen3-Plus中小型生产系统
$300-2000Claude Sonnet 4.5中型 SaaS / 严肃项目
> $2000Opus 4.5 + Sonnet 4.5 双轨重 Reasoning + 大规模调用

3.3 按合规模匹配

数据类型推荐模型
公开数据 / 营销文案任选,海外优先
内部文档 / 客户数据智谱 / Qwen / DeepSeek(可私有化)
跨境业务Claude(境外)+ Qwen(境内)双保险
代码Cursor 内置(多模型切换)

四、被低估的几个模型

[推断] 主流报道容易忽略但实战中很关键的几个:

  • xAI Grok 4.10.50 输出 + 缓存读 $0.05,价格/性能比被低估(⚠️ 2026-07 旗舰已是 Grok 4.5,见 Grok 4.5 资料整理;4.1 价位勿再当当前决策依据)
  • Gemini 3 Flash-Lite:$0.10 输入,与 nano 同档,对长上下文刚需场景友好(1M)
  • 阿里 Qwen3-Plus:仅 Max 价格 1/3,国内 API 性价比之王
  • DeepSeek V3.2:输出价仅 $0.42,生成量大的场景(写文章、生图描述)成本极低

五、预算管控的实操技巧

[第一性原理]

  1. 总是开缓存:长 system prompt + 多次调用 → 启用 prompt caching
  2. 区分大小模型:Reasoning 类用 Opus / Sonnet,生成类用 mini / nano
  3. 批量调用比单调用便宜:多数厂商对批量(batch)有 50% 折扣
  4. 本地化代替部分场景:开发时用本地 LLM(如 Qwen2.5-7B)可降至 0
  5. 严格限流:在 SDK 层加重试 + 退避 + 限流,避免天价账单
  6. 监控指标:Token / 请求 / 平均响应时长 / 失败率,盯 dashboard

六、常见踩坑

[第一性原理 + 经验]

  1. 盲目选最大模型:Sonnet 4.5 在 80% 任务上效果接近 Opus 4.5,价格 1/2
  2. 忽略缓存写成本:Opus 缓存写 5 还贵,别为了缓存而缓存
  3. 国产模型用海外 API:合规风险与延迟问题严重
  4. 不锁定价格表:API 调价是常事,立项时务必查最新报价
  5. 过度依赖单家:多模型 fallback 与流量切分是高可用必修课

七、待展开

  • 国产厂商深度对比(DeepSeek V3.2 vs Qwen3-Max vs 智谱 GLM-4 vs 文心 4.0)
  • 不同模型在 Prompt 注入攻击上的抗性测试
  • 本地部署 vs API 调用的总拥有成本(TCO)对比

关联主题

参考来源(2026-07-13)

此文件夹下有0条笔记。