免费 LLM API 全网整理 — 完整报告

TL;DR 入口

调研说明

本文面向大陆个人开发者,全面汇总 2026 年 7 月仍可免费使用的 LLM API 方案。覆盖四个维度:

  • 国际厂商 — Google / Mistral / Groq / Cohere 等海外平台
  • 中文厂商 — DeepSeek / 智谱 / 阿里 / 百度 / 腾讯 / 火山引擎 等
  • 聚合与中转平台 — OpenRouter / SiliconFlow / GitHub Models / Cloudflare 等
  • 开源与本地方案 — Ollama / LM Studio / llama.cpp / Hugging Face 等

数据交叉验证原则:每条免费额度至少 2 个独立来源(官方定价页 + 第三方比价站 / 社区实测),因 WebFetch 爬取部分页面有限,以官方控制台实际显示为准。


一、国际厂商

1.1 Google Gemini(最慷慨的免费 API)

项目详情
模型Gemini 2.5 Flash / Flash-Lite / 2.5 Pro / 2.0 Flash / Gemma 4 等
免绑卡✅ 完全不需要信用卡
免费模式按 RPM/TPM/RPD 限速,无总 token 限制
注册入口aistudio.google.com

各模型免费限速

模型RPMTPMRPD
Gemini 2.5 Flash10-15250K-1M1,500
Gemini 2.5 Flash-Lite30250K-1M1,500
Gemini 1.5 Flash151,000,0001,500
Gemini 1.5 Pro232,00050
Gemini 2.5 Pro525
Gemma 4 26B/31B15无上限3,000

关键细节

  • 🔴 不覆盖 EU/UK/CH 地区
  • 🔴 免费层数据可能用于训练(可在 AI Studio 设置中关闭)
  • TPM 升级到 1M 是逐步推送的,并非所有账号都有
  • 商业使用:免费层不限制商用(但禁止用输出去训练竞品模型)
  • Vertex AI Express Mode:另一种 API 直调方式,无需 GCP 项目

可信度:官方 AI Studio 定价页 + 多篇独立英文技术博客交叉验证


1.2 Mistral AI(~1B token/月免费)

项目详情
免费额度约 10 亿 token/月
限速~1 req/s(低 RPM)
免绑卡✅ 只需要手机 SMS 验证
可用模型全部 API 模型:Mistral Large、Codestral、Mistral Small 等
注册入口console.mistral.ai

限制

  • 免费层不再公开精确 RPM — 在 Admin Console 可查看具体限额
  • 低并发,不可用于生产
  • Le Chat 免费版(25 条/天)与 API 额度分开计算

可信度:Mistral 官方文档 + pricepertoken.com + 第三方比价文章


1.3 Groq(30 RPM 免费,高达 14,400 请求/天)

项目详情
免绑卡✅ 邮箱注册即可
免费模型Llama 3.1/3.3、Llama 4 Scout、Kimi K2、Qwen3-32B、GPT-OSS、Whisper
LPU 速度320-500+ token/s(极快)
注册入口console.groq.com

免费限速(组织级别,多 API Key 不叠加)

模型RPMRPDTPMTPD
llama-3.1-8b-instant3014,4006,000500K
llama-3.3-70b-versatile301,00012,000100K
llama-4-scout-17b-16e301,00030,000500K
qwen3-32b601,0006,000500K
gpt-oss-120b301,0008,000200K

商业使用:✅ 免费层允许商用,需注明归因

可信度:Groq 官方定价页 + cloudzero.com + grizzlypeaksoftware.com


1.4 Cohere(1,000 请求/月免费试用)

项目详情
免费额度每月 1,000 次 API 调用
限速Command A+ 等模型 20 RPM
免绑卡✅ 不需要信用卡
可用模型Command A+(218B)、Command A、Embed、Rerank
用途仅限非商业(原型 & 评估)
注册入口dashboard.cohere.com

备注:Command A+ 和 North Mini Code 是开源权重(Apache 2.0),可自托管


1.5 OpenAI($5 试用金 + 数据共享免费 token)

项目详情
新用户赠额$5(有效期 3 个月,无需信用卡)
数据共享计划开启后每天免费 token
免费模型GPT-5 Nano、GPT-5.4 Nano、GPT-5-Mini 等

数据共享免费 token 额度

  • 强大模型(GPT-5.2 等):25 万 token/天
  • 轻量模型(GPT-5 Nano、GPT-5-Mini 等):250 万 token/天

限制

  • $18 试用金已取消(2025 年中)
  • 数据共享启用 = 你的输入输出可被训练
  • $5 用完即止,需绑卡继续

可信度:OpenAI 官方定价页 + pricepertoken.com


1.6 xAI Grok(无永久免费 API)

项目详情
永久免费 API不存在
新用户赠额一次性推广 credit(小额)
数据共享曾有过 $150/月 credit,需在控制台确认是否仍在
免费聊天grok.com 免费版(量少,非 API)
开源免费OpenRouter 上 grok-4-fast:free 变体

1.7 Hugging Face($0.10/月,仅限原型)

项目详情
免费额度$0.10/月 inference credit
限速无固定限速(按负载动态)
免绑卡
用途⚠️ 仅限极轻量原型

超过 $0.10 即返回 429(硬停止),适合测试非常小量的推理。


1.8 其他国际厂商(一次性 credit)

平台免费额度是否需绑卡有效期备注
Fireworks AI$1 credit用完为止所有 serverless 模型可用
Together AI$5 credit用完为止DeepSeek V4/M3 等
SambaNova$5 credit用完为止支持 DeepSeek V3.1/M2.7
DeepInfra无免费层必须绑卡
Replicate不详(未公开明确数额)按算力秒计费

二、中文厂商

2.1 智谱 AI / BigModel(最稳定的中文永久免费方案)

项目详情
永久免费模型GLM-4-FlashGLM-4.7-Flash(200K ctx)、GLM-4.6V-Flash(视觉)、CogView-3-Flash(图文)
新用户赠额2000 万 token(永久有效)
并发30 并发
免绑卡✅ 国内直接注册,微信/支付宝
入口open.bigmodel.cn
接口OpenAI 兼容,改 base_url 即可
商业使用✅ 免费模型可商用

评价:当前中文圈最推荐的免费 API — 无 token 总量上限、爆发高、中文质量好。


2.2 百度千帆 ERNIE-Speed(永久免费)

项目详情
永久免费模型ERNIE-Speed / ERNIE-Lite / ERNIE-Tiny(7 款模型)
免费额度无 token 总量限制
限速QPS 约 1-50(不同模型不同)
新用户赠送每模型 100 万 token(3 个月有效期)
实名⚠️ 2026年4月起新用户需实名才能领取
入口console.bce.baidu.com/qianfan

评价:中文理解力强,真正的无限量免费,但 QPS 偏低。


2.3 火山引擎豆包 Doubao(每日 50 万 token 免费)

项目详情
每日免费Doubao-Lite 每日 50 万 token(北京时间 00:00 重置)
新用户赠额5000 万 token(一次性,部分来源说永久有效)
限速10K RPM / 800K TPM(默认)
实名⚠️ 需个人实名认证
入口console.volcengine.com/ark

注意:2026-03-15 之后创建的 API Key 才自动绑每日免费额度,旧 Key 需重建。


2.4 腾讯混元 Hunyuan-Lite(永久免费)

项目详情
永久免费模型Hunyuan-Lite(无限量)
并发~5 路并发(低)
新用户赠额100 万 token(1 年)
入口console.cloud.tencent.com/hunyuan
接口OpenAI 兼容:https://api.hunyuan.cloud.tencent.com/v1

⚠️ 评价:免费是真的,Lite 太笨了(无法理解复杂指令、推理易断片)。建议若要用腾讯优先选 Hunyuan-Turbos-Latest(每月有免费额度)。


2.5 阿里云百炼 Qwen-Turbo(新用户赠额)

项目详情
新用户赠额7000 万+ token(每模型各 100 万,含 Qwen-Turbo/Plus/Max)
有效期90 天
免费模型Qwen-Turbo(送后 0.367 元/百万 token 输入)、Qwen-Plus、Qwen-Max
实名需实名认证
入口bailian.console.aliyun.com

评价:赠额量大但有效期短,适合集中测试。长期用 DeepSeek 更便宜。


2.6 DeepSeek(5M token 赠额 + 全免费聊天)

项目详情
新用户赠额500 万 token(≈$8,有效期 30 天)
免费聊天chat.deepseek.com 完全免费(无 Plus 层)
API 价格V4 Flash 0.28 每百万 token(极低)
入口platform.deepseek.com
限速无 RPM 限速(只有并发限制)

评价:性价比之王。赠额用完后的 API 价格仍是全市场最低。


2.7 月之暗面 Kimi(500 万 token 赠额)

项目详情
新用户赠额500 万 token(注册即领)
实名赠额额外 15 元余额(≈$2)
网页免费kimi.moonshot.cn 每日 ~30-50 条对话(无需登录)
入口platform.moonshot.cn

评价:2026 年起官方 API 已无持续免费层,主要是新用户一次性赠额 + 网页端免费对话。


2.8 其他中文厂商

厂商免费模型免费额度备注
百川智能Baichuan 系列新用户赠额(量较少)需实名
零一万物 YiYi-Lightning有免费试用额度需实名
阶跃星辰 StepFunStep-1V/Step-2新用户赠额图像理解优势
商汤日日新 SenseNova实名后免费额度需企业认证
讯飞星火Spark Lite每日免费次数实名

说明:以上厂商在 2026 年的免费额度多为”新用户一次性赠额”模式,容量有限且可能随时调整,建议以各平台控制台为准。


三、聚合与中转平台

3.1 OpenRouter(多模型免费池)

项目详情
免费模型数十个 :free 后缀模型(池动态变化)
限速按模型不同(通常 ~20-60 RPM)
免绑卡✅ 邮箱注册即可
API 端点https://openrouter.ai/api/v1
入口openrouter.ai

免费模型清单(2026-07 抓取)

模型 ID上下文
tencent/hy3:free262K
nvidia/nemotron-3-ultra-550b-a55b:free1M
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free256K
poolside/laguna-m.1:free262K
cohere/north-mini-code:free256K

⚠️ 风险:数据可能被记录/训练,生产环境慎用;免费模型池每日变动


3.2 SiliconFlow 硅基流动(国内首选聚合平台)

项目详情
新用户赠送2000 万 token(永久有效,≈¥14)
永久免费9B 参数以下模型免费
免绑卡✅ 不需要国外信用卡
实名⚠️ 必须支付宝扫码实名(2025-02 起)
接口OpenAI 兼容
入口cloud.siliconflow.cn

永久免费模型:Qwen2.5-7B、GLM-4-Flash(通过硅基调)、DeepSeek-R1-8B、Phi-3-mini 等

未实名限制:DeepSeek V3/R1 各限 100 RPM/天;未实名日 1000 RPM 总额度


3.3 GitHub Models(150 请求/天)

项目详情
免费额度150 请求/天,15 RPM
模型GPT-4o、Llama 3.3、Phi-4、Mistral、DeepSeek-R1 等
免绑卡✅ 已有 GitHub 账号即可
限速强化DeepSeek-R1 / Grok-3:1 RPM;GPT-5 等:Free tier 不可用
入口github.com/marketplace/models

用途:个人学习、原型开发,无 SLA


3.4 Cerebras Inference(100 万 token/天)

项目详情
免费额度100 万 token/天(登录即可)
模型Llama 3.1 8B(1800 tok/s)、Llama 3.1 70B
绑卡✅ 不需要(Google/Microsoft SSO)
入口cloud.cerebras.ai

特点:硬件加速器极快,是目前免费 API 中推理速度最快的平台。


3.5 Cloudflare Workers AI(10K neurons/天)

项目详情
免费额度10,000 neurons/天(UTC 重置)
超出费用$0.011/1K neurons
模型llama-3.2-1b、qwen3-30b-a3b-fp8、bge-m3(embedding)、whisper 等
免绑卡
入口developers.cloudflare.com/workers-ai

注意:neuron 按模型动态消耗(小模型消耗少,大模型消耗多),实际上只能跑小模型。


3.6 其他聚合平台

平台免费额度需绑卡区域评价
Vercel AI Gateway$5 credit/30 天可选项国际适合 Vercel 生态
Puter.js用户付费模式✅ 不需要国际开发者 0 成本,终端用户付 token
模盒方舟 / TokenPace新用户赠钱中文⚠️ 违反上游 ToS,风险高

四、核心对比表

4.1 永久免费模型(上限无限制)

模型平台上下文限速商用推荐度
GLM-4-Flash智谱 AI128K30 并发⭐⭐⭐
GLM-4.7-Flash智谱 AI200K同前⭐⭐⭐
ERNIE-Speed百度千帆8K-128KQPS 约 1-50⭐⭐
Hunyuan-Lite腾讯混元5 路并发⭐(质量差)
9B 以下开源模型SiliconFlow动态视平台⭐⭐

4.2 有上限但额度大的免费方案

方案额度/限速无需信用卡适合场景
Google Gemini 2.5 Flash1,500 req/day日常编码、问答
Mistral La Plateforme~1B token/月✅(需 SMS)原型研究
Groq14,400 req/day高吞吐简单任务
火山引擎豆包500K token/天✅(需实名)中文长文本
DeepSeek 赠额5M token(30天)初期测试
OpenAI 数据共享2.5M token/天轻量任务(需承担训练风险)
GitHub Models150 req/day多模型对比实验
Cerebras1M token/天极速推理
Cloudflare Workers AI10K neurons/天边缘计算场景

4.3 按质量层级排序

层级免费方案说明
顶级Gemini 2.5 Pro(25/天)最强免费,接近 Claude Sonnet
优秀Gemini 2.5 Flash / Mistral Large / GLM-4.7-Flash日常编码够用
良好Groq (70B) / Cohere Command A+(20 RPM)适合原型
够用豆包 Lite / ERNIE-Speed / 硅基 9B 以下简单任务
玩具Hugging Face $0.10/月 / Hunyuan-Lite仅供测试

五、永久免费模型清单

以下为永久免费、无整体 token 上限的模型(截至 2026-07):

#模型平台类型上下文备注
1GLM-4-Flash智谱 AI文本128K中文最优
2GLM-4.7-Flash智谱 AI文本200K编程能力更强
3GLM-4.6V-Flash智谱 AI多模态128K视觉推理
4CogView-3-Flash智谱 AI文生图图片生成免费
5CogVideoX-Flash智谱 AI文生视频免费视频
6ERNIE-Speed百度千帆文本8K中文理解
7ERNIE-Lite百度千帆文本8K轻量
8ERNIE-Tiny百度千帆文本8K超轻量
9Hunyuan-Lite腾讯混元文本质量差,慎用
10Doubao-Lite(每日 50 万)火山引擎文本128K中文最强
11硅基流动 9B 以下模型SiliconFlow多模型动态100+ 模型可选

六、开源与本地方案

6.1 Ollama(最佳本地方案)

项目详情
平台macOS / Linux / Windows
安装brew install ollama
模型库数百个开源模型,一键 ollama pull <model>

按显存推荐(2026 年)

硬件配置最佳模型参数RAM/VRAM
4 GB VRAM / 8 GB RAMllama3.2:1b,gemma3:1b1-3B极小
8 GB VRAMllama3.1:8b,qwen2.5-coder:7b7-8B5 GB
12 GB VRAMqwen2.5-coder:14b (Q4),gemma3:12b12-14B9 GB
16 GB VRAMgpt-oss:20b,qwen3-coder:14b14-20B14 GB
24 GB VRAMqwen3-coder:30b,deepseek-r1:32b30-32B19-20 GB
48 GB+ VRAMgpt-oss:120b,llama3.3:70b70-120B43-65 GB

2026 年最佳开源编码模型

  • Qwen3-Coder:30b(MoE,256K 上下文,19 GB)— 24-32 GB VRAM 首选
  • GPT-OSS:20b(MoE,128K,14 GB)— 16 GB RAM 也能跑
  • Devstral:24b(SWE-bench Verified 46.8%)— 16-24 GB
  • Qwen3.6:27b(编程 Agent,256K,16 GB)— 2026 新星

6.2 LM Studio

项目详情
特点GUI 图形化 + 内置 OpenAI 兼容端点
优势可使用 Hugging Face 任意 GGUF 模型,无需命令行
平台macOS(M 系列优化好)、Windows、Linux
入口lmstudio.ai

6.3 llama.cpp / llamafile

  • llama.cpp:C/C++ 实现的 LLM 推理引擎,CPU 优化极好
  • llamafile:单文件部署(模型 + 推理引擎打包成一个可执行文件)
  • 适合:需要在无 GPU 服务器上跑模型的场景

6.4 vLLM(服务化部署)

  • 生产级 LLM 推理框架,支持 PagedAttention 和连续批处理
  • 适合需要自建 API 服务、高吞吐的团队
  • 需自行管理 GPU 资源

6.5 Hugging Face Spaces(社区免费推理)

项目详情
模式社区上传模型的免费 inference widget
限速低,共享 GPU 队列
模型所有 Hugging Face 开源模型
用途试用模型效果,不适合生产

七、风险与新用户须知

7.1 七条关键陷阱

  1. “免费” ≠ “可商用” — OpenRouter :free 模型的数据可能被记录;免费层的 Cohere 明确禁止商用
  2. “试用 credit” ≠ “永久免费” — Fireworks/Together/SambaNova 的 5 credit 用完即按量计费,长期用不划算
  3. 实名是隐藏门槛 — 硅基流动(支付宝实名)、火山引擎(实名)、百度(2026年4月起新用户必实名)
  4. 限速 ≠ 配额 — GitHub Models “150 请求/天”是硬封顶;Cloudflare “10K neuron/天”按模型动态消耗
  5. 隐藏升级陷阱 — Perplexity 无免费 credit,注册即按量计费;DeepSeek 赠额 30 天自动过期
  6. 地区限制 — Google Gemini 免费层不覆盖 EU/UK/CH;大量海外平台需国际电话验证
  7. 数据风险 — OpenAI 数据共享计划 = 你的输入输出可能被训练;OpenRouter 免费池同理

7.2 零成本起步推荐组合

flowchart TD
    A["零预算起步<br/>个人开发"] --> B{"任务类型?"}
    
    B -->|"日常编码/问答"| C1["智谱 GLM-4-Flash<br/>永久免费 · 30 并发"]
    B -->|"高吞吐/批量"| C2["Groq 免费层<br/>14,400 请求/天"]
    B -->|"顶级模型"| C3["Google Gemini 2.5<br/>1,500 请求/天"]
    B -->|"中文长文本"| C4["火山引擎豆包<br/>50 万 token/天"]
    B -->|"多模型对比"| C5["GitHub Models<br/>150 请求/天"]
    B -->|"本地/离线"| C6["Ollama + 开源模型<br/>硬件成本"]
    
    C1 & C2 & C3 & C4 & C5 & C6 --> D["日常 0 元<br/>攻坚用 Claude API ~¥50/月"]

7.3 最优配对策略

本地硬件在线免费 API 补充总成本
无 GPU / 4-8GBGLM-4-Flash(主力)+ Groq(高吞吐)+ Gemini(攻坚)¥0
16 GB RAM(M 芯 Mac)Ollama gpt-oss:20b(本地主力)+ 智谱 Flash(云端兜底)¥0
24 GB GPUOllama qwen3-coder:30b(本地编码)+ Gemini 2.5 Pro(交叉验证)¥0
无本地模型火山 + 智谱 + Groq + Gemini 四路免费方案轮流使用¥0

结论:2026 年,个人开发者完全可以在 零 API 成本 下获得超越大多数付费模型的编码体验。只有当需要 Claude Opus 级别的顶级 Agent 能力时,才需要小额付费(约 ¥50-100/月)。


八、国际厂商补充对比(一次性 Credit 类)

厂商免费额度需绑卡说明
Puter.js开发者 0 成本(用户付费)把 AI 成本转嫁给终端用户
Modal$30/月 serverless creditGPU 计算
Replicate免费试用(数额不公开)按秒计费
GitHub Copilot Free有限免费✅ 无需VS Code 内免费用 Claude/Gemini
Vercel AI SDK Free200K 请求/月✅ 可选项内置多 providers

九、数据来源

平台主要来源
Google GeminiAI Studio 官方定价页 / Google Cloud 官方
Mistralconsole.mistral.ai / pricepertoken.com
Groqconsole.groq.com / cloudzero.com
Coheredocs.cohere.com / GitHub docs
OpenAIplatform.openai.com / pricepertoken.com
xAI Grokdocs.x.ai / apidog.com
Hugging Facehuggingface.co/pricing
Fireworks/Together/SambaNova/DeepInfra各平台官方定价页
智谱open.bigmodel.cn
百度千帆console.bce.baidu.com
火山引擎console.volcengine.com
腾讯混元console.cloud.tencent.com
阿里百炼developer.aliyun.com
DeepSeekplatform.deepseek.com
月之暗面platform.moonshot.cn
OpenRouteropenrouter.ai/api/v1/models(直抓)
SiliconFlowsiliconflow.cn/pricing
GitHub Modelsdocs.github.com
Cerebrascloud.cerebras.ai
Cloudflaredevelopers.cloudflare.com/workers-ai
Ollamaollama.com / 各开源模型官方

附录:调研方法论

项目
调研日期2026-07-14
数据来源4 路 agent 并行 WebSearch + 14 次 Direct WebSearch + 官方定价页 WebFetch
交叉验证每关键事实至少 2 个独立来源
未覆盖盲区Replicate 具体 free credit 数额(未公开)、Vertex AI Express 精确配额(返回 404)
报告语言中文