本机本地模型接入与选型
工具调研 · AI 总索引 · organize 总索引
调研主题
在 大陆个人开发者 AI 编码模型选购决策 已给出的云侧双层架构基础上,若在本机再增加一层本地模型,整套供应链如何演进?本地层能真正消灭什么焦虑、不能消灭什么?本机硬件(Mac M1 Max 64GB + PC 4060 8G)适合跑什么、怎么接到 Claude Code?
文件清单
2026-07-14-本机本地模型接入与选型/
├── index.md # 本入口(TL;DR + 阅读路径)
└── report.md # ⭐ 主报告(第一性原理 + 硬件/模型盘点 + 三层架构 + 接入 + 成本)
7 大核心结论(TL;DR)
- 🟢 本地层解决的是「隐私 / 离线 / 边际成本≈0 / 撞墙兜底」四件事,不是「替代 MiniMax/Claude 智能」 —— 把本地当「免费无限吞吐池」,而不是当「顶级智能源」。
- 🟢 本机硬件已经具备可落地的本地编码能力 —— Mac M1 Max 64GB 统一内存是主力推理机;PC 4060 8G 只适合 7B~14B 轻量;N100 不适合跑模型。
- 🟢 本地运行时与模型已在机 —— Ollama 0.31.2 + LM Studio 已装;Ollama 已有
qwen3.6:35b-a3b(≈22GB);LM Studio 已有约 78GB 模型(Qwen3.6-35B-A3B 两套、Qwen3.6-27B、DeepSeek-V4-Flash、Gemma-4-31B)。不必从零购买/下载就能起步。 - 🟢 Claude Code 可原生接 Ollama —— 自 Ollama v0.14.0(2026-01-16)起支持 Anthropic Messages API:
ANTHROPIC_BASE_URL=http://localhost:11434+ANTHROPIC_AUTH_TOKEN=ollama,或ollama launch claude。官方推荐本地编码模型:qwen3-coder/gpt-oss:20b。 - 🟢 架构从「双层」升级为「三层」 —— L0 本地(免费无限)→ L1 国产云套餐/API(日常主力)→ L2 Claude 小额(攻坚)。云侧推荐组合不变,本地是增量层,不是替换层。
- 🟡 本地不能消灭的痛点 —— 长链 agentic 质量仍落后云端顶级 5~15+ 分;Mac 风扇/续航/热节流;上下文一长 KV cache 吃内存;工具调用/权限流依赖模型是否支持 tools。
- 🟢 成本侧边际收益极高 —— 本地层增量硬件成本 ≈ ¥0(已有机器与模型);电费可忽略;把「批量改写 / 敏感代码 / 离线 / 撞墙时段」切到本地后,云侧月费仍可维持约 200~300 元,甚至可把 Claude 攻坚额度压得更低。
三层供应链速览
flowchart TD A["个人开发者任务"] --> B{{"任务分流"}} B -->|"隐私 / 离线 / 批量 / 撞墙兜底"| L0["L0 本机本地<br/>Ollama on Mac M1 Max 64GB"] B -->|"日常高频编码 主力"| L1["L1 国产云<br/>MiniMax 套餐 + DeepSeek API"] B -->|"硬核长链 agentic 攻坚"| L2["L2 海外小额<br/>Claude Sonnet 5"] L0 --> Shell["Claude Code 统一外壳"] L1 --> Shell L2 --> Shell Shell --> Out["产出:确定性在本地+国产<br/>弹性在 API · 顶级能力小额外挂"]
本机已装模型速查(2026-07-14 实测)
| 运行时 | 模型 | 约体积 | 定位 |
|---|---|---|---|
| Ollama | qwen3.6:35b-a3b | ≈22GB | 已拉好的通用 MoE,可先接 Claude Code 试跑 |
| LM Studio | Qwen3.6-35B-A3B(Uncensored / Claude-4.7-Opus abliterated)×2 | ≈20GB×2 | 主力候选;注意 abliterated 变体合规与稳定性风险 |
| LM Studio | Qwen3.6-27B abliterated Fable MTP | ≈16GB | 密度更高、速度可能略慢于 35B-A3B MoE |
| LM Studio | DeepSeek-V4-Flash abliterated MTP | ≈3.5GB | 轻量极速,适合补全/草稿 |
| LM Studio | Gemma-4-31B-it abliterated | ≈17GB | 通用备选 |
| 建议补拉(Ollama) | qwen3-coder:30b(官方推荐编码) | ≈19GB | 专为 agentic coding;256K 上下文;MoE 30B/3.3B active |
硬件与设备全景基线见 个人开发环境现状。
阅读路径建议
| 你的需求 | 推荐阅读 |
|---|---|
| 5 分钟看结论 | 本页 TL;DR |
| 本地层到底解决什么本质问题 | 报告 §1 |
| 本机硬件与已装模型盘点 | 报告 §2 |
| 三层架构怎么落 | 报告 §3 |
| Claude Code 怎么接 Ollama | 报告 §4 |
| 模型怎么选、要不要再下 | 报告 §5 |
| 成本与对原双层方案的影响 | 报告 §6 |
| 风险与诚实盲区 | 报告 §7 |
关键反证
反证 1:「有了本地模型就可以取消云订阅」——不成立
本地在交互式长链 agent(多工具、多文件、长上下文、要稳)上仍明显弱于 MiniMax M3 / Claude。本地消灭的是边际 token 成本与隐私风险,消灭不了智能差距与速度差距。正确姿态是分流,不是替换。
反证 2:「PC 有独显就该当推理主力」——对本机不成立
4060 仅 8GB VRAM,14B 以上就吃力;Mac M1 Max 64GB 统一内存反而能舒服跑 30B 级 Q4 / 35B-A3B MoE。主力在 Mac,PC 只做轻量或实验。
反证 3:「本地=完全免费」——近似成立但有隐性成本
硬件沉没成本已付;显性增量≈电费+磁盘。隐性成本是:模型挑选与量化试错时间、热噪声、agent 失败重试、以及 abliterated 模型的不可预期行为。用时间换 token 钱,要算清楚。
待办与未覆盖盲区
- 在本机实测
ollama launch claude --model qwen3.6:35b-a3b与补拉qwen3-coder:30b的工具调用完整度(写文件/跑命令/多轮) - tok/s 与风扇曲线 —— 同模型在 Ollama Metal vs LM Studio 的体感速度对比(本文未做压测)
- 是否把 Ollama 通过 Tailscale 暴露给 PC/手机 —— 架构可行,安全策略未定
- abliterated 变体 仅作个人实验;生产/敏感项目优先官方权重
工作流元信息
| 字段 | 值 |
|---|---|
| 调研方法 | 读取既有选型文档 + 本机命令实测(硬件/已装运行时/模型目录)+ 官方文档核验(Ollama Claude Code 集成) |
| 数据来源 | 本机 sysctl/ollama --version/模型目录;Ollama Claude 集成文档;Ollama Claude 公告;qwen3-coder 模型库;既有选购决策与开发环境文档 |
| 主题日期 | 2026-07-14(Asia/Shanghai) |
| 报告语言 | 中文 |
关联主题
- 工具调研——其他工具深度调研
- 大陆个人开发者 AI 编码模型选购决策——云侧双层主干(本文为其本地层续篇)
- MiniMax Token Plan 订阅档位深度分析——L1 套餐计费口径
- 免费 LLM API 全网整理——免费云 API 与本地方案对照
- 个人开发环境现状——硬件/组网/设备基线
- 大陆稳定使用 Claude 方案——Claude 云侧接入
- opencode 终端AI编码助手——另一终端编码助手,亦可接本地端点