本机本地模型接入与选型

工具调研 · AI 总索引 · organize 总索引

调研主题

大陆个人开发者 AI 编码模型选购决策 已给出的云侧双层架构基础上,若在本机再增加一层本地模型,整套供应链如何演进?本地层能真正消灭什么焦虑、不能消灭什么?本机硬件(Mac M1 Max 64GB + PC 4060 8G)适合跑什么、怎么接到 Claude Code?

文件清单

2026-07-14-本机本地模型接入与选型/
├── index.md      # 本入口(TL;DR + 阅读路径)
└── report.md     # ⭐ 主报告(第一性原理 + 硬件/模型盘点 + 三层架构 + 接入 + 成本)

7 大核心结论(TL;DR)

  1. 🟢 本地层解决的是「隐私 / 离线 / 边际成本≈0 / 撞墙兜底」四件事,不是「替代 MiniMax/Claude 智能」 —— 把本地当「免费无限吞吐池」,而不是当「顶级智能源」。
  2. 🟢 本机硬件已经具备可落地的本地编码能力 —— Mac M1 Max 64GB 统一内存是主力推理机;PC 4060 8G 只适合 7B~14B 轻量;N100 不适合跑模型。
  3. 🟢 本地运行时与模型已在机 —— Ollama 0.31.2 + LM Studio 已装;Ollama 已有 qwen3.6:35b-a3b(≈22GB);LM Studio 已有约 78GB 模型(Qwen3.6-35B-A3B 两套、Qwen3.6-27B、DeepSeek-V4-Flash、Gemma-4-31B)。不必从零购买/下载就能起步
  4. 🟢 Claude Code 可原生接 Ollama —— 自 Ollama v0.14.0(2026-01-16)起支持 Anthropic Messages API:ANTHROPIC_BASE_URL=http://localhost:11434 + ANTHROPIC_AUTH_TOKEN=ollama,或 ollama launch claude。官方推荐本地编码模型:qwen3-coder / gpt-oss:20b
  5. 🟢 架构从「双层」升级为「三层」 —— L0 本地(免费无限)→ L1 国产云套餐/API(日常主力)→ L2 Claude 小额(攻坚)。云侧推荐组合不变,本地是增量层,不是替换层。
  6. 🟡 本地不能消灭的痛点 —— 长链 agentic 质量仍落后云端顶级 5~15+ 分;Mac 风扇/续航/热节流;上下文一长 KV cache 吃内存;工具调用/权限流依赖模型是否支持 tools。
  7. 🟢 成本侧边际收益极高 —— 本地层增量硬件成本 ≈ ¥0(已有机器与模型);电费可忽略;把「批量改写 / 敏感代码 / 离线 / 撞墙时段」切到本地后,云侧月费仍可维持约 200~300 元,甚至可把 Claude 攻坚额度压得更低。

三层供应链速览

flowchart TD
    A["个人开发者任务"] --> B{{"任务分流"}}
    B -->|"隐私 / 离线 / 批量 / 撞墙兜底"| L0["L0 本机本地<br/>Ollama on Mac M1 Max 64GB"]
    B -->|"日常高频编码 主力"| L1["L1 国产云<br/>MiniMax 套餐 + DeepSeek API"]
    B -->|"硬核长链 agentic 攻坚"| L2["L2 海外小额<br/>Claude Sonnet 5"]
    L0 --> Shell["Claude Code 统一外壳"]
    L1 --> Shell
    L2 --> Shell
    Shell --> Out["产出:确定性在本地+国产<br/>弹性在 API · 顶级能力小额外挂"]

本机已装模型速查(2026-07-14 实测)

运行时模型约体积定位
Ollamaqwen3.6:35b-a3b≈22GB已拉好的通用 MoE,可先接 Claude Code 试跑
LM StudioQwen3.6-35B-A3B(Uncensored / Claude-4.7-Opus abliterated)×2≈20GB×2主力候选;注意 abliterated 变体合规与稳定性风险
LM StudioQwen3.6-27B abliterated Fable MTP≈16GB密度更高、速度可能略慢于 35B-A3B MoE
LM StudioDeepSeek-V4-Flash abliterated MTP≈3.5GB轻量极速,适合补全/草稿
LM StudioGemma-4-31B-it abliterated≈17GB通用备选
建议补拉(Ollama)qwen3-coder:30b(官方推荐编码)≈19GB专为 agentic coding;256K 上下文;MoE 30B/3.3B active

硬件与设备全景基线见 个人开发环境现状

阅读路径建议

你的需求推荐阅读
5 分钟看结论本页 TL;DR
本地层到底解决什么本质问题报告 §1
本机硬件与已装模型盘点报告 §2
三层架构怎么落报告 §3
Claude Code 怎么接 Ollama报告 §4
模型怎么选、要不要再下报告 §5
成本与对原双层方案的影响报告 §6
风险与诚实盲区报告 §7

关键反证

反证 1:「有了本地模型就可以取消云订阅」——不成立

本地在交互式长链 agent(多工具、多文件、长上下文、要稳)上仍明显弱于 MiniMax M3 / Claude。本地消灭的是边际 token 成本与隐私风险,消灭不了智能差距与速度差距。正确姿态是分流,不是替换。

反证 2:「PC 有独显就该当推理主力」——对本机不成立

4060 仅 8GB VRAM,14B 以上就吃力;Mac M1 Max 64GB 统一内存反而能舒服跑 30B 级 Q4 / 35B-A3B MoE。主力在 Mac,PC 只做轻量或实验。

反证 3:「本地=完全免费」——近似成立但有隐性成本

硬件沉没成本已付;显性增量≈电费+磁盘。隐性成本是:模型挑选与量化试错时间、热噪声、agent 失败重试、以及 abliterated 模型的不可预期行为。用时间换 token 钱,要算清楚。

待办与未覆盖盲区

  1. 在本机实测 ollama launch claude --model qwen3.6:35b-a3b 与补拉 qwen3-coder:30b 的工具调用完整度(写文件/跑命令/多轮)
  2. tok/s 与风扇曲线 —— 同模型在 Ollama Metal vs LM Studio 的体感速度对比(本文未做压测)
  3. 是否把 Ollama 通过 Tailscale 暴露给 PC/手机 —— 架构可行,安全策略未定
  4. abliterated 变体 仅作个人实验;生产/敏感项目优先官方权重

工作流元信息

字段
调研方法读取既有选型文档 + 本机命令实测(硬件/已装运行时/模型目录)+ 官方文档核验(Ollama Claude Code 集成)
数据来源本机 sysctl/ollama --version/模型目录;Ollama Claude 集成文档Ollama Claude 公告qwen3-coder 模型库;既有选购决策与开发环境文档
主题日期2026-07-14(Asia/Shanghai)
报告语言中文

关联主题