决定要不要买一台 Mac 跑本地 AI 时,最常听到的选型建议都围绕 CPU 展开:这颗芯片几核、单核多少分、多核跑分排第几。但在本地大模型推理这个场景里,CPU 跑分并不是决定体验的核心指标。真正卡住体验上限的,是统一内存。同一个 7B 模型,在 8GB 内存的入门 Mac 上可能生成几句话就开始换页、速度断崖式下跌;在 16GB 统一内存的 M 系列 Mac 上,却能稳定地以每秒十几到几十个 token 的速度输出。这篇文章要解决的是选型问题:为什么统一内存是本地 AI 的第一指标、四档配置口诀怎么用、每个档位能跑哪些模型、内存该按什么公式估算,以及买回来之后怎样搭建环境、验证速度和排查常见问题。
1. 为什么本地 AI 选型要先看统一内存,而不是 CPU 跑分
1.1 本地大模型推理的瓶颈:显存变内存,带宽变速度
大语言模型的生成是自回归过程。假设一个 7B 参数、Q4 量化后约 4.7GB 的模型,每生成一个 token,硬件都需要把这份权重重新读取一遍,再参与计算。换句话说,本地推理的速度不是由 CPU 单核能算多快决定的,而是由“每秒能从内存里搬出多少数据”决定的,这个指标就是内存带宽。
可以做一个粗略估算:
理论最高速度(token/s) ≈ 内存带宽(GB/s)/ 模型权重体积(GB)例如带宽为 200GB/s 的芯片跑 4.7GB 的模型,理论极限大约是:
200 / 4.7 ≈ 42 token/s而如果带宽只有 68GB/s,同样模型的理论极限就降到:
68 / 4.7 ≈ 14 token/s实际推理还要扣除计算开销、KV Cache 读写、采样等成本,通常只能达到理论值的 50% 到 70%。因此,同一模型在 Mac 上的速度差异,主要来自芯片的内存带宽档位,而不是 CPU 核心数或 Geekbench 跑分。这也是为什么“CPU 跑分很高、模型却跑不快”的现象在 Mac 上非常常见。
1.2 统一内存和独立显存的本质区别
传统 Windows 台式机或者游戏本上,CPU 使用系统内存,GPU 使用独立显存,二者通过 PCIe 总线通信。模型要放到 GPU 里跑,就得先从系统内存复制到显存。如果显存容量不够,模型根本放不进去,退回到 CPU 推理时速度往往非常慢。
Apple Silicon 采用了统一内存架构(Unified Memory Architecture,UMA)。CPU、GPU 和神经引擎共享同一块物理内存,模型权重加载一次,CPU 和 GPU 都能直接访问,不需要跨总线复制。对用户来说,统一内存既是系统内存,也是 GPU 可用的“显存”。购买时选择的内存容量,直接决定你能装下多大的模型。
这里要特别提醒:Mac 的内存是出厂焊死的,没有后续升级选项。选 8GB 就是一辈子 8GB,选 16GB 就是一辈子 16GB。所以买之前,要把未来两三年可能跑的模型一起算进去,不能只看眼下够不够。
1.3 CPU 跑分在本地 AI 场景里为什么失真
CPU 跑分测的是单核和多核计算能力,评测的负载包括整数运算、浮点运算、压缩解压、视频编解码等。而本地大模型推理主要由 GPU(Metal)和神经引擎承担,CPU 只参与预处理、采样、上下文管理等周边环节。对一个内存带宽受限的任务来说,核心再多、频率再高,也弥补不了带宽不足。
选 Mac 跑本地 AI 时,正确的判断顺序应该是:
- 先确定内存容量,保证模型能放进去。
- 再比较内存带宽,决定生成速度。
- 最后看 CPU/GPU 核心数,这只对编译、视频导出等任务有主要影响。
预算有限时,宁可少几个 CPU 核心,也要保住内存容量。这个判断顺序,是全文所有配置建议的基础。
2. 四档配置口诀:8G 聊天、16G 助手、36G 工程、64G 大模
2.1 口诀怎么理解
针对 Mac 跑本地 AI 的常见需求,可以按统一内存分成四档:
8G 聊天,16G 助手,36G 工程,64G 大模- 8G 档:跑 0.5B 到 3B 级别的量化模型,做聊天、改写、抽取等轻任务。
- 16G 档:跑 7B 到 8B 级别的量化模型,做日常助手、代码解释、文档摘要。
- 36G 档:跑 14B 到 32B 级别的量化模型,做长上下文、Agent 工作流、本地代码补全。
- 64G 档:跑 70B 级别量化模型,做本地大模型工作站、多模型并存和微调实验。
需要注意,36G 和 64G 是“容量带”,不是每个机型都有精确等于这个数字的配置项。例如 M 系列 Pro 档常见 18GB、36GB、48GB 等选项,Max 档有 48GB、64GB、96GB、128GB,基础芯片有 8GB、16GB、24GB、32GB 等选项。口诀的价值是帮你快速锁定“该往哪个容量区间去选”,而不是死记某个固定数值。
2.2 第 1 档:8GB 统一内存,先跑通再谈生产力
8GB 是目前入门级 MacBook Air、Mac mini 的起步配置。这个容量能跑什么?
- Qwen2.5-0.5B / 1.5B / 3B 量化版
- Llama 3.2 1B / 3B
- Phi-3-mini 这类约 3.8B 参数的量化模型
适合的任务是:体验 Ollama 的完整流程、写一个关键词抽取小工具、做文本润色、跑通接口调用。这个档位的定位是“学习体验”,不是“生产力工具”。
限制也很明显:上下文不能开太长,因为 KV Cache 会额外占内存;系统里如果开着浏览器、IDE、微信,内存压力会迅速升高,最终触发 swap 换页。8GB 机器不要试图稳定跑 7B 模型,即使模型量化后只有 4.7GB,加上 KV Cache 和系统开销后,剩余空间非常紧张。如果预算只允许买 8GB,建议优先考虑 3B 以下模型,把推理体验保持在“能用”的范围内。
2.3 第 2 档:16GB 统一内存,主流小模型的实用区间
16GB 是本地 AI 的甜点档。一个 7B 模型的 Q4 量化版大约占 4GB 到 5GB,加上 KV Cache、系统内存和几个常用应用,16GB 能留出足够余量。
这一档能稳定跑的模型包括:
- Qwen2.5-7B、Qwen2.5-Coder-7B,Q4 量化后约 4.7GB
- Llama 3.1 8B,Q4 量化后约 4.9GB
- GLM-4-9B-chat 的量化版本,约 5GB 到 6GB
使用场景是日常问答、代码片段解释、中等长度文档摘要、本地 RAG 试验。上下文控制在 8K 到 16K 比较舒适,32K 开始会明显吃内存。
速度方面,常见 M 系列基础芯片内存带宽约 100GB/s,跑 7B Q4 模型大概在每秒 15 到 25 个 token;如果换成带宽更高的 Pro 档芯片,可以到每秒 30 个 token 上下。实际数字受系统负载和具体量化格式影响,不必追求精确值,关键是“连续输出不卡顿、不触发明显换页”。
2.4 第 3 档:24GB 到 36GB 统一内存,Agent 和长上下文的起点
这一档适合已经不只是“聊天”的人。24GB 到 36GB 能跑:
- Qwen2.5-14B Q4,约 9GB
- Qwen2.5-32B Q4,约 19GB
- Qwen2.5-Coder-14B / 32B
- 32K 到 64K 的长上下文任务
- AI 写小说、长文本连续创作这类依赖上下文的场景
这也是“AI 代理助手加本地模型”组合的实用起点。上层 Agent 负责工具调用、流程编排,本地模型负责推理;模型越大,工具调用的准确性和多步规划能力通常越好。32B Q4 在 150GB/s 到 200GB/s 带宽的芯片上,大致能跑到每秒 15 到 30 个 token;如果只跑 14B Q4,速度会明显更快。
这个档位还有一个隐藏收益:模型体积大,排队和并发能力也更强。多个进程同时调用同一个模型时,显存充足的情况下可以把请求合并批量推理,这在独立显存较小的机器上是做不到的。
2.5 第 4 档:48GB 以上,本地大模型工作站
48GB 以上的统一内存,目标已经变成“本地大模型工作站”:
- Llama 3.3 70B Q4,约 40GB
- Qwen 系列 72B Q4,约 40GB 以上
- 同时加载多个 7B/14B 模型做对比测试
- 用 MLX 做 LoRA 微调实验
- 本地 RAG 索引和模型共存,不用频繁卸载
需要这一档的人通常是 AI 应用开发者、对数据隐私有要求的企业内部工具维护者,或者需要大量处理本地文档的团队。价格明显更高,购买前要确认自己的工作量确实需要这么大的内存,而不是“为了跑分而上高配”。
2.6 四档配置速查表
| 档位 | 统一内存 | 适用模型举例 | 典型场景 | 参考带宽档位 |
|---|---|---|---|---|
| 第 1 档 | 8GB | Qwen2.5-3B Q4、Llama 3.2 3B | 学习体验、轻量文本处理 | 基础芯片即可,约 68GB/s 到 100GB/s |
| 第 2 档 | 16GB | Qwen2.5-7B Q4、Llama 3.1 8B | 日常助手、代码解释、文档摘要 | 100GB/s 到 200GB/s |
| 第 3 档 | 24GB 到 36GB | Qwen2.5-14B / 32B Q4 | Agent、长上下文、代码补全 | 150GB/s 到 400GB/s |
| 第 4 档 | 48GB 以上 | 70B Q4、多模型并存 | 本地模型工作站、LoRA 实验 | 400GB/s 级别 |
补充一个反例:如果目标是跑本地 AI 视频生成工具,不能直接用这套口诀硬套。视频生成模型的参数量和计算量远大于文本模型,内存需求往往以几十 GB 起步,而且长时间高负载对散热和功耗要求很高。选型前先查该模型在 Mac 上的实测记录,再决定配置,而不是只看统一内存容量。
3. 内存怎么算:模型权重、量化精度和 KV Cache
3.1 权重占用:参数大小与量化精度的关系
模型在内存里的占用,最粗略的估算公式是:
模型内存 ≈ 参数量 × 每参数位数 / 8以 7B 模型为例:
- FP16(每参数 16 位,2 字节):约 14GB
- Q8(每参数约 8 位,1 字节):约 7GB
- Q4(每参数约 4 位,0.5 字节):约 3.5GB 到 4.7GB
GGUF 量化格式里有 Q2_K、Q3_K_M、Q4_K_M、Q5_K_M、Q6_K、Q8_0 等标签。其中 Q4_K_M 是体积和效果比较平衡的点,多数 7B 到 32B 模型建议先跑 Q4_K_M,确认效果后再按需升到 Q5 或 Q8。不要一上来就下载 FP16 版本,模型体积翻几倍,速度也成倍下降。
3.2 KV Cache:上下文长度是隐藏的内存开销
自回归生成时,模型需要缓存历史 token 的 Key 和 Value,这个缓存叫 KV Cache。它的大小与层数、KV 头数、上下文长度成正比。现代模型很多使用 GQA(Grouped Query Attention)架构,显著减少了 KV Cache 占用,但上下文长度仍然是不可忽略的变量。
以 Qwen2.5-7B 为例,把上下文从 8K 拉到 32K,KV Cache 会额外占用 1GB 到 2GB 量级的内存,具体数值与量化精度和推理实现有关。这也是为什么“模型只有 4.7GB,但 8GB 机器跑长上下文会爆”的原因。
购买和选型时,可以用这个经验公式做内存估算:
所需内存 ≈ 模型权重 + KV Cache + 系统/应用开销系统开销至少要留 4GB 到 6GB。跑 7B Q4 且上下文 8K 时,16GB 是比较稳妥的起步;跑 32B Q4 且上下文 32K 时,36GB 会更从容。
3.3 常见模型参考体积与推荐内存
常见模型在 Q4 量化下的参考体积如下。不同量化标签和版本会有差异,落地前以实际下载为准。
| 模型 | 参数规模 | Q4 量化参考体积 | 推荐内存档位 |
|---|---|---|---|
| Qwen2.5-1.5B | 1.5B | 约 1GB | 8GB |
| Qwen2.5-3B | 3B | 约 1.9GB | 8GB 到 16 |