摘要

关键词:Apple M5 Ultra, M6, 统一内存, 内存带宽, Mac Studio, 本地大模型推理, Apple Silicon, GPU

Apple 在 2026 年 8 月 25 日晚发布了 M6 与 M5 Ultra 两款芯片,以及搭载它们的全新 Mac mini 和 Mac Studio。官方新闻稿用了一连串令人印象深刻的倍率:AI 性能最高提升 4.3 倍、图形 1.8 倍、ProRes 解码 33 路 8K 流……但如果你是一个本地模型玩家,最关心的一个问题可能是:这玩意儿到底能跑多快?

本文从内存带宽切入,拆解 M5 Ultra 在本地 LLM 推理场景中的真实能力边界,与 M6、M3 Ultra、RTX 5090 和 B200 做横向对比,并讨论 512GB 统一内存真正意味着什么。


内存带宽才是本地推理的真正瓶颈

如果你跑过本地模型,应该知道一个反直觉的事实:在大多数单用户交互场景中,GPU 算力很少是瓶颈。当你敲完提示词等待输出时,模型在做的是自回归解码——每次生成一个 token,都需要把整个权重从显存读一遍。

这意味着单请求 decode 吞吐的上限完全由内存带宽决定:

tok/s ≈ 内存带宽(GB/s) ÷ 模型权重(GB)

这一点在 M5 Ultra 上被放大了,因为它的带宽数字确实很亮眼。

一张表看清差距

下表中标 ✗ 的表示该设备显存装不下对应模型,但仍列出带宽除以模型大小的理论值,供参考:

设备 内存容量 内存带宽 Llama-3.3-70B FP4 Qwen3-235B-A22B FP4 DeepSeek-R1 671B FP4
M6 (Mac mini) 32GB 170GB/s 4.2✗ 1.4✗ 0.4✗
M5 Max (Mac Studio) 128GB 614GB/s 15.3 4.9✗ 1.6✗
M3 Ultra (Mac Studio 2025) 512GB 819GB/s 20.5 6.6 2.2
M5 Ultra (Mac Studio 2026) 512GB 1.2TB/s 30.0 9.6 3.2
RTX 5090 32GB 1.79TB/s 44.8✗ 14.3✗ 4.7✗
B200 单卡 192GB 8TB/s 200.0 64.0 21.1✗

数据来源:Apple Newsroom 2026-08-25(M5 Ultra 1.2TB/s)[1][2];Apple Newsroom 2025-03(M3 Ultra 819GB/s)[3];NVIDIA 官网(RTX 5090 1.79TB/s)[4];NVIDIA B200 技术页[5]

关键发现

  1. M5 Ultra 的带宽提升是实打实的,但只有 1.47 倍。从 M3 Ultra 的 819GB/s 到 1.2TB/s,增幅约 50%,这恰好是苹果在新闻稿中明确提及的数字。但新闻稿中反复出现的 4x、4.3x、9.8x 等倍率,主要来自 GPU 算力侧(Neural Accelerator 带来的矩阵乘法加速),而不是带宽。

  2. 走带宽的 decode 和走算力的 prefill 是两种不同的工作负载。苹果的 4x 测试数据来自 LM Studio 的 prompt processing——这是 prefill 阶段,算力主导。而日常聊天中大部分时间花在 decode 上,decode 提速上限就是 1.5x。这不是苹果的虚假宣传,而是营销数字和真实使用场景之间的落差。

  3. 真正的大杀器是 512GB 容量。目前没有任何桌面 GPU(包括 RTX 5090 的 32GB)能纯本地加载 DeepSeek-R1 671B 全尺寸模型,M5 Ultra 是唯一能办到的桌面平台——用 FP4 量化后约 380GB,恰好装进 512GB 统一内存。RTX 5090 即便带宽更高,32GB 显存连 70B 模型都放不下。512GB 统一内存才是真正不可替代的优势。

512GB 能装什么

Apple 官方新闻稿特意提到 M5 Ultra 能跑"frontier-class AI models"。我们看看哪些模型放得进去:

  • DeepSeek-R1 671B FP4(~380GB)→ ✓ 单机可跑,decode 约 3 tok/s
  • Qwen3-Coder-480B FP4(~270GB)→ ✓ 单机可跑
  • Kimi K2 1T MoE FP4(~550GB)→ ✗ 单机装不下,需要集群

3 tok/s 对于 DeepSeek-R1 这种推理模型来说够用吗?够,但不多。推理模型的特点是前几个 token 要"思考"很久(chain-of-thought),实际每次输出的 token 数远少于思考过程占用的时间。3 tok/s 意味着 30 秒等 90 个 token 的思考输出——这个节奏对于深度研究场景是可接受的,但和 API 调用(50-100 tok/s)有明显差距。

集群:更大的显存池

M5 Ultra 的另一个亮点是 Thunderbolt 5 + RDMA 四机集群,官方宣称可达 3x 分布式推理加速。按 TiB 级带宽算,四台 M5 Ultra 顶配总计 2TB 显存池(聚合带宽约 4.8TB/s),总价约 $22,000

  • Kimi K2 1T FP4(~550GB)→ 集群可装,理论 decode ≈ 8.7 tok/s
  • 对比 DGX B200(~$200K 级别,1,440GB HBM3e,64TB/s 聚合带宽)[5],价格比约 9 倍,但带宽比约 13 倍

不是替代训练集群的方案,但作为跑开源前沿模型推理的最低门槛,这个定价段确实没有竞品。

那 M6 呢?

M6 是首款 2nm 芯片,12 核 CPU + 12 核 GPU + 双 16 核神经引擎,最高 32GB 统一内存,170GB/s 带宽。装在新 Mac mini 里。

对于本地 LLM 来说,32GB 统一内存是它的硬限制——70B 模型放不下,甚至 32B 模型在 FP8 下也悬(约 32GB)。M6 的定位更偏向日常 AI 工作流加速:编译代码时跑 agent 任务、index 文件、跑本地 RAG 管道,而不是跑大模型推理。

总结

M5 Ultra 的 1.2TB/s 内存带宽确实是一个很夸张的数字——在桌面平台上是前所未有的。但它的真实价值不在 4x 营销倍率里,而在于三件事:

  1. 512GB 统一内存让加载前沿开源模型成为可能——这是目前任何桌面 GPU 都做不到的
  2. 带宽提升是 1.5x 级别的(decode 工作负载),不是 4x 级别的——这符合物理规律,苹果没有夸大,但宣传口径有误导性
  3. 集群方案提供了一条低成本"跑大模型推理"的路径——$22K 四机集群 vs $200K 级别 DGX,差距明显。$22K 四机集群能装下 Kimi K2 1T 这类单机装不下的模型,总带宽 4.8TB/s 也能提供可用的推理速度

如果你买 M5 Ultra 是为了"本地跑 4x 快的 GPT-4-level 模型",那会失望。如果你是为了"在桌面端跑一个 API 上跑不了的全尺寸开源模型",那它确实是目前唯一的选择。


参考文献

[1] Apple. Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute. Apple Newsroom, 2026-08-25

[2] Apple. Apple introduces new Mac Studio with M5 Max and M5 Ultra. Apple Newsroom, 2026-08-25

[3] Apple. Apple reveals M3 Ultra, taking Apple silicon to a new extreme. Apple Newsroom, 2025-03

[4] NVIDIA. GeForce RTX 5090 Graphics Cards. nvidia.com

[5] JarvisLabs. NVIDIA B200 Specs and Price: 192GB Blackwell GPU. 2026