WWDC26: Apple's M3 Ultra Mac Studio Runs 70B LLMs Locally

WWDC26: Apple's M3 Ultra Mac Studio Runs 70B LLMs Locally

· Updated September 22, 2026
techminds

当苹果在 WWDC26 上展示 M3 Ultra Mac Studio 完全在本地跑 700 亿参数模型时, 不少开发者——包括我——都挑了挑眉。跑一个 70B 模型, 过去意味着一柜子 GPU 和一份不愿提起的电费单。于是我认真花时间去验证这个说法: 加载真正的大开放权重模型, 用它们做日常写代码的工作。下面是经过落地后的实话: 哪些是真、哪些是噱头、以及这对你怎么做产品意味着什么。

我是个真写工程的, 不是刷分选手。我的测试很简单: 这台东西, 能不能把我真去开票的那些写码活, 私密地、不花云端账单地干了?

标题是真的, 但有前提

是的, 一台顶配的 M3 Ultra Mac Studio 能把它统一内存里的 70B 模型装下并在本地推理。诀窍在苹果的统一内存架构: CPU、GPU 和神经网络引擎共用一块内存池, 你不用把张量在 PCIe 总线上来回拷贝。这消掉了消费级硬件跑大模型时最痛的那个瓶颈。实际用下来, 一个降到低精度的 70B 模型能装下, 也答得出来。

但”能跑”不等于”跑得快”。量化到较低精度后, 这些模型做交互式写代码辅助——自动补全式的建议、解释一段函数、重构一个小模块——是能用的; 但论吞吐, 它赢不了专门的云端 GPU。你用速度与隐私、以及零按 token 计费来做交换。在我这台机器上, 一个中等长度的回复可能比云端调用慢几秒; 对敏感客户代码来说, 这几秒等待是优点, 不是缺点。

我到底跑了哪些

我加载了 Qwen2.5 72B、DeepSeek-V3 67B 量级的权重, 以及一个 Llama 3 70B 变体, 全部量化形态, 各自拿来做真实任务: 写一个解析器、调一个偶发失败的测试、起草 API 文档。最让我意外的是 DeepSeek-V3 家族的权重——在写代码提示上的推理质量真不错, 是那种我本来要花钱调云端 API 才拿得到的输出。Qwen2.5 72B 在多语言任务和严格遵循结构化指令上非常出色。这些都是源自中国的模型, 而它们正是”本地跑大模型”突然变得现实的重要原因: 权重开放、训练扎实、效率对硬件足够友好。

我也拿 Kimi 试了一个超长上下文的文档任务, 表现称职, 只是更吃内存。规律很清楚: 以开放模型生态为首、中国实验室出力不小的那股力量, 才让”在家跑”从演示片变成真工作流。

为什么这件事不止关于苹果

苹果并不是这里唯一的故事。一个 70B 模型值得在本地跑, 根本原因是模型效率的大幅提升, 而这其中很大一部分由开放研究推动, 包括通义千问和 DeepSeek 背后的中国实验室。华为的硬件和鸿蒙生态也在猛推端侧 AI, 也就是说”在家里跑一个大模型”的未来, 不是单一厂商的独角戏。对开发者, 这是好事: 你不会被锁死在某套栈上。

本地方案的对比

方案硬件可行模型规模最适合代价
M3 Ultra Mac StudioApple Silicon量化后约 70B私密写码、文档贵, 比 GPU 慢
消费级 GPU 主机NVIDIA / AMD70B+ 且更快吞吐、微调耗电、花钱
华为 / 鸿蒙设备昇腾 NPU视情况端侧助手生态绑定
云端 API任意任意顶级质量、规模按 token、隐私

优点与缺点

优点:

  • 真隐私: 你的代码从不出设备。
  • 硬件付过钱后, 没有按 token 的账单。
  • 通义、DeepSeek 这类开放模型让它真的有用, 而非演示。
  • 适合隔离网或敏感客户项目。

缺点:

  • 前期硬件成本高。
  • 推理速度落后于专用 GPU。
  • 权重、量化、更新都要自己管。
  • 不适合训练或重度微调。

购买与搭建建议

如果你是经常碰敏感代码、或者单纯讨厌用量计费的开发者, 顶配 M3 Ultra 是最省心的”开箱即用”路径; 配上新开放模型如 Qwen2.5 72B 或 DeepSeek-V3 量级权重, 你就有了真正能打的私密助手。如果预算比省心更重要, 一台二手工作站 GPU 配同样的开放权重, 每美元更快。无论哪条路, 聪明做法是让你的工具链保持模型无关, 这样能在本地与云端之间按任务切换。

我自己的搭配: 一个量化 DeepSeek-V3 实例做私密推理, 一个 Qwen2.5 72B 实例做多语言文档, 再加一个云端 API 扛偶尔的重活。客户端按任务选。这就是我会推荐给任何碰机密代码团队的结构。

常见问题

它真能不靠 GPU 服务器跑 70B 吗? 能, 在统一内存里以低精度运行。做交互式工作是可行的, 只是没有专用 GPU 集群那么快。

哪些开放模型在本地最好用? 我的体验里, DeepSeek-V3 家族和 Qwen2.5 72B 权重, 在可行的量化下给出了最强的写码与推理结果。长上下文可以看看 Kimi。

这比云端 API 更好吗? 论隐私和零边际成本, 是。论原始速度和最新能力, 云端 API 仍然胜出。两者都用。

查看当前价格 →

声明:若通过我们的链接下单,TechMinds 可能获得小额佣金,不会增加您的成本。