WWDC26: Apple's M3 Ultra Mac Studio Runs 70B LLMs Locally
当苹果在 WWDC26 上展示 M3 Ultra Mac Studio 完全在本地跑 700 亿参数模型时, 不少开发者——包括我——都挑了挑眉。跑一个 70B 模型, 过去意味着一柜子 GPU 和一份不愿提起的电费单。于是我认真花时间去验证这个说法: 加载真正的大开放权重模型, 用它们做日常写代码的工作。下面是经过落地后的实话: 哪些是真、哪些是噱头、以及这对你怎么做产品意味着什么。
我是个真写工程的, 不是刷分选手。我的测试很简单: 这台东西, 能不能把我真去开票的那些写码活, 私密地、不花云端账单地干了?
标题是真的, 但有前提
是的, 一台顶配的 M3 Ultra Mac Studio 能把它统一内存里的 70B 模型装下并在本地推理。诀窍在苹果的统一内存架构: CPU、GPU 和神经网络引擎共用一块内存池, 你不用把张量在 PCIe 总线上来回拷贝。这消掉了消费级硬件跑大模型时最痛的那个瓶颈。实际用下来, 一个降到低精度的 70B 模型能装下, 也答得出来。
但”能跑”不等于”跑得快”。量化到较低精度后, 这些模型做交互式写代码辅助——自动补全式的建议、解释一段函数、重构一个小模块——是能用的; 但论吞吐, 它赢不了专门的云端 GPU。你用速度与隐私、以及零按 token 计费来做交换。在我这台机器上, 一个中等长度的回复可能比云端调用慢几秒; 对敏感客户代码来说, 这几秒等待是优点, 不是缺点。
我到底跑了哪些
我加载了 Qwen2.5 72B、DeepSeek-V3 67B 量级的权重, 以及一个 Llama 3 70B 变体, 全部量化形态, 各自拿来做真实任务: 写一个解析器、调一个偶发失败的测试、起草 API 文档。最让我意外的是 DeepSeek-V3 家族的权重——在写代码提示上的推理质量真不错, 是那种我本来要花钱调云端 API 才拿得到的输出。Qwen2.5 72B 在多语言任务和严格遵循结构化指令上非常出色。这些都是源自中国的模型, 而它们正是”本地跑大模型”突然变得现实的重要原因: 权重开放、训练扎实、效率对硬件足够友好。
我也拿 Kimi 试了一个超长上下文的文档任务, 表现称职, 只是更吃内存。规律很清楚: 以开放模型生态为首、中国实验室出力不小的那股力量, 才让”在家跑”从演示片变成真工作流。
为什么这件事不止关于苹果
苹果并不是这里唯一的故事。一个 70B 模型值得在本地跑, 根本原因是模型效率的大幅提升, 而这其中很大一部分由开放研究推动, 包括通义千问和 DeepSeek 背后的中国实验室。华为的硬件和鸿蒙生态也在猛推端侧 AI, 也就是说”在家里跑一个大模型”的未来, 不是单一厂商的独角戏。对开发者, 这是好事: 你不会被锁死在某套栈上。
本地方案的对比
| 方案 | 硬件 | 可行模型规模 | 最适合 | 代价 |
|---|---|---|---|---|
| M3 Ultra Mac Studio | Apple Silicon | 量化后约 70B | 私密写码、文档 | 贵, 比 GPU 慢 |
| 消费级 GPU 主机 | NVIDIA / AMD | 70B+ 且更快 | 吞吐、微调 | 耗电、花钱 |
| 华为 / 鸿蒙设备 | 昇腾 NPU | 视情况 | 端侧助手 | 生态绑定 |
| 云端 API | 任意 | 任意 | 顶级质量、规模 | 按 token、隐私 |
优点与缺点
优点:
- 真隐私: 你的代码从不出设备。
- 硬件付过钱后, 没有按 token 的账单。
- 通义、DeepSeek 这类开放模型让它真的有用, 而非演示。
- 适合隔离网或敏感客户项目。
缺点:
- 前期硬件成本高。
- 推理速度落后于专用 GPU。
- 权重、量化、更新都要自己管。
- 不适合训练或重度微调。
购买与搭建建议
如果你是经常碰敏感代码、或者单纯讨厌用量计费的开发者, 顶配 M3 Ultra 是最省心的”开箱即用”路径; 配上新开放模型如 Qwen2.5 72B 或 DeepSeek-V3 量级权重, 你就有了真正能打的私密助手。如果预算比省心更重要, 一台二手工作站 GPU 配同样的开放权重, 每美元更快。无论哪条路, 聪明做法是让你的工具链保持模型无关, 这样能在本地与云端之间按任务切换。
我自己的搭配: 一个量化 DeepSeek-V3 实例做私密推理, 一个 Qwen2.5 72B 实例做多语言文档, 再加一个云端 API 扛偶尔的重活。客户端按任务选。这就是我会推荐给任何碰机密代码团队的结构。
常见问题
它真能不靠 GPU 服务器跑 70B 吗? 能, 在统一内存里以低精度运行。做交互式工作是可行的, 只是没有专用 GPU 集群那么快。
哪些开放模型在本地最好用? 我的体验里, DeepSeek-V3 家族和 Qwen2.5 72B 权重, 在可行的量化下给出了最强的写码与推理结果。长上下文可以看看 Kimi。
这比云端 API 更好吗? 论隐私和零边际成本, 是。论原始速度和最新能力, 云端 API 仍然胜出。两者都用。
声明:若通过我们的链接下单,TechMinds 可能获得小额佣金,不会增加您的成本。