大家好,我是 Jason。
苹果 M5 Ultra Mac Studio 预计月底就要发售了。
顶配 512GB 统一内存,国行价格预计在 12 万到 15 万元之间。
你会买吗?
今年 3 月底,我在《苹果无心插柳:Mac Studio 快断货了》里写过:M5 Ultra 可能是普通人本地私有化算力的最好解法。我当时留下一句话:“我在等 M5 Ultra 512G——不是因为信仰,是因为数学。”
七个月过去,那边的测试台已经搭好了两台机器。
两台贴着标签的 M5 Ultra,插满雷雳线,跑 Qwen 3.8 Next Flash 6-bit:峰值吞吐冲过 400 tps,平均解码速度约 271 tps,长文本预填充(prefill)达到 8000 tps。
终端屏幕滚过行行输出,两台银色盒子的风扇转速听不出变化。
这篇文章把账本、硬件结构和实测数据摊开,看看这 12 到 15 万元的桌面算力,到底值不值。

月底那台 12 万的机器,到底带来了什么
大家对 Mac Studio 的第一反应是视频剪辑或音乐制作工作站。
现在守在苹果官网刷新发货周期的,是一群跑大模型和管理 Agent 的工程师。
M5 Ultra 的变化在统一内存规格。从上一代顶配的 256GB,直接跨入 512GB。
| 芯片配置 | 统一内存上限 | 内存带宽预估 | 典型全精度模型承载 | 6-bit 量化模型承载 |
|---|---|---|---|---|
| M2 Ultra | 192GB | 800 GB/s | 70B FP16 | 120B |
| M3 Ultra | 256GB | ~819 GB/s | 110B FP16 | 235B |
| M5 Ultra | 512GB | 1200 ~ 1500 GB/s | 235B FP16 | 400B+ MoE |
大模型本地推理的瓶颈在内存容量与内存带宽,不在浮点算力。
一个 4000 亿参数的混合专家(MoE)模型,采用 6-bit 量化后,权重文件占据 280GB 到 320GB 空间。算上 64k 到 128k 上下文产生的 KV Cache,显存占用直奔 400GB。
在 x86 和英伟达的阵营里,承载这个体量需要什么?
你需要装配 5 到 6 张 RTX 4090 24G,或者两张单价高昂的 A100/H100 80G。整套工作站需要配上 2000W 电源与散热水冷管路,开机伴随机箱风扇的噪音。
M5 Ultra 把 512GB 显存和处理器封在同一块基板上。整机功耗只有两百余瓦,巴掌大的铝合金盒体,立在书桌一角,插进普通墙插即可运转。
它把原本属于企业机房的显存规模,收拢进桌面设备之中。
双机雷雳直连:把两个 512G 拼成 1TB 显存池
一台 512GB 足够大。真实生产环境里,团队需要运行更大规模的模型,支撑数十个 Agent 并行。
我们在测试台记录了这套方案:两台 M5 Ultra 并联。

照片左侧贴有 MS5U1 标签,右侧贴有 MS5U2 标签。
设备下方垫着一台四盘位 NAS,上方架着一台白色 UniFi 交换机。两台机器背部接出 4 根黑色 Monoprice 雷雳数据线,直接将两台 Mac Studio 的接口打通,旁边连接超六类网线接入局域网。

两台机器并联的物理连接方式:
- 带宽聚合:单根雷雳 5 提供双向 80Gbps(PCIe 隧道模式达 120Gbps)。4 根雷雳线交叉互通,构建出一条带宽在 320Gbps 到 480Gbps 的低延迟点对点通道。
- 内存融汇:通过分布式推理框架(如 MLX Distributed 或 Exo),两台主机的物理内存被逻辑桥接。系统调度面对的是一个连续的 1024GB(1TB)统一显存池。
- 流水线切分:大模型的不同神经网络层分载在 MS5U1 与 MS5U2。前序层计算完成,激活值沿雷雳总线推送到第二台机器,无需绕经外部路由器。
两个原本独立的桌面系统,通过 4 根线缆合体成一台拥有 1TB 显存的本地计算单元。
预填充 8000 与解码 271:跑分背后的物理账
两台 M5 Ultra 连起来跑 Qwen 3.8 Next Flash 6-bit,跑出了这组数据:
- 峰值吞吐:400+ tps
- 平均解码速度(Decode):约 271 tks/s
- 预填充速度(Prefill):8000 tps
这三个数字说明了什么?
大模型推理包含两个阶段:预填充和解码。这两个阶段卡在完全不同的物理瓶颈上。

1. 预填充 8000 tps:长文档秒级消化
预填充阶段做的是矩阵乘矩阵(GEMM),是计算受限型(Compute-Bound)任务。
当你把一个十万字的 API 文档、整个项目的几百个代码文件,或者一份厚重的上市公司财报扔进模型时,芯片的所有计算单元(GPU 核心与神经网络引擎 NPU)全速运转,将输入的 Prompt 一次性向量化。
在两台 M5 Ultra 上,预填充速度冲到了 8000 tokens/s。
将一段 4 万字的架构规范投递给 Agent,机器 5 秒内完成解析并建立索引。审查全库代码或重构项目,手指无需在键盘前停顿等待。
2. 解码 271 tps:文字流淌速度超过肉眼
解码阶段逐字吐出 Token,做的是矩阵乘向量(GEMV),是典型的内存带宽受限型(Memory-Bandwidth-Bound)任务。
生成每一个 Token,芯片都要把模型那几百吉字节的权重全部从内存中读出过一遍。
普通的 M5 Pro 64G 在 8 月份跑 27B 模型,解码速度在 40 tps 左右(见《Qwen3.8 27B 在 M5 Pro 64G 上:能跑不是新闻,MLX 快了四成才是》)。
现在,双 M5 Ultra 将这个速度推到了平均 271 tps,突发峰值破 400 tps。
成年人默读速度每秒约 5 到 10 个词。271 tps 等同于一秒钟铺满半页 A4 纸。面对单人对话,这个速率超出视线捕捉能力;如果在本地编排 5 个自主 Agent 协同工作(代码编写、自动化测试、文档产出),双机能够同步推进多条并发调用,维持流畅输出。
3. 为什么是 6-bit?
很多人执着于 16-bit 浮点(FP16)。在工程落地中,6-bit 量化被称为“黄金分割点”。
大量基准测试表明,6-bit 量化损失的困惑度(Perplexity)小于 1%,在逻辑推理和代码编写上几乎无法分辨出与全精度的差异。6-bit 削减了近 60% 的带宽负载,让双机释放出 271 tps 的解码速度。
12 到 15 万,究竟是一笔开销还是资产
算账离不开价格:单台 12 万到 15 万元,两台合计 25 万至 30 万元。
买来处理文档、浏览网页,这笔投入毫无意义。若将它视作生产设备与固定资产,账目的逻辑就变了。
我们算一笔三年的账本:
商业云端 API 模式(3年):
- 核心主力 Agent 调用:约 $1,200 / 月
- 团队多任务与长上下文测试:约 $800 / 月
- 3年累计开销:$2,000 × 36 = $72,000(折合人民币约 51 万元)
- 资产残值:0 元(买来的只是日志里的 Token 账单)
- 附带成本:账号封禁风险、高峰期排队降频、核心代码隐私泄露合规审计
本地 M5 Ultra 512G 单机模式(3年):
- 硬件购置成本:约 13.5 万元
- 3年电费开销(200W × 24小时):约 3,100 元
- 3年累计总开销:约 13.8 万元
- 资产残值:按苹果高端工作站二手流通折让,3年后残值约 4 到 5 万元
- 实际持有成本:不到 10 万元(年均 3 万余元)
三年省下近 40 万元现金流,同时拥有不受限制的本地 Token 额度。
设备背后的底线在数据安全与业务连续性。
上个月我写过《被 Claude 封了 17 个账号之后,我把它的家搬到了澳洲》。商业云端服务对个人和中小团队充满不确定性:时区检测、IP 封禁、突然收紧的额度倍率。投入心血编排好的自动化流程,可能因为服务商的一封邮件在清晨直接停摆。
放在桌上的 M5 Ultra 没有账号体系,不需要代理节点,断开外网网线依旧稳定运行。商业机密文件、未公开的核心代码、客户的敏感交易数据,全部留在本地 SSD 和统一内存中。
算力握在自己手里,觉才能睡得踏实。
谁该买,谁该绕道
这套设备只适合特定场景。
应该考虑入手的人群:
- 独立 AI 开发者与超级个体:像我一样一个人维护多个产品(如 Zaokit AI),日常由 5 到 10 个 Agent 全天候接力工作。
- 数据安全强监管团队:律所、金融分析机构、医疗方案咨询、军工涉密配套企业,核心资料严禁上传第三方云服务器。
- 模型评测与量化极客:需要频繁测试开源模型各种尺寸和量化参数的工程师。
应该果断放弃的人群:
- 绝大多数日常办公、编程学习者:一台 24G 内存的 MacBook Air 或 64G 的 M5 Pro,配合月付几十美元的商业订阅,已经足够好用。
- 偶发性大模型使用者:如果一天只问模型两三句话,云端按量付费的成本甚至不到几块钱,不必背负十几万的硬件资产。
算力拿在手里,时代才真正开始
今年三月,我说我在等 M5 Ultra 512G,不是因为信仰,是因为数学。
现在这台机器带着 512GB 统一内存和 1200+ GB/s 带宽走到了货架边缘。两台直连跑出的 400+ tps 峰值和 8000 tps 预填充,证明了桌面集群路线的可行性。
桌面设备的体积、家电级的功耗,桌角安置下两年前小型机房具备的计算容量。
把算力设备固定在桌角,代码在内网运行,夜里的觉也能睡安稳。
最后顺便出个闲置:
为了给接下来的设备腾地方,我准备出手手里的两台机器:
- M2 Max(32G + 1TB)
- M5 Pro(64G + 1TB)
平时成色都很好。需要的可以在后台私信我,小黄鱼(闲鱼)上我已经发布了链接,感兴趣的朋友直接搜索 JustJason 就能找到。