苹果把四台 Mac Studio 连起来了,然后呢?
摘要:苹果第一次在官方通稿里鼓励多机集群。但"能不能连"解决了,"放在哪"还没解决
前言:
8月25日,苹果发布新一代 Mac Studio:M5 Ultra,最高 512GB 统一内存,1.2TB/s 带宽,峰值 AI 算力是上代 M3 Ultra 的 4.3 倍。
但真正的信号藏在通稿不起眼的一段——苹果第一次正式写下:通过雷雳 5 与 RDMA,多台 Mac Studio 可互联组集群,四台协同的分布式 AI 推理性能最高可达单机的 3 倍。
过去四十年,苹果卖的一直是"一台好用的电脑",是单数。这次它在描述算力单元:复数、可堆叠、需要被管理。
于是有了一个很不浪漫的问题:四台 Mac Studio,放在哪里?
摆桌上,是四台电脑、四根电源线、八条雷雳线和一场线缆灾难。放进机柜,才是一套系统。从"一台"到"一套",隔着的不是钱,是工程。
一、AI 的瓶颈换了位置,Mac 的价值也换了位置
1.1 内存墙:显卡不是不够快,是不够大
大模型推理的真正瓶颈不是算力,是内存带宽。
Roofline 模型说得很清楚:性能要么受限于算得多快,要么受限于数据搬得多快,谁先到顶谁说了算。文本生成属于后者——每生成一个 token,机器要把整个模型权重读一遍,读完做的算术反而很少。苹果 MLX 文档写得更直白:"生成后续 token 的速度受内存带宽限制,而非计算能力。"
所以决定速度的是:内存带宽 ÷ 模型体积。
700 亿参数模型 4-bit 量化后约占 40GB。RTX 5090 带宽 1792GB/s,理论上限约 45 tokens/秒,但它只有 32GB 显存,装不进去——天花板是 45,实际是 0。M3 Ultra 是 819GB/s,约 20 tokens/秒;M5 Ultra 是 1.2TB/s,约 30 tokens/秒。
GPU 赢在速度,输在容量。而模型的发展方向是越来越大——DeepSeek V3 是 6710 亿参数,Kimi K2 是 1 万亿参数的 MoE。这个方向对苹果有利。
AI 推理是体力活不是脑力活。它是搬运工,不是数学家。
1.2 统一内存:优势藏在架构里
苹果凭什么做到 512GB?不是堆料狠,是架构不同。
传统 PC 是分裂的:CPU 用内存,GPU 用显存,中间隔着 PCIe 总线。数据两边搬运要拷贝、要过桥、要等。所以显存做不大——不是做不出来,是做大了也没用,瓶颈卡在那条桥上。
Apple Silicon 是统一的。DRAM 直接封装在处理器旁,CPU、GPU、神经网络引擎访问同一个池子,没有 DMA 拷贝,没有 PCIe 跨界。所以 M5 Ultra 的 512GB 是完整的 512GB 都能当显存用;一张售价八千多美元的专业卡,显存 96GB。
机型 / 芯片 | 最大统一内存 | 内存带宽 |
Mac mini (M6) | 32GB | 170GB/s |
Mac mini (M5 Pro) | 64GB | 307GB/s |
Mac Studio (M5 Max) | 128GB | 614GB/s |
Mac Studio (M5 Ultra) | 512GB | 1.2TB/s |
RTX 5090 | 32GB | 1792GB/s |
还有一层常被忽略、对 B 端客户可能最关键的:数据不出门。模型权重、提示词、推理结果全在机房里,没有第三方 API,没有数据出境,没有按 token 计费的账单。对金融、医疗、政务、军工以及任何握着不能外传资料的团队,这不是性能问题,是合规问题——花钱买云服务买不来。
二、从"一台电脑"到"一套系统",隔着工程
2.1 四条产品线,两种答案
Mac mini 是 5×5×2 英寸的方块,Mac Studio 是 7.7×7.7×3.7 英寸的方块。它们没有机架耳朵、没有导轨、前面板没有电源键,也没有任何一处设计考虑过"被塞进 19 英寸机柜"。
Sonnet 补的就是这一课。这家公司从 1986 年做到现在,四十年只专注一件事:让专业设备能被专业地使用。
RackMac mini(2024+)——密度优先。 2U 并排装 3 台 Mac mini,钢结构,每台下方预留固态硬盘位,前面板独立电源键。一个 42U 机柜理论上能塞 63 台。
xMac mini(2024+)——密度加扩展。 2U 装 2 台 Mac mini,另一半留给 PCIe 扩展模块。旗舰配置 Echo II DV T5:两个全高全长插槽,双雷雳 5 接口,每插槽 6000MB/s;400W 电源、双 75W 辅助供电、双 Noctua 风扇(17 dBA)。
RackMac Studio——双机位。 3U 装 1 到 2 台 Mac Studio。9.5 英寸浅深度是关键,意味着它能进飞行箱、进转播车、进深度受限的移动机架。
xMac Studio——单机加扩展。 3U,1 台 Mac Studio 加一个 PCIe 模块,可选 Echo III(三插槽,最多三张 Avid Pro Tools | HDX 卡)、Echo I(单插槽,150W 辅助供电)或 Echo II DV(双插槽)。
怎么选?两个问题。 瓶颈是算力节点数量还是 I/O 卡数量?前者 RackMac,后者 xMac。设备要不要跟着项目走?如果要,看深度——RackMac mini 是 5.25 英寸,RackMac Studio 是 9.5 英寸,这两个数字决定能用什么箱子。
2.2 参数表下半页的那些细节
真正决定这套东西能不能在机房活三年的,是参数表下半部分。
散热,最容易翻车。 苹果为 Mac 设计了精密热架构:底部吸冷风,穿过机身,背部排出。廉价机架往往是开放托盘或塑料壳,机器一塞,吸进去的是自己刚吐出的热风,结果就是降频。Sonnet 顺着苹果的设计走:前面板开通风孔,下方留封闭腔体保证吸冷风,背面完全开放保证热风排出——你不会因为集成方案损失任何算力。
供电与运维。 xMac mini 一个电源接口同时给两台 Mac mini 供电,少一根线就少一个故障点。前面板电源键用机械结构引到前面,按一下就开机。模块各用两颗手拧螺丝固定,松开就能整块抽出,换卡换机器不用拆机柜、不用下线。
移动与静音。 全系铺减振橡胶垫,配合浅深度可直接装进 Gator Cases 或 SKB 飞行机架。17 dBA 双 Noctua 温控风扇比图书馆还安静,可以放在录音棚控制室、剪辑师工位旁。
机架不是"把电脑放上去",是"让电脑在机房里活下去"。
三、Mac 扩展的真正战场
3.1 PCIe:Mac 唯一缺的那块拼图
Apple Silicon 有个结构性遗憾:没有 PCIe 插槽。
而专业世界还有很多事只能靠 PCIe 卡做:AJA Kona 5、Blackmagic DeckLink 8K Pro、Bluefish444 Epoch 与 KRONOS SDI 卡、Avid Pro Tools | HDX、光纤通道卡、高速万兆网卡、硬件编解码卡。这些卡没有雷雳版本,短期内也不会有。
所以要么放弃这些工作流,要么给 Mac 装一个 PCIe 扩展箱。Sonnet 的 Echo 系列做的就是雷雳转 PCIe。
Echo II DV T5 是这一代旗舰:双雷雳 5、两个全高全长插槽、每槽 6000MB/s,可一卡接一台机器,也可两张都给同一台。Echo III 支持最多三张 HDX 卡并内置 HDX 兼容模式开关,对大型 Pro Tools 工程是目前 Mac 平台上最干净的方案。配套 400W 电源和两个 75W 辅助供电,且扩展模块随 Mac 自动开关机。
PCIe 扩展箱不是转接头,是许可证。有了它,"用 Mac"和"用专业卡"就不再是二选一。
3.2 三个场景,一个答案
本地 AI 推理集群。 我们为一家头部互联网企业交付过一套 Mac mini 集群:20 台 Mac mini,采用 Sonnet RackMac 专业机架,每台 2U 容纳 3 台,配定制智能双路冗余电源,通过交换机互联。它解决的不是"算力比 GPU 强",而是部署快、运维简单、能效比优秀。第三方实测可作参考:8 台 64GB Mac mini 组成 512GB 内存池可跑 DeepSeek V3 671B;RDMA over 雷雳 5 把节点间延迟从约 300 微秒压到 5 到 9 微秒。
但边界要说清:它适合单用户或小规模团队推理,不适合高并发生产级服务,也不适合训练和微调——那仍是 CUDA 生态的主场。
广电后期与录音棚。 Mac Studio 做主机,xMac Studio 提供两个 PCIe 槽位,一张插 DeckLink 8K Pro 做采集和监听输出,一张插光纤卡连共享存储。整套 3U、17 dBA,可以放在剪辑工位旁边。
DIT 移动工位与转播车。 空间小、要颠簸、要快速架设。RackMac Studio 的 9.5 英寸和 RackMac mini 的 5.25 英寸深度就是为它准备的,配减振垫装进 SKB 飞行机架就能跟组走。
总结
苹果解决的是"能不能连",没解决的是"放在哪"。而"放在哪",恰恰是算力从实验室走向生产环境的最后一公里。
Mac 的 AI 优势是天然的,但不会自动变成企业生产力。中间需要一层工程化封装——把它从一台好用的电脑,变成一套可部署、可运维、可扩展的系统。Sonnet 的机架与扩展方案,做的就是这层封装。
四步决策:定内存——先想清楚模型需要多少内存再倒推机型,容量是硬门槛,带宽只是快慢;定密度——超过 6 个节点就考虑机架方案,散放在桌面从第一天起就是负担;定 I/O——盘点有没有绕不开的 PCIe 卡,有就选 xMac,没有则 RackMac 更经济;定场景——要不要移动、要不要静音、机柜多深,这决定具体型号。
北京蓝美视讯是 Sonnet Technologies 在中国的授权经销商,可提供从选型、供货到集成部署的全流程支持。
咨询电话:400-831-3115 官网:www.bluemade.cn
产品价格以蓝美视讯实际报价为准,兼容性请以 Sonnet 官方 PCIe 卡兼容列表为准。