mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

2 天前
 sentinelK
编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
信源会罗列在文章下方

结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源

然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

prefill

上下文 M3U ( v0.5.4rc2 )
1K 531.0 ~1590 ~2120
4K 486.5 ~1460 ~1950
64K 468.5 ~1410 ~1870
128K 438.6 ~1320 ~1750

decode

场景 M3 Ultra M5 Ultra 预计
MTP 关,1K 27.6 ~40
MTP 关,4K 25.8 ~38
MTP 关,64K 22.8 ~33
MTP 关,128K 21.3 ~31

信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

https://www.apple.com.cn/mac-studio/

https://omlx.ai/compare

8410 次点击
所在节点    Local LLM
51 条回复
sentinelK
2 天前
也就是说,结合实际场景,大概实际应用时打开 MTP ,prefill 也就是 1500 左右的水平,decode 大概在 60 左右。

prefill 性能仍然偏低。

但是结合非常大的统一内存,能实现非常高的多会话缓存命中能力,所以和多卡部署相比,有利有弊。
FrankAdler
2 天前
NVIDIA 打下的江山,Apple 开始摘桃子了吗
ReinXD
2 天前
这个价格对比 n 卡服务器,甚至可以说性价比爆表,统一内存的架构优势在 LLM 时代凸显出来了
xiaoyi123
2 天前
虽然比不上 nvidia ,但是便宜啊!!!!!
octocatami
2 天前
快囤 mac mini
ila
2 天前
可以使用 DeepSeek V4 Flash Vision Exp 吗
Cruzz
2 天前
逼的哪天老黄给显卡加内存条。让你们胡搞
scegg
2 天前
这速度适合一个人玩玩。甚至不适合一个人干活(并发 agent 的情况)。
Nzelites
2 天前
dsf 什么时候个人部署可以比较简单的到 100tps 的话感觉比较可用
sillydaddy
2 天前
是不是比双 DGX Spark 要强?
sentinelK
2 天前
@sillydaddy 从推论来讲,是。但是这个需要看实测。
毕竟 GB10 跑的是 cuda ,mlx 环境不能直接横比。
clemente
2 天前
@ReinXD 同配置 nv spark 只要 3w 啊
OnEvent
2 天前
这玩意是不是还能多机并联增加性能来着
ReinXD
2 天前
@clemente dgx spark 显存没有 512g ,这个区别挺大的,跨越到 512g 意味着可以部署满血 1M 版本的 dpsk v4f ,而且 m5 ultra 带宽 1.2TB/s 也是吊打 dgx ,大模型计算核心耗时其实都是权重搬运,这个对实际使用提升应该是非常巨大的。总的来说,和 dgx 完全不是同级别的硬件,dgx spark 还是有点不上不下,m5 ultra 已经摸到云端服务器水平了,考虑到个人/小团队使用甚至非常超模,部署的好很有可能比用官方 api 的体验还舒服
flyico
2 天前
Q4 量化版,和满血版能相差多大?
dragonszy
2 天前
是不是得等 512gb 的版本
mkdirmushroom
2 天前
目前准备搞个 256 的,up 建议等 512 吗?个人感觉模型参数量大的话,受制于内存带宽,性能不会好到哪里去,所以感觉 512 的意义不是很大,相较于 256 的话。
ReinXD
2 天前
@mkdirmushroom 真要买得等 512g ,能满血部署 1M dpsk v4f 是质变,不然不如买块 5090 玩,1.2T/s 对 1-4 个人来说其实是很超模的带宽水平,你对比 H200 那种 4.5T/s ,这么点人数根本吃不满带宽,楼主的估计其实还保守了点,低负载下+dspark mtp 加速,我算了下理论上至少能到 100 token/s
unifier
2 天前
@dragonszy 跑 dsv4f 应该用不到 512 的,glm 的量化版本应该至少要 512 了
sentinelK
2 天前
@dragonszy @mkdirmushroom 如果只是聚焦于 0731 的话,个人谨慎预测,性价比很低。
v4-flash 无损就是 8bit ,所以其实 256GB 已经可以跑无损(和 GB10 * 2 逻辑一样),但是 prefill 和 decode 会更难看。

而且家用不太可能同时占用太多个 session 的 kvcache 。同时保持 3~5 个 session 是在线的我已经觉得大脑过载了。

512GB 的优势一个是能同时保持更多的 1M 上下文的 session 在线(能命中缓存)以外,就是能跑更大规模的模型。
但是反过来说,更大规模的模型 prefill 和 decode 会更慢。

所以,统一内存方案的掣肘就在这,看似能跑很大的模型,但是实际把 RAM 占满速度又无法接受。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1237246

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX