mac m5 ultra 上线中国官网。1.2T 显存带宽, 256GB 版本 8.6 万

2 天前
 sentinelK
编者注:此文完全是数字推演,不代表真实硬件能力。笔者不对信息准确度负责。
信源会罗列在文章下方

结合 256GB 统一内存来看,目前比较有价值的就是运行 ds-v4-flash-0731 ,恰巧最近 omlx 有过一次版本更新,官方性能数据如下:信息来源

然后,M5 Ultra 的内存带宽是 M3 Ultra 的接近 1.5 倍。又根据苹果官网数据,其 prefill 性能是 M3 Ultra 的 4 倍( ollama 数据,框架不同,只能参考)

所以大概预期,M5 Ultra 运行 ds-v4-flash-0731 Q4 的大致性能是:

prefill

上下文 M3U ( v0.5.4rc2 )
1K 531.0 ~1590 ~2120
4K 486.5 ~1460 ~1950
64K 468.5 ~1410 ~1870
128K 438.6 ~1320 ~1750

decode

场景 M3 Ultra M5 Ultra 预计
MTP 关,1K 27.6 ~40
MTP 关,4K 25.8 ~38
MTP 关,64K 22.8 ~33
MTP 关,128K 21.3 ~31

信息来源: https://newreleases.io/project/github/jundot/omlx/release/v0.5.4rc2

https://www.apple.com.cn/mac-studio/

https://omlx.ai/compare

8278 次点击
所在节点    Local LLM
51 条回复
aimuz
1 天前
256G 的要 14 万,512G 应该不会少于 20 万吧?
tanszhe
1 天前
话说最近小米发布的 o100 也是 1.2T 带宽 是不是类似?
sentinelK
1 天前
@tanszhe 这个完全没有基础数据,所以只能看看了。毕竟内存带宽只是一个必要条件,并不是充分条件。
LLM 的表现和硬件、生态、框架、甚至模型本身都息息相关。

就像是保时捷 911 卡雷拉的前悬挂用的依然是麦弗逊结构。但你不能说用多连杆的面包车比他更运动。
slowgen
1 天前
今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
sosme
1 天前
@tanszhe 小米那个应该和老黄那个 nv spark 差不多,统一内存撑死 128g
kenvix
1 天前
@FrankAdler #2 好事,总得有人给牢黄上点强度
Gomoku2024
1 天前
其实更强的是可以多台 Studio 组合,实现 TB 级别的超大显存。
wy315700
1 天前
所以 4080S 32G 魔改版来了,8 卡刚好 256G 显存。
巧不巧,惊喜不惊喜,意外不意外。
iugo
1 天前
将来可能会有架构变动,比如 Cerebras 在 decode 场景性能很强,将来会有优化,但我觉得这个变动很可能不来自 NV 。
winning11k
1 天前
@slowgen 跑上了速度也太慢,时间也是钱
beginor
1 天前
泼一点儿冷水,Mac 并发很差的,多用户根本不能和 NV 比,买台十几万的 Mac 个人用是不是太奢侈了?
mrzx
1 天前
@beginor 买 8 块 4080S 32G 魔改版 个人用,是不是更奢侈?
CyouYamato
1 天前
@sillydaddy 我查了现在的评测加上对于 m3 ultra 的估计,两台 dgx spark 明显更快.虽然 mac 内存带宽大.
c0xt30a
1 天前
我这么算 tg:
- 1.2TB/s 的带宽
- dsv4-flash 的激活是 13B 的 fp4 ,大概是 6-7 GB
- 1M 上下文时候 bf16 kv 是 7 GB


所以不带 mtp:
- 在 ctx=0 时,1200/7 = 171 tok/s
- 在 ctx=1M 时,1200/(7+7) = 85 tok/s

参考:
- https://www.reddit.com/r/LocalLLaMA/comments/1svzlog/the_exact_kv_cache_usage_of_deepseek_v4/
azuis
1 天前
@Gomoku2024 组合不了,没有高速接口。nvidia spark 起码还有 200G 网卡
andyJado
1 天前
MK47
1 天前
有一个问题啦,不管是苹果还是小米的那个盒子 ,都没有 CUDA 生态
coefu
1 天前
512 的串起来是可行的,pipeline 模式的 layer 切割,其实没有那么多 要传输的数据,mac thunderbolt 5 120Gb/s 的速度,每台设备有 2 个,刚好上下串起来。

mac 没有 cuda ,只是性能问题,但是首先能不能跑来都保证不了,性能无从谈起。
zzutmebwd
1 天前
搜一下 dgx spark 双机并联跑 ds4f 的数据,比这个快不少。
whooc
1 天前
完全没钱买

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1237246

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX