2 台 DGX Spark 上运行的本地 LLM 横向对比

20 小时 52 分钟前
 ldm0

有三个模型能跑

过去一周 flash 模型集体更新:

  1. Qwen3.8-Flash-Next
  2. GLM-5.3-FLash
  3. DeepSeek-V4-Flash-Vision-Exp(之前没有 Vision)

比较幸运的是这几个模型刚刚好都能在两台 DGX Spark 上面跑起来,直接爽吃。

横向比较

在这三个模型里面来回切换了好多次,说一下使用体验:

Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp > GLM-5.3-FLash

GLM-5.3-FLash > DeepSeek-V4-Flash-Vision-Exp > Qwen3.8-Flash-Next

GLM-5.3-FLash > Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp

比较细节的是 GLM-5.3-FLash 有两个量化版本 EXL3 和 NVFP4:

  1. NVFP4 的 prefill 更快(加载历史会话更快) 1500t/s 左右,比 EXL3 1000t/s 快很多
  2. EXL3 的 decode 更快(吐字更快) 28t/s ,比 NVFP4 20t/s 快很多

主观结论

我主要是用 Hermes ,这三个模型其实都已经非常不错了,没有找到什么明显瑕疵。

总的来说如果要绝对质量,用 GLM-5.3-FLash; 要绝对速度,用 Qwen3.8-Flash-Next

DeepSeek V4 Flash 有点中不溜,而且图像理解似乎有点近视,看不清图片细节,实测被上面两个模型爆杀。

现在每天日常在用 Qwen3.8-Flash-Next :D

2366 次点击
所在节点    Local LLM
27 条回复
xqk111
7 小时 28 分钟前
这个部署的话,能几个人同时用吗
minibear2021
7 小时 24 分钟前
@ldm0 #17 性价比出来了
ldm0
7 小时 13 分钟前
@xqk111 glm 5.3 不行,没有足够 kv cache ,deepseek 还有 qwen 可以。
ldm0
7 小时 12 分钟前
@minibear2021 如果硬件正常贬值的话没什么性价比,但是现在还能小赚一点的话性价比就爆了。
flyico
5 小时 25 分钟前
无论什么时候,都是线上 plan 比本地划算啊,有这几个 w 够你买多少年的 plan ,而且永远是满血+最强+最新版,本地部署唯一的优点就是数据安全可控,对于合规要求高的只能有本地部署了
TArysiyehua
5 小时 19 分钟前
@flyico 也不能这么说,现在硬件出来没多久就涨价,买这个比买 A 股还香,自己 5 万买的玩了一年 10 万卖出去。
ldm0
4 小时 15 分钟前
@flyico 可以全都要,比如现在线上 plan 会拒绝干一些逆向的活,然后一些敏感问题也可以问,全在本地就很安心。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1239350

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX