2 台 DGX Spark 上运行的本地 LLM 横向对比

21 小时 39 分钟前
 ldm0

有三个模型能跑

过去一周 flash 模型集体更新:

  1. Qwen3.8-Flash-Next
  2. GLM-5.3-FLash
  3. DeepSeek-V4-Flash-Vision-Exp(之前没有 Vision)

比较幸运的是这几个模型刚刚好都能在两台 DGX Spark 上面跑起来,直接爽吃。

横向比较

在这三个模型里面来回切换了好多次,说一下使用体验:

Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp > GLM-5.3-FLash

GLM-5.3-FLash > DeepSeek-V4-Flash-Vision-Exp > Qwen3.8-Flash-Next

GLM-5.3-FLash > Qwen3.8-Flash-Next > DeepSeek-V4-Flash-Vision-Exp

比较细节的是 GLM-5.3-FLash 有两个量化版本 EXL3 和 NVFP4:

  1. NVFP4 的 prefill 更快(加载历史会话更快) 1500t/s 左右,比 EXL3 1000t/s 快很多
  2. EXL3 的 decode 更快(吐字更快) 28t/s ,比 NVFP4 20t/s 快很多

主观结论

我主要是用 Hermes ,这三个模型其实都已经非常不错了,没有找到什么明显瑕疵。

总的来说如果要绝对质量,用 GLM-5.3-FLash; 要绝对速度,用 Qwen3.8-Flash-Next

DeepSeek V4 Flash 有点中不溜,而且图像理解似乎有点近视,看不清图片细节,实测被上面两个模型爆杀。

现在每天日常在用 Qwen3.8-Flash-Next :D

2387 次点击
所在节点    Local LLM
27 条回复
honjow
19 小时 27 分钟前
羡慕双 DGX
ldm0
17 小时 44 分钟前
@honjow 几个月之前从闲鱼低价收的,现在的价格已经完全买不起了 T.T
witcherhope
13 小时 58 分钟前
羡慕大佬,不像我,只能用 4090 48G 版本本地跑一跑 Qwen3.8-27B-FP8
zzutmebwd
13 小时 50 分钟前
hhh 看到最后一句果然是这样 其实本地模型就是够用够快,追求绝对智力直接换 opus api
0x400
13 小时 45 分钟前
速度具体是多少呢
heyjei
13 小时 21 分钟前
我也部署了一个 QWen3.8 27B ,速度有 30tokens/s

不过我的问题是 claude code 接这个用的时候,始终无法流畅使用,不是 auto mode 的权限分类器无法成功运行,就是 Web Search 无法运行。

你是怎么用你自己搭的本地 LLM ,前面有接什么 agentic api 层吗?
qazwsxkevin
13 小时 19 分钟前
大佬可以说一下上面提到的 3 个模型的精度吗? 同一个模型精度差一个级别,输出质量有多大区别?
sentinelK
13 小时 9 分钟前
@heyjei 相对而言 dsh 这种比较开放的 harness 更方便实现全工具能力。可以靠插件,可以靠 skill 。
Codex 和 Claude Code 都是依赖 API 来提供 web_search 的,所以一般只能安装第三方 MCP 来实现。

@qazwsxkevin 抱脸的量化方在文档中都会着重体现自己的量化方案的损失,关键词是 KDL 以及 Top 1%正确率。通常来讲,优秀的 4bit 量化的 top 1%大概在 95%~97%。比如 unsloth 就以量化损失小著称。他们会公布热门产品的量化损失曲线。
tsja
12 小时 59 分钟前
小白想知道,像这样本地运行的都是量化版的吧,像 GLM5.3flash 的量化版和官方 API 的满血版性能体验差距有多大呢?
RexKang
12 小时 10 分钟前
@ldm0 好奇多低收的……能说个范围吗
qa2080639
10 小时 55 分钟前
一台的话推荐什么模型 我部署的 qwen27B 才 25T/s
ldm0
10 小时 42 分钟前
@zzutmebwd 快就是好.jpg
主要是 Qwen 的智力其实也很高了,只要不写代码。
ldm0
10 小时 40 分钟前
@0x400 qwen 和 deepseek 的 prefill 差不多是 2500t/s 和 1800t/s ,单流 decode 二者差不多都是 70t/s ,多流的话 qwen decode 要更快一些
ldm0
10 小时 38 分钟前
@heyjei 换一个对本地 LLM 支持更好的 harness 吧,比如 pi 。
ldm0
10 小时 36 分钟前
@qazwsxkevin DeepSeek 是 fp8 满血,GLM 是 EXL3 和 nvfp4 ,Qwen 是 nvfp4 。

这几个量化都不极限,智力基本都保持的比较好,几个模型看评估数据基本都是 95%以上,我体感上没有智商问题。
ldm0
10 小时 34 分钟前
@tsja 没有用过官方 API ,但是 GLM5.3 Flash EXL3/NVFP4 的能力其实已经远远超出我的预期了,聪明是真的聪明,和其它两个有代差的感觉。
ldm0
10 小时 34 分钟前
@RexKang 5w4 收的两台+连接线
ldm0
10 小时 32 分钟前
@qa2080639 一台可以用 Ling Flash 之类的模型,DeepSeek V4 Flash 也有一个单 DGX Spark 可跑单量化版本。

可以去 nvidia 论坛看看,不少人都只有一台 https://forums.developer.nvidia.com/c/accelerated-computing/dgx-spark-gb10/719
yachen
9 小时 14 分钟前
双 dgx prefill 和 decode 实测多少速度?
ldm0
8 小时 25 分钟前
@yachen 上面有说,不同模型差别挺大的。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1239350

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX