Nvidia 128G 的那个小盒子用哪个模型好?

1 天前
 abctest

试了最新出的 Qwen3.8-27B ,吐字很慢,4token/s 。 试了 Qwen3.6-35B-A3B ,质量感觉不行,幻觉有些严重。

972 次点击
所在节点    问与答
2 条回复
volvo007
1 天前
因为这货的带宽太低了,所以非常不适合稠密模型的推理。所以比较合适的还是两台上满血 d4f
biaoyu
22 小时 19 分钟前
适合用 MOE ,稠密不行

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1237461

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX