pro6000 部署 Qwen 3.8 flash next nvfp4

9 月 3 日
 zzutmebwd
速度飞快,智力够用,十分好用,唯一的问题是占用了 60G 内存和 92G 显存,影响跑 ocr tts 和 asr 。















用了 12 年 V2EX 今天刚知道传一张图居然要收 20 币...
2783 次点击
所在节点    Local LLM
51 条回复
JasonYip
9 月 3 日
好羡慕 现在这个卡好贵啊 token 自由了
piapia
9 月 3 日
这卡年初才 6w 多吧
kekxv
9 月 3 日
ocr 直接让 qwen 识别按照格式返回就好了啊
SiWXie
9 月 3 日
羡慕,好奇能部署 glm 5.3 flash 吗?
honjow
9 月 3 日
羡慕死了
zzutmebwd
9 月 3 日
@kekxv 通用模型执行 pdf 转 xls 一类的任务不如 mineru 的。
zzutmebwd
9 月 3 日
@SiWXie 至少需要两张(好像也很紧张,四张比较稳)
marvin520
9 月 3 日
羡慕 token 自由
coefu
9 月 3 日
有个 64G vram 的,也能跑个 Q4.

https://github.com/FlashML-org/FreeToken

把 engram offload 到 mem 。
zzutmebwd
9 月 3 日
@coefu 那就慢的多了...纯显存+fp4 是最快的。n-gram 已经卸载了 nvfp4 完整权重 130G
coefu
9 月 3 日
蟹,bro 。

老师傅给你们一个便宜方案,有点 hack 。

找个 双 pcie 主板,最好能四通道,2*v100 32G ,m.2 16G 傲腾 M10 ,64G mem 。

1w 以内的解决方案。

绝招:装 Linux ,把傲腾 m10 映射成 vram cache ,v100 支持 GPUDirect Storage ,可以走 pcie 直接 读傲腾,绕过 cpu/mem 搬运。pcie3.0x16 30GB/s ,傲腾 16GB 容量。因为 傲腾夸张的 4k 随机读写和 mem 一个性能,所以,可以把 kvcache ( Q8 量化,1M context ) offload 到 M10 。engram offload 到 mem ,64G vram 放模型权重。

挤一挤,也能用。😂
coefu
9 月 3 日
@zzutmebwd 不是人人都买得起 pro6000 ,🦀,bro 。
wises
9 月 3 日
@coefu 64G 内存起步 5000 了吧? 那 2 个 V100 的 32G 的多少钱呢?
coefu
9 月 3 日
@wises 64G,4 通道,8 条插槽,每条 8G 。你硬件这块要补习啊,bro 。v100 32G 现在贵了,之前 3000 左右能搞到。
coefu
9 月 3 日
@wises 再贵,贵的过 pro6000 ?用它五分之一的价格,跑个 10tok/s ,值不值?
xiaomushen
9 月 3 日
500K 上下文是甜点,Qwen3.8-Flash 智力足够

这个真心羡慕了,token 自由
c0xt30a
9 月 3 日
OP 是怎么设置 `partial_rotary_factor` 和 `factor` 到 512K ctx 的?
catazshadow
9 月 3 日
@coefu 这个有多少 prefill ?
coefu
9 月 3 日
@catazshadow 这只是 idea ,我没去实践过,理论上看起来能跑通。
zzutmebwd
9 月 4 日
@c0xt30a 当前 long 模式( systemd 默认跑的 serve-flash-next.sh )是这样设置的:

通过 SGLang 的 `--json-model-override-args` 覆盖到 `text_config.rope_parameters`:

```json
{"text_config":{"rope_parameters":{
"mrope_interleaved":true,
"mrope_section":[11,11,10],
"rope_type":"yarn",
"rope_theta":10000000,
"partial_rotary_factor":0.25,
"factor":2.0,
"original_max_position_embeddings":262144
}}}
```

配合命令行 `--context-length 524288`。

要点拆解:
- `partial_rotary_factor=0.25` 是模型原生值(只有 25% 的 head dim 带 RoPE ,这个不是为扩长改的,只是随 override 一起显式声明,防止 SGLang 读不到 config 里的 rope 字段)
- `factor=2.0` 是扩长手段:原生 `original_max_position_embeddings=262144`( 256K ),YaRN ×2 → 524288 ( 512K )
- `rope_theta=1e7`、`mrope_interleaved` + `mrope_section [11,11,10]` 保持不变,与原生配置一致
- 权重文件本身 config.json 里 rope 字段是空的( NVFP4 转换版没带),所以才需要 json-model-override-args 注入,两套脚本( serve-flash-next.sh / serve-flash-next-test.sh )里这段 override 相同
- fast 模式则不带这组 override ,直接用原生 256K

注意 factor 不是自己拍脑袋设的缩放率——262144×2.0=524288 ,与 `--context-length` 严格对应;两者不一致时 SGLang 会在 rope 外推区间外产生质量断崖。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1239314

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX