有没有人装过 Strata + Qwen3.8-Flash-Next 125b?我遇到的问题是在 workbuddy 里一直超时。

1 天前
 zktz
有没有人装过 Strata + Qwen3.8-Flash-Next 125b ?我遇到的问题是在 workbuddy 里一直超时。
我用的 NVIDIA A6000 48G
2× Xeon Silver 4210R @ 2.40GHz = 40 线程
128G 内存
硬盘是固态的
我本来就是用 work buddy 远程控制安装的。开始用 workbuddy 安装,测试还不错。能到 90 多 tps 。套在程序代码里也没啥问题。但是套进 workbuddy 就有问题了,一直超时。我初步觉得是 workbuddy 上下文太长。然后套在 cherryStudio 里也不行。然后用 AI 分析 AI 解决。后来 cherryStudio 里好了。workbuddy 还是不行。最后 AI 分析是只要调用 tools 就有概率会崩。还有长上下文,在某个位置必崩。

大家有什么好的建议么?
1413 次点击
所在节点    Local LLM
8 条回复
anivie
1 天前
我也在尝试把 Starta 接入 codex 里用,发现 codex 里它不知道在哪执行的工具调用,思维链也不展示,一阵 thinking 之后直接告诉我在沙箱里什么也执行不了就退出了,给我整的一脸懵,现在在等官方支持 codex
bigcata
1 天前
非要用 workbuddy 干什么?
oldlamp
1 天前
有可能是量化的问题?
dford
1 天前
试试用 pi 或 omp 呢,适配得挺好的
cskeleton
1 天前
很可能是 wb 的问题,wb 还是有些私活,我把我的 codex 放 cpa 给朋友们用,朋友们发现不能生图,模型回复已经画好了,但是客户端看没有。分析了 wb 的文件之后发现它的生图只能走自己的渠道,其他渠道返回回来的图片直接静默丢弃。
我通过 cpa 然后放在 dsh 里用,完全没问题。5070ti+64G 内存,跑 iq3_s 能有 40+ tps 。
honjow
1 天前
我也接到 wb 用,正常的啊
utwo
22 小时 42 分钟前
我 2080ti 22gb 跑的都能勉强用。IQ2_XS ,60 左右的 tok/s
passive
21 小时 33 分钟前
这项目牛逼了,ddr3 的电脑 16G VRAM 跑 IQ3_XXS ( IQ2 估计降智严重),100k 上下文,稳定 40t/s 。 把本地的 Qwen3.6-35B-A3B 换了。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1246393

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX