qwen 本地大模型的问题

4 月 2 日
 workbest

我的机器是 M1 Pro ,32G 内存,部署本地模型主要是两个需求:

  1. 翻译
  2. 总结并做简单的分析提取内容

我一开始使用的是 qwen3.5-9b 和 qwen3.5-4b 的模型,测试的时候,可以用,但是在实际跑起来的时候,发现 qwen 会无限思考,经常 10 分钟都没有任何响应;后来换成了 qwen3-4b 的模型,效果比较好,很少出现无限思考的问题

1834 次点击
所在节点    Local LLM
4 条回复
lagrange7
4 月 2 日
是不是启动的时候设定不思考,会好一些?
xiaoz
4 月 2 日
你直接调用参数里面设置下禁止思考呗。
workbest
4 月 2 日
没有 disable 思考,设置了 最大思考 token ,没用
ahdw
5 月 25 日
用 oMLX ,然后 32GB RAM 可以很舒服地跑 gemma-4-26b-a4b-fp16 了,你选一下 oQ8 量化配短一点的上下文,或者 oQ4 量化,跑 32K 以上的上下文。

M1 和 M2 系列的 GPU 没有 bf16 格式的硬件加速,所以关键不在量化,在 fp16 上,能显著提升 PP 和 TG 的速度。

另外,Dflash 和 MTP 对 M1 系列来说,基本上净收益为负,不用浪费时间了。

Qwen3.6-35b-a3b 比那个 9B 模型强,你都有 32GB RAM 了,没必要用它了。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1203064

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX