MacOS 上搭建了本地的 Gemma4,如何与它协作最高效?

4 月 10 日
 viskem

各位是如何做的?是使用什么对话窗口或是命令行、或者第三方工具? ClaudeCode / Cursor ? 平时我都用 Cursor 。(因为 ClaudeCode 屏蔽比较猛烈)所以本地的如何高效协作还希望参考下大家的优雅作风。

3258 次点击
所在节点    AI Agent 智能体
31 条回复
Brightt
4 月 10 日
搞的多少 B 的模型?
viskem
4 月 10 日
@Brightt Gemma4 26B
kizunai
4 月 10 日
没有用,就 M 芯片那个 prefill 速度,也就短点的对话还行,放弃辅助编程吧,别占用硬盘空间了
Hilong
4 月 10 日
楼上+1 基本长一点的上下文就卡住动不了了。搞搞小的对话还行,写代码还是算了吧
penisulaS
4 月 10 日
本地模型笨笨的,有什么需要超大量上下文但不需要高智能的场景吗
diudiuu
4 月 10 日
还是笨笨的。你可以使用 vscode ClaudeCode 插件,配置本地模型
dacapoday
4 月 10 日
非常适合做总结和提供索引,为更高级的模型提供服务,方便其更好的索引文档(业务总结的文字往往更精辟和专业,全文搜索更容易找到,然后 ai 再根据总结中包含的文件路径找到对应的文件).相当于一个简易的知识图谱,而且在不断丰富语义描述.
dacapoday
4 月 10 日
我也在折腾 gemma4, 感觉 V2EX 的人年龄偏大,比较迟钝. 看不懂 ai 的能力. 现在 local llm 的潜力巨大.
viskem
4 月 10 日
@dacapoday 我再让它慢慢爬我的项目,并接入到企微 Bot 上,但愿能协助到同事们。
tcper
4 月 10 日
26B 模型至少需要 24G VRAM 等同显卡
macbook/mini 48G 内存版或以上(操作系统,浏览器也得吃一大半内存)
以本人对 V 站的了解,大部分人没这个经济实力
darksword21
4 月 10 日
我还在尝试用 mlx 跑 E2B 的( 16G air )。。。

感觉也就一次性做个翻译之类的工作,
hash
4 月 10 日
放弃尝试本地模型这种浪费时间的行为最高效
kirbyzhu
4 月 10 日
个人感觉用处不大
emberzhang
4 月 10 日
卵用没有的。26b a4b 这种玩意给龙虾调用 tool ,一调一个不吱声全是失败

之前大内存 mac 是 70b 、122b 给 cherry studio 聊什么计算 24 点自己骗自己

现在大内存 mac 是 26b 、35b 扔给龙虾心跳,7x24 小时 龙虾屁事没干,人眼看着 omlx token 生成量继续骗自己
chenzhihuiiiii
4 月 10 日
@viskem #9 请问具体的应用场景是什么?
viskem
4 月 10 日
@chenzhihuiiiii 就是想让他慢慢熟悉项目和搜罗信息,帮我调整一些项目管理系统的信息,和大家简单推点通知啥的,简单问答一些项目上的信息。(我已经逐步认清现实……)
haohaozaici
4 月 10 日
没有显卡,9950x 本地跑 Gemma4 e4b ,只有 30 token/s ,没法写代码,简单问问题还行
zoozobib
4 月 10 日
已经用 gemma4 31b q4 量化的版本重构了半个 app 了,现在主力用它,opencode + openclaw + hermes ,接入了几个必用的 mcp ,如 word amap chrome opencli 等等,反正目前写文档、旅游计划、写代码主用这个模型。双显卡 上下文 35-58 所有的 token ,目前从涉及到的所有项目上看,很能打; moe 没试过
zoozobib
4 月 10 日
不过我最高开 200K 的上下文,到 120K 以上的上下文 token 速度有所下降
viskem
4 月 10 日
@zoozobib 诶? 31B 比 27B 这个强很多吗?晚上回去更新掉。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1204781

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX