大家帮忙看看跑本地大模型哪个方法更好点, 以及云端调用 api 的方法.

3 月 29 日
 Hermitist
方法一:cherry studio 对接本地 Ollama 跑的大模型, 突破只能聊天的限制
方法二:AnythingLLM+llama.cpp ,可以自己配 gpu 和 CPU 分配。且占用资源少。



第二个问题:
一个任务最后如何做到 80%用本地模型, 最后 20%高精度/高密度的工作才扔给云端来最后进行收尾?


第三个问题:
如何薅羊毛使用云端 api, 比如通过注册机 24 小时产号, 然后本地搭建 sub2api 之类的调用 openai 之类的 token
P.S: 各位能推荐一个注册机吗?

还是大家直接用 cc-switch 呢?

期待各位指点, 不胜感谢.
1576 次点击
所在节点    程序员
1 条回复
Hermitist
3 月 29 日
自己测试了下, mac 无脑上 omlx, 然后龙虾对接曲线实现控制电脑, 操作浏览器.

第二个问题是模型路由模式, https://github.com/QuantumNous/new-api/blob/main/README.zh_CN.md 这个可能可以.

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1201912

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX