我发现个人部署本地 llm 真的很垃圾。

5 天前
 jony83

本地显存 48g 4090d,llm 为 fp8 量化版 qwen36.-27b

工作流是 yt-dlp--funasr---获取文案--qwen 提取观点 ---langgraph 调用 qwen 多 agent 对话---crawl4ai 搜索补充---生成文案龙骨---qwen 分段生成。

最终文案丢给 gpt ,无论怎么调提示词或流程,基本都是说废话太多,前面提到的观点后面重复解释之类。 而且调试也费时。 最后换成在线 api ,一切解决了。

本地模型可以用来生/编辑图、生视频、背景音等,短文可以,长篇还是算了,本地 llm 注意力机制的能力就决定了不能胜任。

367 次点击
所在节点    人工智能
6 条回复
laonger
5 天前
3.6 很老了,为啥不直接用 3.8 ?
jony83
5 天前
@laonger 2 个多月的感受。3.8 也一个样,只要传入的参数多或要求多,注意力机制能力就有可能忽略一些要求。
就像一条流水线上并行处理能力,可能你提了 10 条要求,一条流水线过去,他只处理了 8 条,使用 8 条的结果拼装,自然满足不了你的需求。
laonger
5 天前
感觉收到量化的影响很大
frayesshi1
4 天前
是不是注意力机制比较耗资源? Gemma 也是一样的,在一个对话里面对图片数量或者视频长度有要求的。
jony83
3 天前
跟训练和 transformer 模型有关。就像人脑只焦距眼球焦距的地方,其他次要的都是模糊的,在线模型设计多层 transformer 去解决强弱相关性问题,但是一次提问带的参数过多了还是无法满足,可以使用分层设计去解决参数过多的问题,但是因为 llm 是无状态的,有些是不能分层能解决的因为必须带有之前的全部或部分参数进去,分层不能解决就只能考虑换设计思路去解决自己需求。
oldlamp
3 天前
@laonger


@jony83

其实,有可能 3.6 的工具调用等方面还比同规格的 3.8 更强,或者至少不明显弱很多,而且可能还更快

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1236094

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX