用贵的国产大模型 API 是否效果堪比 GPT4?

2024 年 4 月 23 日
 lstz

最近想用 qwen 来协助开发,但感觉总是答非所问,还给人一种懒惰不肯干活的感觉

研究了一下,发现我用的是 qwen-turbo ,单价 0.008 元,而通义千问又提供了 0.12 元的 qwen-max ,切换之后,效果果然棒棒的,唯一缺点就是价格高了,有些贵

再想起各位吐槽国产大模型,我在想是不是因为目前客户端提供的都是菜鸡 qwen-turbo ,而真正高能力的大模型没有被普遍大众体验到,所以导致有种错觉国产不如 GPT4 ?

理性探讨,不要带有情绪,谢绝一切情绪发泄

免责声明,不为 qwen 或者任何其他国产大模型站台,只是开源项目想探讨一下 AI 编程的可行性而已

14912 次点击
所在节点    OpenAI
75 条回复
NCZkevin
2024 年 4 月 23 日
@JeriffCheng #9 不懂就别乱说,国内有 1W+ A100 卡的厂商至少有 5 家。事实上 23 年国内厂商还购买了大量的 A800orH800 机器,前几的大厂大模型都是自己训练的。只有小厂才用 llama 微调
siriussilen
2024 年 4 月 23 日
@sighforever 问题的关键字在于效果吧,“基础的简单任务还是能胜任的,比如翻译,总结,扩写,代码补全” 这些在过去几年,非 decoder only 架构的模型同样也做的很好。 如果没有推理能力就无法胜任更复杂的任务,就不会引发新一轮的生产力变革。
d119
2024 年 4 月 23 日
看了 1 楼的发言,瞬间觉得美帝制裁的效果真强……但是只要用脚趾头想想,9 楼的那种数字资料就不可能是对的
trungdieu031
2024 年 4 月 23 日
同等参数级别的大模型,尤其是 70B 以上参数的模型,国产模型确实不如 OpenAI 和 llma, 也就在特定的中文问题上表现好点;
楼上有人说拥有上万卡的公司有好几家,大厂以前囤积的卡包括后来从各地高价收购的卡加起来上万也没啥问题,但这些卡在大厂里也是分散在各处,并不是在一个统一调度的集群里,所以能用来训练大模型的也就在千张量级;
有些早期的大厂模型比如百度这些可能不是用 llma 微调的,但国内确实也有很多微调的大模型,由于国产大模型都没怎么开源,所以也很难判断,但从大厂一贯开源节流,“效率优先”的传统来讲,在开源模型上用中文语料库 finetune 似乎也是预料之中的事;
中文语料由于长期思想审查带来的语料质量方面的问题是存在的;所以会有从 chatGPT 这种大模型里生成中文数据来训练的情况出现;
很多排行榜有数据污染的情况,国产大模型很多为了刷榜提升知名度,会做一些面向刷榜的特定优化
iyaozhen
2024 年 4 月 23 日
@JeriffCheng 我感觉你很多信息错的离谱,我虽然不知道具体数量(非大模型部门),但肯定不是 2000 这个量级
还有你说的 finetune ,你去了解下就知道了,啥是 finetune

我不是做大模型训练的,是做应用层这块,回到楼主的问题,我们内部评测来看,目前中文各家最贵的那个在非推理能力上,基本上都超过 3.5 了,局部项超过 4.0 。整体还是离 4.0 有点距离,但也能望其项背了
MapleEve
2024 年 4 月 23 日
首先国内下单的 GB00 NVL72 就有十几万台了
其次国内从零训练的大模型确实很差,还不如 llama2 ,而现在那些微调的 llama3 已经开始卷起来了,但是他们既没有技术,也没有好的 SFT, DPO PPO 。
再次,国外所有社交媒体、新闻、出版书籍都是可以花钱购买语料的,而国内任何一家公司都不会出售自己的语料。
lithiumii
2024 年 4 月 23 日
去 chatbot arena 看,综合排名里阿里的 Qwen1.5-72B-Chat 还是很强的,略强于 Claude-1 。限定中文的话,还有 Yi-34B-Chat 也还行。限定代码问题的话 DeepSeek 之前口碑也不错,现在排名下去了。

这些差不多都是 3 到 3.5 的水平,但它们都是可以本地运行的开放模型。国内公司卖 API 的模型性能应该会更好一些
wOuv7i4e7XxsSOR1
2024 年 4 月 23 日
@JeriffCheng 哥们你真是张嘴就来啊
hellofreckles
2024 年 4 月 23 日
@JeriffCheng qwen 也会出现中英混搭,肯定也是基于一个英文的基座模型搞起来的
MuhammadWang
2024 年 4 月 23 日
这个 thread 突然让我对 LLM 能赚钱充满了信息,原来错误信息这么普遍,大家对 LLM 这么不了解
lvye
2024 年 4 月 23 日
@pkoukk #17 应该说的是 GPT 3 之前是开源的,这也是 OpenAI 的 Open 一词所在。

https://github.com/openai/gpt-2
maolon
2024 年 4 月 23 日
@hellofreckles 这个不是,是因为 qwen 的中文语料只占 15%,当然这也是 qwen 的国际排名比较高的原因,因为语料还是以英语为主。不过 qwen 和 llama 的架构很像且 qwen 的 embeding 做的比 llama 好,有 16 万条,刚出的 llama3 改进了 embedding 也才 13 万
lvye
2024 年 4 月 23 日
https://chat.lmsys.org/?leaderboard

![]( )

你用的 qwen 的确是国产里靠前的了
R18
2024 年 4 月 23 日
一本正经的胡说八道竟然也有人信。这人之前还嘲讽程序员看源码?
QXDM
2024 年 4 月 23 日
@R18 哈哈看了过往发言这哥们估计年纪还小
persistz
2024 年 4 月 23 日
hhhh 楼主的回复就和楼主口中的中文大模型一样,一本正经的胡说八道。
lstz
2024 年 4 月 23 日
@persistz 我回复啥胡说八道的了? 是不是回错人了
paopjian
2024 年 4 月 23 日
百度的 ERNIE 在小模型的时候确实有点东西,应该是自研的,但是训练预料肯定很多英文,不然也不会在画图的时候把总线画成 bus 公共汽车
persistz
2024 年 4 月 23 日
@lstz 哈哈哈哈不好意思不好意思,下午浏览器卡了 hhhh
zouywx86
2024 年 4 月 23 日
这真是大开眼界了,2024 年,居然在 V2EX 上,还能看到认知那么幼稚的人。

话说,楼主有对比过 「智谱清言」没?我现在主要用这个,中文能力感觉比千问要强(当然,我对比的是免费的,因为前面的这个也是免费的),代码能力,感觉也勉强能用。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1034834

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX