据说 GPT6 的技术路线,可以压榨出十几倍的参数效果

1 天前
 siriusliangcn

OpenAI 证明此路可行,那等几个月被开源模型们摸索清楚了,那岂不是本地 27b 的模型能跑出 300b 模型的效果?哪怕 12b 能出 100b 的效果也行啊!

要 token 自由了?

是不是可以 Mac Studio 买起来了……

2195 次点击
所在节点    OpenAI
8 条回复
zhanying
1 天前
不太相信,截止目前,“没有银弹”还是真理。。。
sentinelK
1 天前
你如果只看跑分的话,qwen3.8-27B 的 xhigh 跑分,也可以和 flash-0731 有来有回。甚至吊打上 T 规模的老模型。

但是这是春秋笔法,没意义。
cubecube
1 天前
@sentinelK 有意义啊,3.8flash 很好用
shitshit666
1 天前
@sentinelK 但是跑分的话,好像也是模拟日常使用
coefu
1 天前
要是真行,全世界都不要新建 idc 了,openai 又找 amd 订了卡。

当前 transformer 架构下,scaling law 依然有效。

存算一体没有搞成之前,冯诺伊曼体系下,只有堆量,物理规律决定的。
sentinelK
1 天前
@shitshit666 没错,但是很多维度的体验是跑分没法告诉你的。

比如更小体量的模型,因为缺知识量,所以直觉更差,就需要更多的重试次数。
比如为了能力更好,越小的模型性格越偏激,必须要拿到真凭实据(收敛到极致),导致 thinking 起来完全停不下来。
longaiwp
1 天前
@sentinelK 这不就是跑分没有告诉你的事情,又不是跑分的设计有问题,你需要另外一个跑分衡量你想要的标准。
zizon
5 小时 20 分钟前
理论上,递归比循环省代码.
循环比手动展开省代码.

但这和要不要能不能写手工展开循环代码没冲突.

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1239243

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX