大家有没有感觉国产 AI 编程其实已经挺能打了,就是太慢了

9 月 4 日
 VBk

最近 Kimi 、GLM 、DeepSeek 我都用了一些,我现在有个感觉,就是国产 AI 编程能力其实真没以前差那么远了。

尤其 Kimi 和 GLM ,我自己体感大概已经能有 GPT 七八成吧。肯定还是 GPT 强,但是已经不是那种完全没法比的感觉了。有时候我 GPT 写完东西,再扔给 Kimi 或者 GLM review 一遍,它还真能给你找出来一点 GPT 漏掉的东西。

所以我现在觉得拿国产模型做第二遍检查其实挺合适的。

但是有一点我真的受不了,就是太慢了。

同样一个东西,我用 GPT ,高思考模式可能三十秒就搞完了。换 Kimi 、GLM ,六七分钟都有可能。GLM 尤其慢,我感觉比 Kimi 还慢。有时候我都忘了刚才让它干嘛了,它还没跑完。

DeepSeek 也是这个问题。

然后价格这个东西我现在也有点怀疑。大家都说国产便宜,按百万 Token 算确实便宜,但是问题是同样干一件事,它消耗的 Token 好像也比 GPT 多不少。

GPT 可能很快就把问题解决了,国产在那想半天,跑一大堆 Token 。最后真按一个任务算下来,我感觉 GPT 好像也没贵,甚至可能还更便宜。

所以单看每百万 Token 多少钱,我现在觉得没啥意义。应该看同一件事最后到底花多少钱,还有花多长时间。

我目前用下来的感觉就是 GPT 综合性价比还是最高。贵是看着贵,但是快,而且大部分时候一次就能把事干明白。

国产里面我现在更喜欢 Kimi 一点,综合比较均衡。真要必须国产,比如数据比较敏感,那我估计还是会选 Kimi 。

GLM 我感觉能力其实挺好的,尤其拿来 review ,但就是慢,真的慢。

DeepSeek 现在我反而有点不知道用它干嘛了。以前便宜是个很大的优势,现在感觉也没有以前那么便宜,再加上还是慢,我自己用得越来越少。

不知道你们有没有这种感觉?尤其是平时真拿这些东西写代码、跑 Agent 的。

我挺想看看有没有人实际算过,同一个任务 GPT 、Kimi 、GLM 、DeepSeek 各跑一次,最后分别用了多少 Token 、多少钱、多少时间。我怀疑最后算总账,GPT 可能反而是最便宜的那个。

5881 次点击
所在节点    智谱
47 条回复
Nasdaq
9 月 4 日
都是义和团大模型,归根结底就是算力不够。没算力=训练和部署规模上不去=没有好用户和好数据=没有好工程反馈=没有正向循环=一直蒸馏美帝。
Meursau1T
9 月 4 日
GPT 也挺慢的啊,不知道是不是因为 sol xHigh 和 max 本身就慢,反正每天也是看着他在那里磨叽。
GLM 没用过,DS 涨价了没法写代码用,Kimi 确实还可以,我用 199 套餐的 K3 ,没感觉比 GPT 差在哪了,还多一个“说人话”的优势。大家都说 K3 慢,但我还是感觉没跟 GPT 的 sol max 速度差到哪去,都一样慢。
Yukiteru
9 月 4 日
我觉得 deepseek-v4-flash 很好用,速度快而且也挺聪明,从回复风格之类的能明显看出来是根据 claude 训练出来的
目前我给公司写代码基本都是 ds 了,glm 和 kimi 感觉太慢了还容易过度设计
HTML001
9 月 4 日
GLM5.3 ,DeepSeek V4 Flash0731 ,公司内部国产模型免费用,用来用去还是觉得这两个好用。
94
9 月 4 日
能力的部分我的感觉和你差不多。但是产出速度的话,我的体感是反过来的。
特别是在 Codex 中很明显我需要“等待”的(如果不是并行开发的话)。但是其他的国产 Agent 工具没有那么明显的“等待”感觉(大概 4 个工作区就能满足我不间断开发下去了,Codex 可能要 8 个以上)。

感觉模型产出速度的快慢和 Agent 客户端 Harness 约束强弱是强相关的。也就是越强的约束产出速度越慢,所以我才感觉 Codex 会慢慢的。
体验过最快的是 Cursor 刚出 Composer 2.5 的时候,我刚回车完还没几秒钟就结束了。当时还以为卡思考了,结果已经是干完了………
Spirei
9 月 4 日
DS-v4-flash 可比 Codex 快哦
VBk
9 月 4 日
@Meursau1T 我都是用 gpt 的 sol 中,已经基本可以达到我想要的效果了,xhigh 也不是推荐的用法, 这个增加思考深度,增加上下文。有点像超频,有点效果不显著。建议你管理下上下文改用中,速度很快,效果也不错。我这边同样的任务给 kimi ,小任务还好。大一点就显出来了。kimi 的思考链特别长,具体来说你可以扔给他们同时一两千行代码做修改分析。你就能对比出来了,而且 k3 额度消耗巨快!
Moishine
9 月 4 日
不只是慢的问题,质量存在明显差异的。当然对于一般的需求,都完成的不错。
VBk
9 月 4 日
@Yukiteru 小任务 ds 还能用,大一些,ds 就跑偏。我反正不爱用,但是合规化的话有时候就没办法了。
foryou2023
9 月 4 日
op 可能用的是 dsv4 pro ,ds 涨价之后,用的人少了,dsv4 flash 超级快。
VBk
9 月 4 日
@Spirei 咱们得同样质量比速度,同样速度比价格啊,老大,没这么比的。
Moishine
9 月 4 日
我曾经有个问题,让 DeepSeek 搞了两个小时都没弄好,Cursor 配合 GPT 5 三分钟找到根因完美解决。
VBk
9 月 4 日
@Moishine ai 的能力差两成就能决定这个 bug 能不能找出来了,就好像五十五分和六十分,差的不多,但是一个及格一个不及格。所以有时候我真懒得用垃一点的模型,太浪费时间。
Moishine
9 月 4 日
@VBk 对,这时候 DeepSeek 花费反而更多(因为工作了很长时间,浪费了更多 token )
heftyMan
9 月 4 日
更多情况是翻墙,外卡,claude 卡国区的原因,不然有几个原因用国产
qiuzhang
9 月 4 日
ds 和 glm 亲测,感觉能打,但还不是很能打。但已经进步巨大了。
defaw
9 月 4 日
sol 只是想的快,反而是慢的。
maolon
9 月 4 日
kimi 我反而是体感差的那个, 随便 review 个啥就要 6-7 分钟, 用 zai 的 5.3 平时大概有个 70-80 tps 不觉得慢,ds v4 flash 其实也不错速度挺快,只是最近 flash 级别模型发的太多了也用不上他
netox
9 月 4 日
总觉得模型是一个因素,推理架构和推理硬件是另一个因素

就很同样的硬件,国内云厂和国外云厂商就是差那么一些
afkool
9 月 4 日
因为确实蒸馏老美的。。。不会差到那去。。主要还是太贵、低价方案还得抢。老美的订阅算下来实在太便宜了。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1239395

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX