我的使用姿势不对么, 我感觉 ds 很差劲啊, 比 grok3 差远了, 编程相关问题试了几次都表现很差

2025 年 3 月 26 日
 jdz

比如 example.nacos.com 这是我的 nacos 地址, 帮我写个 bash 脚本, 查询 cpp_long_link 命名空间下的所有服务信息, grok 可以一次写对, deepseek 就会忘记 pageSize 这个参数

22620 次点击
所在节点    程序员
164 条回复
duzhuo
2025 年 3 月 27 日
@Moierby 这么多层为数不多的正常回答,这 b 论坛有时候一扯到中国就开始输出情绪了
ysn2233
2025 年 3 月 27 日
除了编程比 claude 差其他没感觉出来,都是各有优势
byc4i
2025 年 3 月 27 日
全是工人视角在阴阳怪气。
DS 核心是是 2 块 4090 (十万左右)跑生产级别的大模型。这意味着什么?
magicfield
2025 年 3 月 27 日
楼上说 deepseek 慢的为啥不用各家平台的 api 。
magicfield
2025 年 3 月 27 日
代码用 claude ,其他用 ds ,挺好使的。
ds 现在我用着感觉最大问题感觉是功能性的功能差点意思,比如使用 function call 的幻觉太多了,很难稳定下来
GuLuDaDuiZhang
2025 年 3 月 27 日
日常 ds-r1 ,代码 3.7t ,备胎 gemini 。gpt 什么都能做但缺少专精的地方,感觉现在已经没有护城河了,tokens 还贵,最容易被 r1 取代。grok 只记得输出快但尴尬的是当时第一次用输出的代码不符合预期,后面就没再用了。

个人感受 r1 代码能力不差,可惜输出总是差那么口气,例如我想要个项目大致框架 r1 容易东西全部写一个文件里,而 3.7t 基本能正常拆分出代码文件进行输出,所以我代码主力还是 3.7t 。很期待后续 ds-r2 编码实力,应该能打平 3.7t ,期待能薄纱。不过真要薄纱了,充钱的我就成小丑了(,claude 你加把劲啊,哭

其它日常问问题感觉主流模型都半斤八两,个人更喜欢 r1 的推理和输出格式,但偶尔输出的有点奇怪,可能是被联网查的东西给带歪了。

另外我试了下 op 对这个脚本的描述,ds 的输出也带了 pageSize 参数呀,可能脸黑中奖了,新开个对话试试吧。
cat9life
2025 年 3 月 27 日
@lovedebug #76 你这个用法就是之前比较火的。把 ds 的思维链发给其他大模型去推理
BestPix
2025 年 3 月 27 日
写前端豆包都够我用了,我都用不到 ds ,你们居然还拿海外付费版的对比,看来大家的需求确实不一样
msg7086
2025 年 3 月 27 日
DS 的意义不是暴打 Claude 或者 Grok 或者 Gemini ,而是能在有限的成本和卡脖子的前提下依然做到不错的成绩。你要指望 DS 全方位暴打收费模型,那人家真的都倒闭算了。

顺带一提,我感觉 DS 训练用的语料和其他几家的差别很大,这几天测试翻译能力的时候可以看到 DS 有大量本土化用语,像是什么「一点就通」啊「套路」啊这些国外模型吐不出的词。所以如果有条件同时使用多个模型的话,可以把 DS 当作很好的补充。
herewego
2025 年 3 月 27 日
r1 的推理真的挺好用的,我给输入参数和输出结果让他帮我写程序实现,他自己搁这里思考了 5 分钟,不断推导,验证,最后给我的东西准确率还挺高的。就是如果开了联网,容易被带偏。
写代码还是要 r1 。
viking602
2025 年 3 月 27 日
直接开了 supergrok 现在 grok3 是主力 之前也开过 gptplus 太麻烦而且节点还有要求
TubroRock
2025 年 3 月 27 日
一般人都不会拿个例否定全部,要得出结论好歹正常测试下:
https://github.com/KCORES/kcores-LLM-Arena

https://github.com/cpldcpu/llmbenchmark/blob/master/raytracer/Readme.md
zhangeric
2025 年 3 月 27 日
挺无聊,捧一家踩一家,我觉得 10 有 89 是广告帖.
zmal
2025 年 3 月 27 日
R1 写代码不如 V3 。再者就是温度要低。
karatsuba
2025 年 3 月 27 日
我现在重度依赖 grok ,deepseek 用来搜搜中文问答还行
yuanran
2025 年 3 月 27 日
@wryyyyyyyyyyyy #86 阿里的啊,chat.qwen.ai 选 32b
zhmouV2
2025 年 3 月 27 日
ds 的幻觉还是严重的要命,比如让它给出代码优化建议,后面还能给出来一个这种性能对比:

指标 优化前 优化后 提升幅度
初始渲染时间 (ms) 450 220 51%
内存占用 (MB) 85 62 27%
分组切换时间 (ms) 120 40 67%
选中行响应时间 (ms) 80 20 75%

离谱好么
letwewell
2025 年 3 月 27 日
cursor 天下第一,其他都是垃圾
huoru
2025 年 3 月 27 日
R1 实用性比较差,但凡用来改代码,讨论系统架构,优化产品业务,思考前景,都给你聊虚的,一点都不中用。
qwert999
2025 年 3 月 27 日
很多时候是提问质量和主观感受带来的差别,直接看技术测评 https://artificialanalysis.ai/

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1121273

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX