Gemini 3 Pro 这么牛吗

2025 年 11 月 19 日
 iflint

看起来各项数据都遥遥领先啊

11579 次点击
所在节点    Google
42 条回复
locoz
2025 年 11 月 19 日
其他方面没测试暂时不清楚,但是视频理解能力是确实遥遥领先,gemini 2.5 pro 无法精确理解并输出的细节画面的时间点,gemini 3 pro 完全没问题,同一批视频输出的结果准确度高了很多。
OumaeKumiko
2025 年 11 月 19 日
试了一下日常聊天,它竟然跟 gpt 一样在对话结尾要猜测我接下来要干什么,然后“我是否能为你做 XXXX”了……很不喜欢这点,因为这个猜测往往都是错的
hez2010
2025 年 11 月 19 日
今天试了试 Gemini 3.0 Pro 诊断我手上的 UDP 网络通信库为什么会在流量大的时候接收端突然收到本不应该收到的 FIN 信号终止连接,结果它分析了半天又是内存安全问题又是数据结构对齐问题又是大小端问题,还反反复复对着同一个地方复读老半天,等了好几分钟最后改了一大堆代码,结果啥用都没有。
然后换了 GPT-5.1-Codex ,同样是分析了好几分钟,也尝试了各种方向,但是很快就得到结论不是代码实现的 bug ,开始朝着数据完整性的方向思考,最后给我加入了 checksum 拦截掉经过网络传输后变得不正确的数据,问题解决。
问题确实不出在终端软件而是在链路上。这么看还得是 GPT-5.1-Codex 更胜一筹。
不过想发挥 GPT-5.1 的全部实力,你得要能触发 high thinking 才行,于是得在 prompt 上下下功夫让模型的 router 认为你这个问题需要大量思考。
jqtmviyu
2025 年 11 月 19 日
光看跑分没啥用. 能改陈年屎山代码才是真牛.
wniming
2025 年 11 月 19 日
@wniming #13

补充一下,感觉 chatgpt 经常胡说八道,就我问的这个问题本来不复杂,是因为我把 status-keys 设置成 vi 后又被 tmux-sensible 的设置给覆盖了,我当时不知道 tmux-sensible 会覆盖这个,才问了 chatgpt:

"Why does it feel the same as Emacs?"

结果 chatgpt 给我说:




翻译成中文就是:
---------------------------------------------------
✔️ 为什么设计成这样?

tmux 命令提示符并非完整的交互式编辑器。
它不支持像 Vim 那样的普通/插入模式。

因此,即使在 vi 模式下,tmux 也保留了 Emacs 风格的行编辑键,因为它们是标准的 POSIX Readline 键。

换句话说:

➤ status-keys vi= Emacs 快捷键 + hjkl 方向键
➤ status-keys emacs= Emacs 键 + hjkl 没有任何特殊作用

这就是为什么它们感觉几乎一模一样的原因。
---------------------------------------------------

我觉得 chatgpt 在遇到它不明白的问题的时候就跟川宝一样,满嘴谎话,虽然 gemini 也会误导我,但没有 chatgpt 这么离谱,chatgpt 这种满嘴跑火车的情况已经遇到好几次了。
idblife
2025 年 11 月 19 日
没觉得多牛,你们问问他“绿化带战神是什么梗”
AX5N
2025 年 11 月 19 日
@idblife gemini 的知识基本都是 2024 年的,你问新的知识他肯定不知道
newtype0092
2025 年 11 月 19 日
之前 2.5 ,拿沼王的电车海报图片问是什么宝可梦,咬死了说是呆呆兽,我纠正也不听。现在 3 能正常识别了,还能识别出电车的场景,给我搜索相关联动的建议,不是倒是数据更新还是真变聪明了。
Aaron325
2025 年 11 月 19 日
google 毕竟数据多,就看愿意喂多少料。之前对 gemini 感觉就是对搜索信息的整理还是过于保守了
nuII
2025 年 11 月 19 日
正好最近遇到了 Windows 上笔记本内屏 HDR 默认开启,达芬奇里编辑 log 视频转换为 hdr 效果时开启 hdr 画面预览的问题。比起 macos 上非常丝滑统一的操作系统级 hdr 管理,windows 11 虽然改进了不少但还是一团糟,第三方软件里调用起来也问题不少,网上又搜不到太多的有用信息,就问了 Grok (免费版,自动模式),昨天 Gemini 3 出了就把同样的问题丢进去看了下效果,从结果来说还是 Gemini 3 会强一点。

问题挖掘:
> Gemini 首轮判断了几个可能的原因,其中包括最重要的 Windows 对 HDR PQ 的支持和 HLG 的支持不完整。Grok 首轮没包括最关键的原因。但是有个小问题,我说了我用的版本是 20 ,Gemini 3 上来就说没有这个版本,看来是没联网搜索?

- Gemini 3 ✔
- Grok ❌

生成速度:
> Gemini 3 生成问题基本都用了 40+秒,而 Grok 都是 5 秒内就能生成。

- Gemini 3 ❌
- Grok ✔
maolon
2025 年 11 月 19 日
@wniming #25
gemini 3 pro 对标的是 gpt 5 thinking/high 模式,你直接用免费版的 gpt5 那肯定是满嘴跑火车了,我试了下,另外搜索我觉得还是 gpt 靠谱一些,gemini 才是一不留神满嘴跑火车的那个,下面是我把你问题贴给 5 thinking 里节选 vi 部分的回答:

• set -g status-keys vi
Uses vi-style editing in those prompts, with insert/command modes:
• In insert mode you type normally
• Esc → go to command/normal mode
• In command mode:
• h / l – left/right
• 0 / ^ – beginning of line
• $ – end of line
• w / b – next/previous word
• x – delete char under cursor
• dw / dd – delete word / delete line, etc.
silypie
2025 年 11 月 19 日
@iden 开源模型怎么监督呀,一般不是直接开源训练好的权重吗
wniming
2025 年 11 月 19 日
@maolon #31

我用#25 楼的提示词问的时候还在 gpt-5.1 的免费额度内,刚才我又用#13 楼的提示词问了一次,回答和你贴的差不多,这个问题让我感觉 gemini 更强是因为 gemini 的提示直接帮助我搞明白了这个问题,明确的指出了"您首先进入插入模式(正常输入)。要浏览或编辑已输入的内容,您必须按 ESC 键进入命令模式",chatgpt 没有提示到我默认是插入模式还是命令模式。
idblife
2025 年 11 月 19 日
@AX5N #27
同样的问题你去问问 gpt5.1
tool2dx
2025 年 11 月 19 日
跑分倒是很好看,就是测试下来修改 bug ,没 2.5 pro 强。可能是个别情况,前端倒是挺炫酷的。
goata
2025 年 11 月 20 日
都说很牛,让子弹飞一会
coolmenu
2025 年 11 月 20 日
Tried Gemini 3 for coding and I think it just gaslit my entire repo
Did a “quick assessment” of Gemini 3 for coding and I’m convinced this thing is either a genius or legally insane.

I asked it to refactor one file. It refactored my entire project. Then told me “btw your architecture was concerning” like a disappointed parent.

It writes code like it’s getting graded by God. It leaves comments like “fixed this, you’re welcome.” It reorganized my utils folder without asking — bold move honestly.

Performance verdict: Code: 10/10 Mental stability: 2/10 Vibes: immaculate

Would I use it again? Absolutely. Do I understand anything it produced? Not even slightly.:reddit 上的帖子, 多名用户反馈同一现象:
Gemini 3 在编码任务上非常强,但会过度自信、越权大改、强行 refactor 、删除“它认为没用的代码”,哪怕明确告诉它“不要动其他文件”。
Saigut
2025 年 11 月 20 日
简单试用了几个对话:
1. 十分自信,依据自己假设的东西进行逻辑推理,导致错的离谱
2. 问题没分析怎么样呢,就开始对代码瞎改一通
AX5N
2025 年 11 月 20 日
@idblife 就是知识库的问题,不用想了。这种黑话都能回答得出来的,要不然依靠搜索引擎了,要不然知识库够新。gemini3 的知识库其实比 2.5 还要旧一点。
devoteever
2025 年 11 月 20 日
@iflint 是啊, 出生早了

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1173713

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX