maybe0410

AGI 前夜 期待 GPT6 的表现

  •  
  •   maybe0410 · 12h 2m ago · 1508 views

    如图 微信图片_20260904091922_100_247.jpg

    6 replies    2026-09-04 12:58:01 +08:00
    mk3s
        1
    mk3s  
       11h 30m ago
    agi 有那么容易就实现?就前夕了? 2030 能 agi 能出来不?
    tianhehechu
        2
    tianhehechu  
       11h 15m ago
    确实前夕,缺少一样东西,我不说。
    maolon
        3
    maolon  
       9h 54m ago
    99.9 是 oai 用专门针对 arc agi 的 harness 做到的,arc agi 自己得分是 62%(虽然也很高)
    sillydaddy
        4
    sillydaddy  
       9h 12m ago
    @maolon 这么说不太公允:
    62%是每次 API 调用,只允许大模型记笔记,下一轮喂给它的只有题目和之前记的笔记。
    99%是允许多轮之间保留模型内部的推理 token 。我们平时用的 Agent 都是这种模式。还有包括上下文会自动压缩,也是允许的。
    换句话说,99%完全就是我们平时使用 Agent 的模式。
    而 62%是失忆症的模式,有点像电影《记住》( Remember ,2015 ),每次睡醒都会忘记之前的事,只有纸条上的谜题和记下的线索。
    maolon
        5
    maolon  
       8h 34m ago
    @sillydaddy #4 我是这么看,你可以觉得 arc agi 的 bench 方式不合理,但是分数对比应该是 apples to apples 的,因为其他分数没有用这个 harness 尤其是 opus 。
    另外之前也有其他 harness 取得 99 的成绩,这个 bench 本来 harness 的影响就非常大
    sillydaddy
        6
    sillydaddy  
       8h 29m ago
    @maolon GPT Sol 好像之前的分数 8%左右也是用的 ARC-AGI 的官方 harness ,而这次的 Astra 是 62%。Opus 的分数 30%好像也是吧。
    不过不管了,看到 X 上有玩过 ARC-AGI-3 的人说“真的感受到 AGI 来临了”,我准备再去玩一下 ARC-AGI-3 的题目了,上次就玩了第 1 个,好像是越到后面,题目越难: /t/1189306
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2855 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 31ms · UTC 13:27 · PVG 21:27 · LAX 06:27 · JFK 09:27
    ♥ Do have faith in what you're doing.