penzi
V2EX  ›  OpenAI

超过 500 行的代码改动, codex 根本无法独立完成。astra 也不行

  •  
  •   penzi · 16h 38m ago · 9640 views

    自回归模型不回归

    怪不得 OpenAI 要推迟上市

    Supplement 1  ·  16h 5m ago




    希望评论的人都可以一直不用 claude ,否则失去的感觉太难受了
    Supplement 2  ·  15h 35m ago
    请大家 block 我,夏虫不可语冰
    98 replies  •  2026-10-10 20:16:23 +08:00
    CodingIran
        1
    CodingIran  
       16h 28m ago   ❤️ 1
    什么玩意,公司几十万行代码的项目一直都是用 Codex 开发的,从来没遇到这种问题
    penzi
        2
    penzi  
    OP
       16h 26m ago   ❤️ 7
    @CodingIran 那你们的项目真挺简单的
    nullyouraise
        3
    nullyouraise  
       16h 25m ago
    我改 Chromium 都是 Astra 一把梭,从来没遇到过问题,难以想象你们的项目是有多复杂
    lozzow
        4
    lozzow  
       16h 23m ago
    @nullyouraise 甚至我用的 DeepSeek 4.1 flash 也能改得动
    Finest
        5
    Finest  
       16h 20m ago
    昨天才让 6.1-sol 一次改了 2000 多行代码,真不知道你的项目有多复杂
    MHPSY
        6
    MHPSY  
       16h 20m ago
    我自己弄了个指纹浏览器 用 claude 5.5 打 patch 改的很好
    changnet
        7
    changnet  
       16h 18m ago
    AI 基本只能在已有功能的例子上添加功能。如果没有框架限制,没有例子,尤其是需要扩展、修改原有框架实现时,现有的 AI 确实就是不行,跟代码行数没有太大关系

    或者说 AI 实现得很奇怪,各种 if-else 打补丁。有些明明在基类扩展一个虚函数就很优雅,它偏不。除非不关注代码质量和后续维护,否则很难不人工修改
    xing7673
        8
    xing7673  
       16h 18m ago
    降智了吧,现在黑 codex 都已经泥沙俱下了么?
    cat9life
        9
    cat9life  
       16h 15m ago
    画个鹈鹕看看,大概率是降智了。
    DOOMS
        10
    DOOMS  
       16h 15m ago
    不知道的以为是去年发的帖子。
    penzi
        11
    penzi  
    OP
       16h 15m ago


    随便找个三分钟前的例子,一次判断都做不好的模型,长任务的结果会是怎样?
    Y25tIGxpdmlk
        12
    Y25tIGxpdmlk  
       16h 14m ago   ❤️ 9
    求大神让我们见识一下超高质量的项目代码(不简单的项目),学习一下。
    maxwellz
        13
    maxwellz  
       16h 12m ago
    可能被降智到 luna 了
    penzi
        14
    penzi  
    OP
       16h 11m ago
    @maxwellz 随机数测试测过了,就是 astra 。
    CodingIran
        15
    CodingIran  
       16h 10m ago   ❤️ 2
    @penzi 不会接了个垃圾中转站,然后被降智后把责任怪到 codex 上了吧
    Dk2014
        16
    Dk2014  
       16h 7m ago via Android
    这个页面怎么跟 codex 不一样😅
    o/前段时间本来就在治中转,并发多了就降智
    你不会开了转发来用的吧
    zeroFans
        17
    zeroFans  
       16h 4m ago   ❤️ 1
    至少用上官方的 codex 再说话吧
    haoooooooo
        18
    haoooooooo  
       16h 3m ago
    哥们,你是认真的吗?确定不是用的什么山寨 Codex ?
    虽说 Astra 比不上 Opus5.5 ,但是也没不堪到这种地步。。。
    alamaya
        19
    alamaya  
       15h 59m ago
    codex 需要有一个比较好的编码规范给到他才行
    supersleepking
        20
    supersleepking  
       15h 59m ago
    华为用户啊不奇怪了,大家喷之前可以看下这人发帖记录很有意思
    icelas259
        21
    icelas259  
       15h 59m ago
    你这是掺水模型吧。先去订阅官方的 codex 看看。
    mwenhua2023
        22
    mwenhua2023  
       15h 58m ago
    5w 行都改得动
    location123
        23
    location123  
       15h 58m ago
    deepseek 改个 500 行也是绰绰有余的吧
    BanShe
        24
    BanShe  
       15h 57m ago
    xs😂
    StarsunYzL
        25
    StarsunYzL  
       15h 56m ago   ❤️ 33
    送人头 block ,但凡对当前的 AI 能力有一丁点认知+有一丁点思考能力的都会反思和反复验证自己哪里出问题了而不是下这种不过脑子的结论
    strobber16
        26
    strobber16  
       15h 51m ago
    微内核
    sima675
        27
    sima675  
       15h 51m ago
    一个用中转站的就不要评论了,自己被卖了也不知道
    xylxAdai
        28
    xylxAdai  
       15h 46m ago
    你用的什么垃圾中转站啊。500 行都改不动。你用半年前的 glm 都不至于五百行改不了。更别提 codex 了。
    pengtx
        29
    pengtx  
       15h 43m ago
    懒得喷
    hookbreak
        30
    hookbreak  
       15h 42m ago
    你用的中转站吗
    furlxy
        31
    furlxy  
       15h 40m ago
    你这个智能机器人是个什么?
    中转被偷换了模型,自己不知道么?
    osilinka
        32
    osilinka  
       15h 37m ago
    ms build, 肯定是微软的系统,如果没有足够的 training 材料,肯定是这样啊

    现在都把 AI 看的太聪明了
    Satoshl
        33
    Satoshl  
       15h 36m ago
    截图中转站绷不住了,自己还能发出来
    Haku
        34
    Haku  
       15h 36m ago
    @penzi #14 随机数测试只能在 GPT 内的模型进行,告诉你是否产生了 GPT 内的模型降级(例如 6.1 SOL 可能使用 luna 回复),如果你接的是中转站,给你注水成 DS 或者别的模型,随机数测试是分辨不出来的。
    ishengge
        35
    ishengge  
       15h 36m ago   ❤️ 1
    block, 影响我智商
    laodao
        36
    laodao  
       15h 35m ago
    你家 codex 叫智能机器人?
    fkdtz
        37
    fkdtz  
       15h 34m ago
    不像演的
    Promtheus
        38
    Promtheus  
       15h 33m ago
    50 岁了吧
    keshawnvan
        39
    keshawnvan  
       15h 32m ago
    我用 Astra 改过最大的改动是 68 万行,其中 2 万行是业务改动,剩下都是单元测试+集成测试。
    测试阶段和生产验证都是 0 BUG 。
    firemiles
        40
    firemiles  
       15h 29m ago
    看到用户名 penzi ,真怀疑 up 是不是故意炒话题的
    tim9527
        41
    tim9527  
       15h 26m ago
    不至于。
    nutting
        42
    nutting  
       15h 22m ago
    你这是机器人不是 codex ,更不是 ai
    BRZ001
        43
    BRZ001  
       15h 18m ago
    中转站 注水了兄弟,用原生 codex 吧
    stardew
        44
    stardew  
       15h 17m ago
    😅
    yougg
        45
    yougg  
       15h 12m ago
    不要回答! 不要回答! 不要回答!

    这就是来骗铜币的!!!
    aicong2021
        46
    aicong2021  
       15h 10m ago
    不太可能,500 行开源 8B 参数的模型应该都能改的动
    yoyoyoyolol
        47
    yoyoyoyolol  
       15h 9m ago
    你把这个问题的文本描述打出来,让大家问一下看看答案是不是和你一致,就知道是谁的问题了
    d119
        48
    d119  
       15h 5m ago
    改是能改,就是跑不起来
    seanxx
        49
    seanxx  
       15h 3m ago
    直接 block 完事,明显装糖骗回复
    413420
        50
    413420  
       15h 2m ago
    糖 b
    tcchen
        51
    tcchen  
    PRO
       14h 58m ago
    jerseyhero
        52
    jerseyhero  
       14h 52m ago
    感觉像在带节奏骗回复
    cropflre
        53
    cropflre  
       14h 50m ago
    怕不是中转站接的是豆包模型
    hidemyname
        54
    hidemyname  
       14h 50m ago
    @penzi #2 几十万行的代码挺简单???
    iyaozhen
        55
    iyaozhen  
       14h 37m ago
    你得在 codex 里面用吧,我们之前测试过不同 harness 框架差异很大

    不知道你那个什么智能机器人是怎么部署的
    Kafuka578
        56
    Kafuka578  
       14h 37m ago
    难绷
    ttkit
        57
    ttkit  
       14h 34m ago
    TofuBazinga
        58
    TofuBazinga  
       14h 16m ago
    看到这个智能机器人绷不住了。。。
    niubilewodev
        59
    niubilewodev  
       14h 15m ago
    哈哈,‘我写了 99 行脚本和 109 行测试。’
    你用到正品 GPT 了。
    Y25tIGxpdmlk
        60
    Y25tIGxpdmlk  
       14h 13m ago
    @Kafuka578 #56 你这头像倒是和难崩非常贴切。哈哈哈
    Y25tIGxpdmlk
        61
    Y25tIGxpdmlk  
       14h 11m ago
    我们只是嘲讽你说 500 行代码改不动的观点,为啥就剥夺我们用 cc 的权利呢?凭啥啊?我 tm 非要用,我想用 cc 就用 cc ,想用 gpt 就用 gpt ,你管我啊?
    jadeborner
        62
    jadeborner  
       14h 1m ago
    这个智能机器人是什么鬼,能不能直接用官方的?
    ziyanghua
        63
    ziyanghua  
       13h 46m ago
    你这算是那种 500 元以下没有好耳机的提问方式吗?

    可以先按官方推荐的开发最佳示例开始尝试呗。
    https://learn.chatgpt.com/docs/developers

    gpt 可能不如 claude ,但是你说的也太夸张了。
    guanhui07
        64
    guanhui07  
       12h 55m ago
    不太可能
    fyq
        65
    fyq  
       12h 53m ago
    区区 500 行,免费的 Claude 都能改啊……
    QS0x01
        66
    QS0x01  
       12h 34m ago
    唐完了
    tomyark123
        67
    tomyark123  
       12h 33m ago
    v2 真是遍地嘉豪
    achira
        68
    achira  
       12h 25m ago
    确实是有差距的,就像你和正常人类一样。block
    YiCheng88
        69
    YiCheng88  
       12h 12m ago
    deepseek 都行 你活在啥年代了
    bqn
        70
    bqn  
       11h 48m ago
    你这是什么 harness
    Hilalum
        71
    Hilalum  
       11h 39m ago
    gpt 和 claude 同时高强度使用十几个项目,虽然 gpt 差一点,但也差不了多少。你这不是被注水了就是 agent 的问题吧
    NullIsLife
        72
    NullIsLife  
    PRO
       11h 30m ago
    有过类似的感受,一个 bug 实际上修改 10 几行代码即可. gpt 给我改了 10 几个文件上千行代码,单独的实现了一个分支功能.

    opus fable 给我最大的感觉就是克制
    goumadantui
        73
    goumadantui  
       11h 24m ago
    500 行哈哈,我这随便十几个文件几千行上万行都是随便改,改完它自动执行用例自测,基本都是能完成功能的
    Wh1t3zZ
        74
    Wh1t3zZ  
       11h 22m ago
    鉴定为用中转站把脑子用坏了
    jackOff
        75
    jackOff  
       11h 17m ago
    你这是不是掺水了豆包啊
    hzzhzzdogee
        76
    hzzhzzdogee  
       11h 15m ago
    @iyaozhen 现在 deepseek 哪个 harness 最适合呢. 各个评测/榜单, 说法都不尽相同
    keethebest
        77
    keethebest  
       11h 10m ago
    笑死我了 智能机器人, 这个机器人靠谱保真吗
    lemoncoconut
        78
    lemoncoconut  
       10h 57m ago
    兄弟 币又不够用了?
    deplives
        79
    deplives  
       10h 55m ago
    你这个机器人保真吗?

    我一个 thread 改了点文件,刚提交上去,不知道超过 500 行没
    94
        80
    94  
       10h 54m ago
    多多少少是有点抽象的
    OrangeDark
        81
    OrangeDark  
       10h 53m ago
    能工智人来了
    cluulzz
        82
    cluulzz  
       10h 15m ago
    让 codex 给我定制一个 rustdesk ios 客户端的需求也不止 500 行啊
    cnevil
        83
    cnevil  
       10h 3m ago   ❤️ 1
    感觉已经塞后面了,等别人回复奖励自己
    izzzz
        84
    izzzz  
       10h 3m ago
    @penzi #11 你这个交互界面是啥?
    czlccczc
        85
    czlccczc  
       9h 55m ago
    @cnevil 哈哈哈哈,学无止境
    wwwwjack
        86
    wwwwjack  
       9h 52m ago
    看界面,有没有可能是你中转站的问题, 我反正用 gpt 经常单次改动超过 10-20 个文件, 代码都是几千行, 没出现过类似现象
    Y25tIGxpdmlk
        87
    Y25tIGxpdmlk  
       9h 47m ago
    @izzzz #84 像是某个中转站的 web 对话窗口,看上去跟某些小网站的右下角智能客服窗口似的。嘻嘻
    MaxJin
        88
    MaxJin  
       9h 33m ago
    你这个是维护的代码吧,除非是各种代码累积出来的屎山代码,要不然连 GPT 不应该遇到这种情况。我之前遇到过用 ai 搞不定的就是屎山代码,因为内容多还在维护还要出新功能,文件关联的又多的那种会出现 ai 开始瞎写代码的情况。
    Ketter
        89
    Ketter  
       9h 24m ago
    哥们连开一个官方正式的 codex 账号都不会啊?
    EvaElfie
        90
    EvaElfie  
       9h 11m ago
    难绷,你的中转站都是掺假的你知道不?
    常见的测试题测不出来的都给你路由了
    mosesyou
        91
    mosesyou  
       9h 11m ago
    咱能不用这些中转站了吗
    i36lib
        92
    i36lib  
       9h 11m ago
    九成用的中转,掺屎了卖给你,你还以为是 codex
    haidaomihuan
        93
    haidaomihuan  
       8h 52m ago
    大概率你们项目一坨屎山、要么就是需求不明确(使用姿势不对)
    lemolee
        94
    lemolee  
       8h 48m ago
    这模型现在就是一坨屎,每个任务都能搞出一个 BUG ,老子换 deepseek 了,效果都差不多,给 openai 送钱干毛
    jmliang
        95
    jmliang  
       8h 33m ago
    这是 qwen 0.6b 吧
    iyaozhen
        96
    iyaozhen  
       8h 19m ago   ❤️ 1
    @hzzhzzdogee deepseek 我用得少。但肯定是适配了 Claude Code ,以及 DeepSeek 自家的。

    哦哦 我们之前测试是 ChatGPT 系列,用不用 codex 差异较大
    desstiony
        97
    desstiony  
       6h 8m ago
    最开始用 codex200x,切到 opus5.5 用了一周左右,被 ban 了,现在换回 codex ,难受的一批,太慢,太多防御门槛,一堆无用测试
    chidiansha
        98
    chidiansha  
       5h 48m ago
    至少先订阅个官方的吧哥们
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1185 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 304ms · UTC 18:05 · PVG 02:05 · LAX 11:05 · JFK 14:05
    ♥ Do have faith in what you're doing.