5X 的 Codex 一天半烧完了,晒晒我的智障多 agent 工作流

2 天前
 HakuZero

充了 100 刀 codex 想做点正经东西,结果一天半就没了,项目还卡在半路,越想越亏,来吐槽一下。

我干了个挺蠢的事:一个项目塞了好几个 agent ,产品、测试、运营、后端、桌面端。本来想的是流程正规一点,学大厂那套需求评审测试验收,能少返工。

结果实际流程变成了这样——需求来了先丢给运营 agent 去"调研",调研完产品 agent 出方案,方案出来测试 agent 要先写测试用例,都齐了后端和桌面端才开始写代码。写完你以为完事了?天真,还要挨个过审:测试审一遍,产品审一遍,UI 审一遍,UX 单独再审一遍。我当时不知道哪根筋搭错,UI 和 UX 还拆成了俩 agent 。

它们审起来一个比一个能说。产品动不动就"不符合用户心智",UX 说交互路径太长要重做,测试说边界情况没覆盖要补用例,UI 说视觉规范不统一。最离谱的是,它们提的问题最后基本都得我自己动手改,返工不但没少,我还多了个活儿:给几个 agent 的意见当裁判。

钱主要烧在上下文上。每个 agent 都得喂历史记录,喂一次几百条 message ,光"对齐需求"就对齐了好几轮,我自己都不知道在干嘛了。

现在纠结要不要再充 100 刀。充吧,怕两天又烧没了;不充吧,东西不上不下的很难受。

就想问问,到底是我这流程本身有病——AI 干活根本不需要模拟人类团队那套官僚流程,还是我用法不对,应该让它们并行干而不是串行开会,还是单纯额度买少了,其实再充 100 刀就能成了?

5027 次点击
所在节点    程序员
55 条回复
zed1018
2 天前
再充 100 刀不如直接升级到 20X
HakuZero
2 天前
@zed1018 感觉我这套工作流 20X 都顶不住,太麻烦,太慢了
sampeng
2 天前
我也在解决这个问题,有几个点可以优化。你可以看看 cf 和 google 怎么解决的:
https://blog.cloudflare.com/ai-code-review/
https://cloud.google.com/blog/topics/threat-intelligence/staying-ahead-of-adversarial-ai-through-agentic-source-code-review

你这一套我用了半年,干个活要 1 小时才能干好一个需求,太慢了,于是我在优化这个过程。这个痛点是显而易见的,因为每个模型都喜欢扣细节,然后就对不上。越多就越扯皮。我认可 cf 和 google 的处理方式,我也在测试,不要每个角色都给最牛逼的模型,按情况用低一档的就行,比如你说的那个 ui ,说实话,这是很机械的活,用用 opus/sol 是大炮打蚊子,不要给每个角色喂重复上下文,我的处理方式是我用 pi 来做,所以每个 agent 是一个独立的 session ,这一件事不完 session 是不结束的。这样就后面的重复其实缓存命中率非常高。

效果怎么样不好说,我要解决的是干活太慢,不是干活质量的问题。目标是 review 一次 5 分钟内解决战斗。
zzl93
2 天前
原来如此,那感觉是不是 AI 开发不能这么拆,是不是应该有一个大脑,其它智能体都是下级,子智能体是否调用看大脑,大脑需要有一定的 token 焦虑
homcrazy1
2 天前
直接实现功能,顶多写写单元测试
Fooooo0
2 天前
op 用的这个是什么工具啊?
HakuZero
2 天前
@sampeng 学到了,我也研究下,主要是不想返工,返工的时候 AI 又会整一堆的兼容写法,太麻烦了,就想着让它一次性处理好。
sampeng
2 天前
@HakuZero 倒不是返工,实话实说,我跑你这一套最的的困扰不是写出来的东西不能用,是能用,但实际代码里到处所谓兜底,你要全用 codex 的 sol ,就是他会考虑完全不存在的情况,各种莫名其妙的兜底,提示词都拉不回来那种。悄悄咪咪的加。一些简单的还好,每轮+1 个点,一跑就是 6-10 轮起步。就是 10 几坨屎进去了。我也很苦恼
HakuZero
2 天前
@Fooooo0 agency-agents 有很多 agent ,挑几个安装就行,然后再调整下每个 agent 用什么模型,像 UX 、UI 这类的就用 gpt-5.6-terra 之类的模型。
HakuZero
2 天前
@zzl93 是的,token 消耗太快了,消耗在反复的 出方案、评审、打回、继续出方案评审,也有可能是我模型指定的都太高了的原因
HakuZero
2 天前
@sampeng 是的,现在很多时候我都需要盯着思考过程,让它不要想那么多
HakuZero
2 天前
@homcrazy1 单一功能是这么干的,新的项目,涉及的端比较多,避免返工所以尝试一下这种模式是否可行
winnerczwx
2 天前
这个流程真可以吗, 看似每个环节都有, 但实则每个环节都缺少灵魂

产品不懂需求, 测试没有边界, 后端不懂架构
molicloud
2 天前
可以试试多智能体协作,而不是人参与每个环节,特别是你使用了这么多 agent:
https://docs.codeg.app/zh/guide/multi-agent
ktyang
2 天前
这么多 agent 还开极高还开快速模式,也不知道到底是缺 token 还是不缺 token
gitxuzan
2 天前
不要装太多工具 mcp ,skill 和插件,针对项目针对性的,我平时全部关掉,按需开启
nanwangnongfu
2 天前
我也有这种疑问,从零开始构建系统,想各种节点都有产出,需求分析的,原型,测试用列,proto 文件,代码,尝试了很多,最终都不太满意。AI 的产出总感觉缺少什么,review AI 的产出一言难尽
Dylan89
2 天前
我现在都是手动创建 Agent ,遇到的问题是 figma 的圆形,AI 根本实现的稀碎,有没有好的 Skill 。。。
hackyuan
2 天前
258K 上下文的这么玩根本玩不了,AI 评审就是智障互相骗,最关键的产品品味、技术架构需要人工判断。GPT-5.6 Sol Max 也不行。
xycoder01
2 天前
多 agent 没有问题,问题是不要所有 agent 都使用最高级别,比如 xhigh 。其他的子 agent 要适当调整。否则,20x 的也不一定顶得住。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1238942

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX