之前在站里发帖问了大家有没有合适的测试工作流或者自动化工具,结果……

2 天前
 a394505181
好像没有一个大家都认可、称得上众望所归的方向。评论区给了不少思路,我自己试了几个,但还是有几个点有点纠结。

有佬说让 agent 自己加单元测试就行。但我有个疑惑,就是 agent 自己写的测试,会不会跟它写的代码一起错?相当于裁判下场自己判,全绿也不代表真对,而且有些方向它自己可能压根想不到。这怎么保证测试本身是对的?

或者把所有功能、历史踩过的坑都落盘成测试,听着最靠谱,但对日常随手搓的小工具来说,维护成本会不会有点高?

还有佬说该花的小钱避免不掉。所以我也去试了之前问过的那个测试 agent 工具,目前还在用免费额度,还算够用,而且确实省了不少时间和搭测试系统的脑细胞。就是不知道之后量大起来还够不够。

我非测试出身,想把这些也一并兼顾,感觉还是有点吃力。目前我倾向于干脆多挂一个 agent 专门帮我 monitor 和跑测试。

佬们怎么看?
1976 次点击
所在节点    程序员
11 条回复
a394505181
2 天前
以防有佬好奇,我就是在 github 上搜 testing agent 找到的 TestSprite cli 版,他们好像也有 web 和 mcp 版本的我还没用过,感觉可以有机会尝试一下。
saltbo
2 天前
我的解决方案是用 subagent 在隔离上下文中让它写测试,不允许主 context 里写代码的 agent 去写测试
tianhehechu
2 天前
AI 自己测就行,啥都不用
sead
2 天前
小工具我都是先出架构方案和实施步骤,里面包含整个业务流程图(这个我认为最关键),人工审核没有大问题,就可以干活了( AGENTS.md 和项目技能得先搞好)。

最后验收时,开 Sol High 进行一次 code review 审查,当然我写的小工具业务较简单,暂时没有很复杂的测试
94
2 天前
一般写代码和写测试的 Agent 不是同一个。但即使分开写,AI 也会使用作弊的方式去达成目标。单元测试可以作弊,集成测试、端到端测试都可以作弊。
所以现在还会在 PR/MR 阶段加入 Agent 去 review 。但又会延生出来其他的问题,比如说过度审查,又得再加入一个 Agent 去对抗。

-----
小工具,就看是不是复杂项目,或者是不是准备长期维护。如果数据流很简单、不准备长期用或者只是自用的,有没有测试都无所谓。
foryou2023
2 天前
同 2 楼的方案。subagent 执行 review 。

个人的流程是出需求文档,让 ai review 一遍需求文档,然后实现之后,再让 ai 根据需求文档 review 一遍实现,需求明确的话基本上都是一遍就过。
Hubbard
2 天前
代码级的有 端到端视觉验证的没有
kuber
2 天前
@Hubbard 我是让 AI 写端到端测试用例,然后用 Playright 测试。测试用例可以要求它用 Gherkin 语法写,方便人工阅读,自己审核一下测试用例就行。
kuber
2 天前
让 AI 写,保证覆盖率就性。要求更高的可以写变异测试。不过变异测试代价比较高,不需要每次运行。
coefu
2 天前
你要是认为一个模型不行,就搞几个 sub-agent ,把 sub-agent 挂别的模型。

我现在用 deepseek harness ,就把 sub-agent 挂了小模型。小模型理解单元测试的能力还是足够的。
tylerrrrrr
2 天前
写代码的 agent 自己写单测确实容易一起错,全绿也不等于对。实现放一个目录/worktree ,测试或 review 另开一个 agent 、隔离上下文,人只审用例意图和关键路径。多挂一个专门跑测试的 agent 没问题,关键是别和实现抢同一份工作区。我是两个文件夹各跑一个 CLI ,本机工作台只用来看谁在跑、diff 对不对: https://github.com/yy36295238/caravel-releases

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1238846

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX