TapNow 正在招聘一名 Agent 工程师(QA 方向)

16 天前
 islaohu

我们不想再招一个亲自做测试的人,而是想招一个让 Agent 学会做测试的人

TapNow 招聘:Agent 工程师( QA 方向) / Agentic Quality Engineer |深圳

从去年 12 月开始,我们一直在探索一件事:AI 时代,一家软件科技公司应该如何生产和协作。

今天的 Agent 已经很强,但大多数 Agent 仍然只是个人助手:等待人的指令,运行在某位同事的电脑上,只拥有这个人当下提供的 context 。个人效率提高了,组织仍然依靠会议和文档传递信息,Agent 的生产力也依然受限于人的设备、注意力和作息。

我们认为这不应该是终局。

TapNow 是一个完全 AI Native 的团队。我们把 Agent 视为新的生产主体:人负责目标、判断与创造,Agent 在充分的 context 、工具和反馈中协作、工作并进化。

关于 TapNow

TapNow 正在构建 Creative OS:让用户带着想法而来,带着完整作品离开。

Agent 是其中的灵魂和主轴。它将创作者的意图逐步转化为策略、任务、图像、视频和粗剪成片;画布、节点、3D 节点与 Playlist ,则为人和 Agent 提供共同创作的 Workspace 。

复杂、长链路、多模态、非确定性的真实生产过程,让 TapNow 成为建设下一代 QA Agent 的理想场景。

现在,我们希望有人专门把其中的 QA 环节做好。

为什么是 QA

当 Agent 可以快速完成开发,质量就会成为整个生产系统能否闭环的关键。

我们的核心原则是 TDD:测试用例先行。Agent 不是写完代码以后再等待一个人验收,而是从任务开始就面对明确、可执行的质量标准,在开发、测试和修正之间自主迭代。

自动化脚本只能解决“如何执行”,不能单独解决:应该测什么、怎样才算正确、如何覆盖边界、如何判断生成式 AI 的非确定性结果,以及怎样从一次失败中持续学习。

所以,我们想找的不是传统测试工程师,而是一个测试 Agent 的优化者

你的工作,是把 QA Agent 这个角色调教得越来越好。

它既可以是 multi-agent 团队中独立的 QA Agent ,也可以是开发 Agent 自身的端到端测试能力。由于 Agent 同样是 TapNow Creative OS 的产品灵魂,你也会参与产品 Agent 本身的质量评测。

这份工作可能不适合你,如果

测试用例是最重要的资产

一个 QA Agent 表现不好,很多时候并不是模型不够强,而是它没有得到足够好的测试用例。

但你的工作不是自己长期编写这些用例,而是设计生成测试用例的 harness:让 Agent 获得正确的产品 context ,理解业务,并把产品能力抽象为状态、约束和路径,系统性覆盖正常流程、边界、异常、权限、数据组合与跨端影响。

Agent 应当自主生成、扩展、质疑、去重和维护用例;能够确定性穷举的部分尽可能穷举,无法穷举的开放问题则识别并引入风险模型、生成式探索或人工判断。你通过 eval 持续检验这项能力,而不是代替 Agent 完成它。

最终,Agent 生成的测试用例会成为长期资产:既是 QA Agent 的执行 context ,也是开发 Agent 开始工作前的约束与验收标准。

你会做什么

你可能仍然会写 Playwright 、Pytest 或其他工具,但脚本只是 Agent 的能力组件,不是这个岗位的最终作品。你的作品,是一个能够理解测试用例、可靠执行、正确判断、提供证据并持续进化的 QA Agent 。

我们希望你是什么样的人

我们不要求你以前从事测试。Agent 工程师、全栈工程师、开发者工具工程师、SDET 或其他背景都可以。相比传统测试经验,我们更看重你使用、开发和评测 Agent 的深度。做过 Agent harness 、multi-agent 、eval 、benchmark ,或者有相关开源项目和个人产品,会非常加分。

怎么申请

工作地点在深圳。请把简历、GitHub 、个人项目或其他能证明你适合这件事的作品发到 builders@tapnow.ai,邮件标题写:Agentic Quality Engineer + 姓名

也请简单告诉我们:

  1. 你做过的最接近“让 Agent 独立完成一项真实工作”的项目;

  2. 你亲手定位过的最难的一次线上或质量问题;

  3. 如果给你 TapNow 的代码仓库和现有 Agent Workspace ,你第一周会先优化什么?

3185 次点击
所在节点    酷工作
7 条回复
mashihua
15 天前
感觉难度不小:

1. 上下文不是天然存在的
2. Test oracle 比测试执行更难

多模态质量评估本身就需要数据集,没有数据集的积累没法做质量评估
bangbo
15 天前
Agent 不受限于个人的设备的话,贵团队是有建立相关的基础设施,将 Agent 运行在服务端吗?
islaohu
11 天前
@bangbo 是的,必须要云端
islaohu
11 天前
@mashihua 对的,但这件事真的对
mashihua
6 天前
@islaohu 嗯,这是做质量控制机制。可惜 base 深圳
jojow
3 天前
有用过 Claude code ralph-loop 运行 harness+playwright mcp. 通过本地代码,生成 web 自动化用例, 拆了 一堆 文档
prompt.md
spec.md
agent.md
subagent.md
workflow.md
process.JSON
experience.md
plan.md
golden-case.md

基本是 白天上班,晚上公司电脑跑,丫监控软件动不动就看桌面。

生成了 p1,p2 case 不到 100 个。测试一次就几十万 token ,最后一次跑了将近 100w.

真糟心,经验 用例规划按照用户故事来,后面再从主线一点点扩。
jojow
3 天前
目前自己再学做 harness agent ,midscenejs 做执行层 。本地模型 Qwen3.8-27B-4bit 。Claude code 评估 Qwen3.8-27B 可以。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1232468

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX