AI 写测试用例到底能不能用?我花了一周实测,结论很扎心

📅 2026/8/25 15:25:45
AI 写测试用例到底能不能用?我花了一周实测,结论很扎心
最近 AI 写代码火得一塌糊涂各种 程序员要失业了AI 一天写完一个项目 的说法满天飞。作为一个干了 10 年的测试工程师我没焦虑就好奇一件事AI 到底能不能帮我写测试用例说干就干。我花了整整一周挑了 3 款国内能用的主流 AI 工具在 3 个真实项目场景里做了对比测试。今天把真实数据和踩的坑全分享出来不吹不黑。先上结论效率确实有提升但翻车的地方也不少。想复制粘贴直接用不可能。一、测试方法干测试的都知道测啥都得先有章法不能瞎测。测试工具ChatGPTGPT-4o、豆包、通义千问测试场景用户登录功能简单电商下单流程中等复杂订单接口测试专业向评估维度用例覆盖率、边界值考虑、可执行性、专业度二、场景一用户登录功能简单功能三个 AI 表现都还行正常流程输入账号密码→登录成功都能写出来。但一到异常场景差距立刻拉开表格评估项ChatGPT豆包通义千问密码错误提示✅✅✅账号不存在✅✅❌ 遗漏连续输错锁定✅❌ 遗漏❌ 遗漏验证码错误 / 过期✅✅❌ 遗漏空值校验✅✅✅SQL 注入等安全测试✅❌ 遗漏❌ 遗漏看到没就一个登录功能差距已经这么大了。但我想说的重点不是这个。就算是表现最好的 ChatGPT也漏了我们系统特有的 手机号未注册不能登录 这条业务规则。原因很简单AI 根本不知道你们系统的具体规则。它只能根据 通用经验 来写放之四海而皆准但放到具体项目里一半都不对。这是 AI 目前最大的问题也是最致命的问题。三、场景二电商下单流程这个场景开始有意思了。正常流程都能写选商品→加购物车→结算→付款→下单成功。但一到组合场景和边界值三个 AI 集体拉胯。说几个真实翻车的例子我当时看笑了。翻车 1自己加戏有个 AI 写了一条商品库存为 0 时用户仍可下单后台自动补货。兄弟我们系统没这功能啊你自己给我加了个自动补货翻车 2规则全靠猜让它写优惠券相关用例它写了 满 100 减 20 和满 200 减 50 可叠加使用。实际上我们系统优惠券是互斥的不能叠加。AI 不知道全靠猜猜错了还一本正经。翻车 3捡了芝麻丢了西瓜有个 AI 写了 用户输入 - 1 件商品系统应提示数量不合法。这条没错但它同时漏了 数量超过库存上限 秒杀商品限购 1 件 这些更关键的边界。你说它没考虑吧它考虑了。你说它考虑了吧关键的全漏了。中等复杂度的功能AI 写的初稿覆盖率大概只有 50%-60%剩下的全靠人补。四、场景三接口测试这个场景差距最大也最能看出 AI 的真实水平。表现好的地方基本的参数校验空值、类型错误、长度超限能写权限测试能想到正常返回值断言也有表现差的地方说出来你们可能不信并发测试、幂等性测试三个 AI全漏了有个 AI 写了 接口返回 200 就是测试通过—— 这是新手都不会犯的错误接口依赖、数据准备、环境清理等前置后置条件完全没提签名校验、token 过期、重放攻击等安全相关只有 ChatGPT 提了一嘴说句实在话接口测试这种需要深度专业理解的场景AI 目前只能帮你写个骨架肉得自己填。想直接用出了 bug 你背锅。五、效率数据到底提升了多少光说感受不行上数据。每个场景我都记录了实际耗时表格场景纯人工耗时AI 初稿 人工修改效率提升用户登录约 2 小时约 30 分钟75%电商下单约 4 小时约 1.5 小时62%接口测试约 6 小时约 3 小时50%平均下来效率提升大概 60%。说实话比我预期的低。我本来以为能省 80% 的时间结果人工审核和补充的时间比想象中多得多。还有一个更扎心的数据AI 写的用例能直接使用的比例只有 30% 左右。剩下 70%要么要改要么要补要么直接删掉重写。六、三个绕不开的坑测了一周我总结了三个坑每个都绕不开。第一个坑不懂业务上下文全靠猜。前面说了AI 不知道你们系统的密码策略是 8 位还是 16 位不知道优惠券能不能叠加不知道订单超时是 15 分钟还是 30 分钟。它只能猜。猜对了是运气猜错了是常态。第二个坑组合边界值基本全漏。单个边界值比如密码最长多少位AI 能想到。但组合边界 —— 满减优惠券 积分抵扣 会员折扣同时使用这种基本全漏。而实际项目中出 bug 最多的恰恰就是这些组合场景。第三个坑一本正经地胡说八道。这个最坑。AI 有时候会写一些看起来很专业、但实际完全错误的测试点比如前面说的 接口返回 200 就是通过。新手可能看不出来直接拿去用结果漏测一堆东西。所以用 AI 写用例你自己得先有判断能力。不然还不如不用。七、结论能用但只能当助手测了一周我的结论很明确不模棱两可适合用 AI 的场景简单功能的用例初稿重复性高、规则统一的用例比如各种表单校验帮你想思路、列提纲避免遗漏大方向新人学习参考不适合用 AI 的场景核心业务模块出 bug 损失大的业务规则复杂、组合条件多的功能接口自动化、性能测试等专业度高的需要深度理解需求文档的场景正确姿势就一句话AI 写初稿人来审核补充重点检查业务规则和边界值。这样效率能提 60%质量也不会掉。想完全交给 AI至少现在还不行。写在最后作为一个干了 10 年的测试人我不担心 AI 抢饭碗。测试这行核心能力从来不是 写用例 这个动作而是理解业务、发现风险、判断质量。这些东西AI 目前还差得远。但 AI 确实是个好工具用好了能帮你省不少时间。关键是你得知道它哪里行、哪里不行别被它带沟里去。工具永远是工具人才能定方向。大家平时有用 AI 写测试用例吗体验如何欢迎在评论区交流我每条都会看。关于作者我是老测干了 10 年软件测试现在把测软件那套本事用来测市面上所有 AI 工具。关注「老测日记」每周更新 AI 工具真实测评不吹不黑数据说话帮你避开 AI 智商税。扫码关注一起把 AI 用明白