1. AI 生成测试用例的现状与局限,LLM 生成单元测试/集成测试的可用性和质量保证?如何评估生成测试的有效性?
AI 生成测试用例的现状与局限是什么,LLM 生成单元测试/集成测试的可用性和质量保证如何,如何评估生成测试的有效性?
- LLM 生成测试的可用性(能生成、能跑通、但覆盖率与真实性有限)
- 生成测试的局限:断言过弱、覆盖幻觉、与实现耦合、难以发现真 bug
- 有效性评估:变异杀死率、缺陷发现率、人工审查
LLM 生成测试用例的能力已相当可用,能快速生成单元测试、集成测试的骨架与常见场景,但存在明显局限:生成的断言往往"照着实现写"而偏弱(只验证实现本身而非行为契约)、容易产生"覆盖幻觉"(声称覆盖了分支实际没有)、对真实 bug 的发现能力有限、可能生成与实现强耦合的脆弱测试。生成测试的可用性取决于任务清晰度与代码可读性,对复杂业务逻辑生成质量大幅下降。评估生成测试的有效性不能只看"能跑通",核心指标是:变异杀死率(Mutation Score,注入变异体后测试能否杀死,衡量测试真正检测行为的能力)、缺陷发现率(在植入缺陷的代码上能否发现)、以及覆盖率(行/分支/条件覆盖)与人工审查结合。生成测试应作为辅助快速铺覆盖,再通过变异测试与人工完善关键断言,而非直接信任。
得分点是"能用但不可全信",并给出变异杀死率等有效性的客观度量。能指出"断言照着实现写"的局限,说明理解 LLM 生成测试的深层缺陷。