AI 辅助测试

共 19 题
#

1. AI 生成测试用例的现状与局限,LLM 生成单元测试/集成测试的可用性和质量保证?如何评估生成测试的有效性?

A LLM 生成的测试断言通常很强,能发现所有真实 bug
B 只要生成测试能跑通,就说明其有效
C 生成测试有效性需用变异杀死率、缺陷发现率与覆盖率评估,且断言可能"照着实现写"而偏弱 ✓ 正确答案
D 生成测试与实现耦合是优点,能让测试更稳定
#

2. 大模型驱动的测试 Agent(自动探索、自动生成并执行用例)的现状与落地边界?如何验证 Agent 的测试覆盖充分性?

A 测试 Agent 可完全替代人工测试,无需人工监督
B Agent 生成的用例必然可靠,无需门禁
C Agent 适合快速冒烟与广覆盖探索,但对复杂业务与长链路有限,需用覆盖率、需求覆盖与变异测试验证充分性 ✓ 正确答案
D 测试 Agent 无法自动执行用例,只能生成
#

3. LLM 生成测试用例的"覆盖率幻觉"问题,模型声称覆盖了分支但实际没有,如何验证?

A 模型对覆盖率的描述总是准确的,可直接采信
B 覆盖率幻觉只影响行覆盖,不影响分支覆盖
C 覆盖率幻觉指模型声称覆盖了某分支但实际未执行,必须用覆盖率工具实测而非采信描述 ✓ 正确答案
D 只要测试能运行,覆盖率就必然真实
#

4. AI 测试断言(Assertion)自动生成时,如何避免模型"照着实现写断言"导致测试失效?

A 根据当前实现生成的断言最可靠,因为它与代码一致
B 断言无需验证,因为 LLM 生成的断言必然正确
C 断言应尽量耦合内部实现细节,以增强测试
D 应让期望值独立于被测实现(基于规格、独立黄金值),并用变异测试验证断言有效性,避免"照着实现写断言" ✓ 正确答案
#

5. AI 辅助 Bug 检测,基于机器学习的缺陷预测和缺陷定位技术的成熟度如何?

A 缺陷预测偏重风险排序、缺陷定位偏重缩小嫌疑范围,成熟度有限,适合作为辅助而非黑盒决策 ✓ 正确答案
B 基于 ML 的缺陷预测与定位已能精确定位所有 bug,无需人工
C 静态分析比较成熟,而缺陷预测已完全成熟
D AI 定位只能用于单元测试,无法用于集成测试
#

6. Self-Healing(自愈)定位器的原理,AI 如何在页面元素变更后自动修复定位失败?其可靠性边界在哪?

A 自愈定位器能百分之百正确修复所有定位失败,可放心依赖
B 自愈定位器只针对新元素,不处理元素变更
C 自愈通过属性相似度、上下文或视觉重定位元素,但存在误定位风险,需设阈值与人工确认 ✓ 正确答案
D 自愈修复无需记录,因为它是自动的
#

7. AI 辅助测试评审,如何用 LLM 检测测试用例的覆盖盲区和冗余?

A LLM 评审结果可直接自动删除冗余用例,无需人工
B LLM 能通过需求点-用例映射发现覆盖盲区、通过语义相似度发现冗余,但输出需人工确认防误判 ✓ 正确答案
C 覆盖盲区只能靠人工发现,LLM 无法辅助
D 只要用例文本不同,就必然不是冗余
#

8. Playwright + LLM 的 UI 自动化中,如何用快照/语义 ID 降低选择器脆弱性?

A 应尽量使用具体 class 与 XPath 定位,因为它们最精确
B 应优先使用 role、name、testid 等语义化定位器,并可用可访问性快照辅助 LLM 生成稳健定位 ✓ 正确答案
C 前端样式变化不影响 CSS 选择器,因此无需处理脆弱性
D 选择器脆弱性只能靠人工频繁修改,无法缓解
#

9. AI 生成的回归测试集如何防止"测试套件膨胀"(用例数量爆炸但价值不增)?

A 应以覆盖增益与变异杀死率度量每个用例的价值,并结合去重、分层、门禁与定期清理控制膨胀 ✓ 正确答案
B 测试用例越多越好,覆盖越全
C AI 生成的用例应全部直接加入套件,无需筛选
D 套件膨胀只影响存储,不影响 CI 与维护
#

10. 如何评估一个 AI 测试工具(如自动生成单元测试)在团队中的 ROI?

A 只看节省的时间即可,无需考虑维护与审查成本
B 需同时量化收益(时间、覆盖率、缺陷发现)与成本(订阅、审查、维护、返工),并用 A/B 对照与采纳率衡量净收益 ✓ 正确答案
C AI 工具的用例无需人工审查,因此无维护成本
D ROI 只能用主观感受评估,无法量化
#

11. LLM 生成测试数据的真实性与多样性,如何评估生成数据是否贴近生产分布并覆盖边界,避免全是常见值?

A 生成数据只要字段齐全就足够真实,无需关心分布
B 需用分布对比评估真实性、用边界命中率评估多样性,并采用"主体抽样+边界单独生成"避免全是常见值 ✓ 正确答案
C 边界值不需要覆盖,因为生产数据都是常见值
D 测试数据越多越好,无需考虑贴近生产分布
#

12. AI 辅助测试文档生成,LLM 生成测试计划与报告的价值与风险(编造数据、遗漏风险),人工校验点如何设置?

A LLM 生成的测试报告数据必然真实,可直接采信
B 测试报告由 LLM 生成后无需人工签字
C 应约束 LLM 只基于真实输入生成不编造数据,并对指标溯源、关键结论、遗漏项设置人工校验点 ✓ 正确答案
D 遗漏风险可以通过让 LLM 生成更长的文档来避免
#

13. AI 测试工具(如 Copilot for Testing、AI-based test generation)的选型与评估方法?

A 只看工具演示效果即可决定,无需真实项目验证
B 选型无需考虑数据隐私与代码上传问题
C 所有 AI 测试工具能力相同,选便宜的即可
D 需综合技术兼容、生成质量、成本、安全与厂商风险,并在真实项目上做试点对比评估 ✓ 正确答案
#

14. AI 生成测试的可信度验证,如何评估 AI 生成测试的有效性(变异得分、缺陷发现率)?

A 只要测试能运行,就说明其有效
B 变异杀死率与缺陷发现率是衡量测试有效性的核心指标,覆盖率仅作辅助 ✓ 正确答案
C 覆盖率越高,测试必然越有效
D 变异测试会破坏被测代码,因此不能用于评估
#

15. 大模型在缺陷分类与 triage 中的准确率如何度量,误判成本如何控制?

A 需与真实处理结果对比度量准确率,并对高危误判单独加权、设置置信度阈值与人机协同控制成本 ✓ 正确答案
B 所有误判的成本相同,看整体准确率即可
C 模型 triage 结果可直接自动执行,无需复核
D 严重级别误判不影响任何成本
#

16. AI 辅助缺陷定位与根因分析?

A AI 通过堆栈/日志分析、SBFL、最近变更等缩小排查范围,但输出应作为需人工验证的候选假设 ✓ 正确答案
B AI 能直接给出准确根因,无需人工验证
C 根因分析只适用于分布式系统,不适用于单服务
D AI 根因分析无需证据,直接给结论即可
#

17. AI 测试的质量,人工复核与门禁?

A AI 生成的测试无需人工复核,可直接入库
B 应把 AI 生成的用例视为候选,按风险分层人工复核,并设置变异得分等可量化门禁后入库 ✓ 正确答案
C 门禁只会降低效率,不应设置
D 人工复核只适用于高风险测试,低风险测试可完全免审
#

18. AI 测试的提示设计与上下文?

A 只需给函数名即可,上下文越多越干扰
B 提示应包含尽量多的无关代码,让模型更全面
C 提示格式不重要,只要模型能生成即可
D 应明确角色、任务、约束与输出格式,并提供被测代码与相关依赖作为上下文,用 RAG 控制粒度 ✓ 正确答案
#

19. RAG 赋能的测试知识库,如何把缺陷模式、历史用例与环境手册构建为可检索知识库,辅助用例设计与问题定位?

A 知识库内容单一,只需存储缺陷描述即可
B 知识库不需要更新,因为历史知识永远有效
C 把缺陷模式、历史用例、环境手册切分向量化建索引,检索时附来源引用防幻觉,并定期更新沉淀经验 ✓ 正确答案
D RAG 检索结果无需溯源,可直接采信