# 1. AI 生成测试用例的现状与局限,LLM 生成单元测试/集成测试的可用性和质量保证?如何评估生成测试的有效性? A LLM 生成的测试断言通常很强,能发现所有真实 bug B 只要生成测试能跑通,就说明其有效 C 生成测试有效性需用变异杀死率、缺陷发现率与覆盖率评估,且断言可能"照着实现写"而偏弱 ✓ 正确答案 D 生成测试与实现耦合是优点,能让测试更稳定
# 2. 大模型驱动的测试 Agent(自动探索、自动生成并执行用例)的现状与落地边界?如何验证 Agent 的测试覆盖充分性? A 测试 Agent 可完全替代人工测试,无需人工监督 B Agent 生成的用例必然可靠,无需门禁 C Agent 适合快速冒烟与广覆盖探索,但对复杂业务与长链路有限,需用覆盖率、需求覆盖与变异测试验证充分性 ✓ 正确答案 D 测试 Agent 无法自动执行用例,只能生成
# 3. LLM 生成测试用例的"覆盖率幻觉"问题,模型声称覆盖了分支但实际没有,如何验证? A 模型对覆盖率的描述总是准确的,可直接采信 B 覆盖率幻觉只影响行覆盖,不影响分支覆盖 C 覆盖率幻觉指模型声称覆盖了某分支但实际未执行,必须用覆盖率工具实测而非采信描述 ✓ 正确答案 D 只要测试能运行,覆盖率就必然真实
# 4. AI 测试断言(Assertion)自动生成时,如何避免模型"照着实现写断言"导致测试失效? A 根据当前实现生成的断言最可靠,因为它与代码一致 B 断言无需验证,因为 LLM 生成的断言必然正确 C 断言应尽量耦合内部实现细节,以增强测试 D 应让期望值独立于被测实现(基于规格、独立黄金值),并用变异测试验证断言有效性,避免"照着实现写断言" ✓ 正确答案
# 5. AI 辅助 Bug 检测,基于机器学习的缺陷预测和缺陷定位技术的成熟度如何? A 缺陷预测偏重风险排序、缺陷定位偏重缩小嫌疑范围,成熟度有限,适合作为辅助而非黑盒决策 ✓ 正确答案 B 基于 ML 的缺陷预测与定位已能精确定位所有 bug,无需人工 C 静态分析比较成熟,而缺陷预测已完全成熟 D AI 定位只能用于单元测试,无法用于集成测试
# 6. Self-Healing(自愈)定位器的原理,AI 如何在页面元素变更后自动修复定位失败?其可靠性边界在哪? A 自愈定位器能百分之百正确修复所有定位失败,可放心依赖 B 自愈定位器只针对新元素,不处理元素变更 C 自愈通过属性相似度、上下文或视觉重定位元素,但存在误定位风险,需设阈值与人工确认 ✓ 正确答案 D 自愈修复无需记录,因为它是自动的
# 7. AI 辅助测试评审,如何用 LLM 检测测试用例的覆盖盲区和冗余? A LLM 评审结果可直接自动删除冗余用例,无需人工 B LLM 能通过需求点-用例映射发现覆盖盲区、通过语义相似度发现冗余,但输出需人工确认防误判 ✓ 正确答案 C 覆盖盲区只能靠人工发现,LLM 无法辅助 D 只要用例文本不同,就必然不是冗余
# 8. Playwright + LLM 的 UI 自动化中,如何用快照/语义 ID 降低选择器脆弱性? A 应尽量使用具体 class 与 XPath 定位,因为它们最精确 B 应优先使用 role、name、testid 等语义化定位器,并可用可访问性快照辅助 LLM 生成稳健定位 ✓ 正确答案 C 前端样式变化不影响 CSS 选择器,因此无需处理脆弱性 D 选择器脆弱性只能靠人工频繁修改,无法缓解
# 9. AI 生成的回归测试集如何防止"测试套件膨胀"(用例数量爆炸但价值不增)? A 应以覆盖增益与变异杀死率度量每个用例的价值,并结合去重、分层、门禁与定期清理控制膨胀 ✓ 正确答案 B 测试用例越多越好,覆盖越全 C AI 生成的用例应全部直接加入套件,无需筛选 D 套件膨胀只影响存储,不影响 CI 与维护
# 10. 如何评估一个 AI 测试工具(如自动生成单元测试)在团队中的 ROI? A 只看节省的时间即可,无需考虑维护与审查成本 B 需同时量化收益(时间、覆盖率、缺陷发现)与成本(订阅、审查、维护、返工),并用 A/B 对照与采纳率衡量净收益 ✓ 正确答案 C AI 工具的用例无需人工审查,因此无维护成本 D ROI 只能用主观感受评估,无法量化
# 11. LLM 生成测试数据的真实性与多样性,如何评估生成数据是否贴近生产分布并覆盖边界,避免全是常见值? A 生成数据只要字段齐全就足够真实,无需关心分布 B 需用分布对比评估真实性、用边界命中率评估多样性,并采用"主体抽样+边界单独生成"避免全是常见值 ✓ 正确答案 C 边界值不需要覆盖,因为生产数据都是常见值 D 测试数据越多越好,无需考虑贴近生产分布
# 12. AI 辅助测试文档生成,LLM 生成测试计划与报告的价值与风险(编造数据、遗漏风险),人工校验点如何设置? A LLM 生成的测试报告数据必然真实,可直接采信 B 测试报告由 LLM 生成后无需人工签字 C 应约束 LLM 只基于真实输入生成不编造数据,并对指标溯源、关键结论、遗漏项设置人工校验点 ✓ 正确答案 D 遗漏风险可以通过让 LLM 生成更长的文档来避免
# 13. AI 测试工具(如 Copilot for Testing、AI-based test generation)的选型与评估方法? A 只看工具演示效果即可决定,无需真实项目验证 B 选型无需考虑数据隐私与代码上传问题 C 所有 AI 测试工具能力相同,选便宜的即可 D 需综合技术兼容、生成质量、成本、安全与厂商风险,并在真实项目上做试点对比评估 ✓ 正确答案
# 14. AI 生成测试的可信度验证,如何评估 AI 生成测试的有效性(变异得分、缺陷发现率)? A 只要测试能运行,就说明其有效 B 变异杀死率与缺陷发现率是衡量测试有效性的核心指标,覆盖率仅作辅助 ✓ 正确答案 C 覆盖率越高,测试必然越有效 D 变异测试会破坏被测代码,因此不能用于评估
# 15. 大模型在缺陷分类与 triage 中的准确率如何度量,误判成本如何控制? A 需与真实处理结果对比度量准确率,并对高危误判单独加权、设置置信度阈值与人机协同控制成本 ✓ 正确答案 B 所有误判的成本相同,看整体准确率即可 C 模型 triage 结果可直接自动执行,无需复核 D 严重级别误判不影响任何成本
# 16. AI 辅助缺陷定位与根因分析? A AI 通过堆栈/日志分析、SBFL、最近变更等缩小排查范围,但输出应作为需人工验证的候选假设 ✓ 正确答案 B AI 能直接给出准确根因,无需人工验证 C 根因分析只适用于分布式系统,不适用于单服务 D AI 根因分析无需证据,直接给结论即可
# 17. AI 测试的质量,人工复核与门禁? A AI 生成的测试无需人工复核,可直接入库 B 应把 AI 生成的用例视为候选,按风险分层人工复核,并设置变异得分等可量化门禁后入库 ✓ 正确答案 C 门禁只会降低效率,不应设置 D 人工复核只适用于高风险测试,低风险测试可完全免审
# 18. AI 测试的提示设计与上下文? A 只需给函数名即可,上下文越多越干扰 B 提示应包含尽量多的无关代码,让模型更全面 C 提示格式不重要,只要模型能生成即可 D 应明确角色、任务、约束与输出格式,并提供被测代码与相关依赖作为上下文,用 RAG 控制粒度 ✓ 正确答案
# 19. RAG 赋能的测试知识库,如何把缺陷模式、历史用例与环境手册构建为可检索知识库,辅助用例设计与问题定位? A 知识库内容单一,只需存储缺陷描述即可 B 知识库不需要更新,因为历史知识永远有效 C 把缺陷模式、历史用例、环境手册切分向量化建索引,检索时附来源引用防幻觉,并定期更新沉淀经验 ✓ 正确答案 D RAG 检索结果无需溯源,可直接采信