LLM 与 Agent 应用测试(高频)

共 19 题
#

1. 大模型应用的测试分层,提示词/Prompt、模型输出、Agent 行为、工具调用各自测什么?

A 只需测试模型输出,其他层无需测试
B 分层测试只会增加工作量,无实际价值
C 工具调用与模型输出层测试完全等价
D 应分层测试 Prompt、模型输出、Agent 行为与工具调用,从而精确定位问题出在哪一层 ✓ 正确答案
#

2. 如何测试 LLM 的"幻觉",构造对抗性问题集、引用溯源断言与人工抽检如何结合?

A 只需人工抽检,自动化无法检测幻觉
B 用对抗性问题集诱导、引用溯源断言验证引用真实性、人工抽检高风险样本,三者结合形成闭环 ✓ 正确答案
C 只要模型输出带引用,就必然无幻觉
D 幻觉测试只需覆盖无信息问题,无需矛盾问题
#

3. Agent 测试的 Harness 如何搭建,模拟工具、录制回放、步骤级断言与终态断言?

A Agent 测试必须连真实外部服务,无法模拟
B Harness 用模拟工具与录制回放提供可控环境,并用步骤级断言验证过程、终态断言验证结果 ✓ 正确答案
C 只需终态断言即可,步骤级断言无价值
D 录制回放只能用于调试,不能用于测试
#

4. RAG 系统的检索质量测试,召回率、命中率、排序质量与引用完整性如何度量?

A 只需看是否返回了内容,无需看排序
B MRR 不关心正确答案位置,只关心是否命中
C 用 Recall@K、命中率、MRR/NDCG 度量检索,并验证引用真实存在且支持对应断言 ✓ 正确答案
D 引用完整性无关紧要,只要答案正确即可
#

5. Agent 的异常路径测试,工具超时、返回错误、多步失败、循环卡死如何设计用例?

A 只需测试正常路径,异常路径概率低可忽略
B Agent 遇到工具错误会自动正确终止,无需测试
C 用模拟工具注入超时、错误、多步失败与循环,验证 Agent 的容错、恢复与循环检测机制 ✓ 正确答案
D 循环卡死只能靠人工观察,无法自动化检测
#

6. LLM 输出安全的自动化测试,越狱、提示注入、PII 泄漏、违规内容如何持续回归?

A 需构建对抗性测试集持续回归越狱、注入、PII 泄漏与违规内容,并因对抗手段演化而持续更新测试集 ✓ 正确答案
B 越狱、提示注入、PII 泄漏是同一类威胁,可统一测试
C 安全测试只需跑一次,模型不变就无需重复
D 安全过滤器能拦截所有变体,无需对抗升级
#

7. 如何用 LLM-as-Judge 做大规模评测并验证 Judge 自身可靠性?

A Judge 打分必然客观,无需验证
B 所有 Judge 偏差都无法规避
C Judge 只适合小样本评测,无法大规模
D 需与人工标注对比验证 Judge 一致性,并规避位置偏差、长度偏差、自我偏好等偏差 ✓ 正确答案
#

8. Agent 工具调用的并发与竞态测试,多工具并行调用、超时竞争与结果覆盖如何设计用例?

A 并行调用结果顺序固定,无需竞态测试
B 需用可控模拟工具制造不同延迟与返回顺序,验证超时竞争、结果覆盖与状态一致性,并关注幂等性 ✓ 正确答案
C 竞态只会导致性能问题,不影响正确性
D 只要工具最终都返回,结果就必然正确
#

9. RAG 评估框架(RAGAS 等)的落地,忠实度、答案相关性与上下文相关性的自动化度量?

A 忠实度衡量回答是否切题,答案相关性衡量是否编造
B 忠实度衡量回答能否被上下文支持,答案相关性衡量是否切题,上下文相关性衡量检索质量,均可用 LLM 自动化度量 ✓ 正确答案
C RAGAS 指标完全准确,无需人工评估
D 上下文相关性衡量的是回答的完整性
#

10. Agent 的任务规划测试,多步任务的分解、排序与依赖规划正确性如何验证,规划错误与执行错误的归因如何区分?

A 用步骤级断言验证任务分解、排序与依赖,并通过规划日志与执行日志区分规划错误与执行错误 ✓ 正确答案
B 规划错误与执行错误是同一类问题,无需区分
C 只要最终任务完成,规划一定正确
D 规划测试无需验证回退能力
#

11. LLM 流式输出与交互测试,流式 token 输出的完整性、中断恢复与并发请求如何验证,打字机效果如何断言?

A 流式输出只需验证最终内容,无需按事件断言
B 并发流式请求不会互相干扰,无需测试
C 流式输出不可能出现丢失或乱序
D 需验证流式拼接结果与非流式一致、中断恢复、并发隔离,并用"内容递增且为前缀"断言打字机效果 ✓ 正确答案
#

12. AI 生成测试代码的"测试测试者",如何用变异测试评估 AI 生成用例的有效性?

A 只要测试能运行,变异杀死率就一定高
B 变异测试用于生成测试数据,而非评估测试有效性
C 变异测试是给被测代码注入变异体,用变异杀死率衡量测试能否发现缺陷 ✓ 正确答案
D 变异测试成本低,可无限执行
#

13. 模型版本升级(Prompt/模型/上下文策略变更)的回归测试与灰度验证如何做?

A 升级应走"离线回归→灰度放量→全量"流程,用差分评测对比,并设置可观测指标与自动回滚阈值 ✓ 正确答案
B 模型升级只需离线跑一次评测即可上线
C 灰度验证无法反映真实线上效果,没必要
D 升级后无需保存样本与评测报告
#

14. 如何度量 AI 应用的质量指标,端到端任务成功率、用户反馈率、安全拦截率?

A 端到端任务成功率只需看工具调用是否成功
B 应从任务成功率、用户反馈率、安全拦截率等多维度度量,并区分工具成功与业务结果成功 ✓ 正确答案
C 安全拦截率只反映过滤器的拦截数量,与越狱无关
D 用户反馈率与模型准确性无关
#

15. Agent 测试的三大维度,工具调用正确性(参数拼装/返回解析)、多步流程编排(依赖/回退)与安全边界(注入/越权)如何逐层验证?

A 三大维度相互独立,可只测其中一个
B 安全边界只需测试注入,无需测试越权
C 工具调用正确性验证参数拼装与返回解析,多步流程编排验证依赖与回退,安全边界验证注入与越权,需逐层建立测试集 ✓ 正确答案
D 多步流程编排与工具调用正确性测试完全等价
#

16. LLM 应用的 token 成本与延迟测试,输入输出长度、模型档位与缓存策略对成本的影响验证?

A 需验证输入/输出长度、模型档位与缓存策略对 token 成本与延迟的影响,并权衡成本、延迟与质量 ✓ 正确答案
B 成本只取决于输出长度,与输入长度无关
C 缓存命中会降低延迟但必然增加成本
D 模型档位越高成本越低
#

17. Agent 上下文窗口超限与记忆裁剪测试,长对话溢出、关键信息丢失与恢复策略如何验证?

A 长对话溢出时直接报错即可,无需裁剪策略
B 记忆裁剪不会丢失任何信息,因为模型会记住所有内容
C 需验证超限时的优雅处理、记忆裁剪是否保留关键约束(避免关键信息丢失),以及恢复策略的可用性 ✓ 正确答案
D 上下文使用率无需监控
#

18. LLM 输出的多语言与格式稳定性测试,JSON 输出失败、语言混用与特殊字符的回归保障?

A LLM 总能输出合法 JSON,无需测试
B 需验证 JSON 输出的合法性、语言一致性、特殊字符转义,并建立格式回归集防退化 ✓ 正确答案
C 语言混用只影响展示,不影响解析
D 特殊字符不会破坏 JSON 结构
#

19. Agent 多轮对话的状态保持测试,跨轮指代消解、上下文累积与状态重置如何设计用例,长会话状态漂移如何检测?

A 多轮对话中状态无需保持,每轮独立即可
B 需设计跨轮指代、状态累积、状态重置与长会话状态漂移用例,并用关键约束跟踪检测漂移 ✓ 正确答案
C 状态重置会自动清空,无需测试
D 长会话状态漂移必然发生,无法检测