# 1. ML 模型的测试集/验证集/训练集划分策略与数据泄漏(Data Leakage)的识别和避免方法?请举例说明时间序列场景下的数据泄漏风险。 A 数据泄漏只发生在特征工程阶段,预处理阶段不会发生 B 时间序列场景下可以随机打乱数据后切分,只要切分比例正确 C 训练集与测试集重叠不会造成泄漏,泄漏只与特征有关 D 特征泄漏指模型使用了线上推理时无法获得的"未来信息"或"后验信息",会导致评估指标虚高 ✓ 正确答案
# 2. 数据漂移(Data Drift)与概念漂移(Concept Drift)的检测与测试策略?如何设计自动化监控和告警机制? A 数据漂移指输入特征分布发生变化,概念漂移指输入与输出的映射关系发生变化,后者更隐蔽 ✓ 正确答案 B 概念漂移通常可通过比较特征分布是否变化来直接检测 C 数据漂移指输入到输出的映射关系发生变化,概念漂移指输入特征分布变化 D 数据漂移和概念漂移是完全相同的一个概念
# 3. LLM 评测(Eval)与回归测试如何设计?基准集构建、判定器(Judge)选择和稳定性(Fluctuation)控制的实践方法? A 由于模型输出具有随机性,评测结果无法控制,只能接受波动 B 稳定性只与测试机性能有关,与模型参数无关 C 只要扩大基准集规模,评测结果就必然稳定 D 通过固定 seed 与温度、多次采样取均值、以及差分评测对比新旧输出,可以有效控制评测波动 ✓ 正确答案
# 4. LLM 应用测试的工程挑战,非确定性输出的验证方法?如何设计"足够好"的断言而非精确匹配? A 应采用精确字符串匹配以保证测试严格性 B 应放弃对 LLM 输出的自动化测试,全部依赖人工 C 非确定性输出无法设计任何断言 D 应采用"结构严格、语义宽松"的断言策略,并配合多次采样与 LLM-Judge 判定 ✓ 正确答案
# 5. RAG 系统的端到端测试,检索质量(Recall/Precision)、生成质量(Faithfulness/Relevance)和端到端效果如何分层评估? A 分层评估能帮助定位问题:检索层 Recall 高但生成层 Faithfulness 低,说明问题主要在生成 ✓ 正确答案 B Recall@K 属于生成层指标,Faithfulness 属于检索层指标 C 只需评估端到端效果,无需分层 D RAG 评估不需要标注数据
# 6. 对抗样本(Adversarial Example)鲁棒性如何测试?白盒攻击与黑盒攻击场景下的测试策略差异? A 白盒攻击可访问模型梯度,能生成扰动更小、攻击更强的样本;黑盒攻击通常借助替代模型迁移或查询式攻击 ✓ 正确答案 B 黑盒攻击通常可访问模型梯度,攻击更强 C 白盒攻击只能通过查询输入输出进行,无法访问梯度 D 对抗样本只存在图像场景,文本模型不会受影响
# 7. MLOps 中模型版本与流水线的 CI/CD 测试关注点,模型注册、A/B 部署、回滚的测试验证? A MLOps 只需要测试离线评估指标,不需要线上部署验证 B A/B 测试只需看均值,无需统计显著性 C 模型回滚无需验证,因为回滚后必然成功 D 模型注册后应保证版本号唯一、记录血缘、制品不可变,并通过 shadow 与金丝雀部署进行验证 ✓ 正确答案
# 8. ML 模型的公平性(Fairness)与偏见(Bias)测试,如何定义公平性指标并设计测试用例? A 公平性只有一种定义,即所有群体预测结果完全一致 B 公平性测试只能靠人工判断,无法自动化 C 公平性问题只源于特征选择,与训练数据无关 D 统计均等、机会均等、校准均等是不同的公平性定义,业务上可能互相冲突,需按场景选择 ✓ 正确答案
# 9. LLM 的幻觉(Hallucination)检测,如何设计测试集验证模型输出的事实准确性?Grounding 验证的方法? A 幻觉检测就是检查模型输出是否违反语法规则 B 幻觉检测无法自动化,只能全部人工 C 幻觉只存在于 RAG 场景,普通问答不会产生幻觉 D Grounding 验证指验证输出是否可由给定上下文支持,常用 NLI 或 LLM-Judge 逐条核对 ✓ 正确答案
# 10. Prompt 回归测试,如何构建 Prompt 变更的回归测试集?如何检测 Prompt 修改导致的行为漂移? A 通过同一输入集上新旧 Prompt 的差分对比,检测输出语义与行为是否发生非预期漂移 ✓ 正确答案 B Prompt 修改不会影响模型输出,无需回归测试 C Prompt 回归测试与普通鉴权测试完全等价 D 只需测试 Prompt 的格式,无需测试语义
# 11. 多模型对比测试(Model Comparison),如何设计公平的比较基准?评估指标的选择和统计显著性? A 只要模型不同,温度与 seed 可以随意设置,不影响对比公平性 B 对比只需看准确率,无需考虑成本与延迟 C 单次运行的结果即可可靠决定模型优劣 D 需控制变量使输入、提示词、采样参数一致,并对多次采样做显著性检验,才能判断模型差异 ✓ 正确答案
# 12. 模型推理性能测试,延迟、吞吐与批处理大小对线上 SLA 的影响,如何设计压测场景? A 应使用平均延迟评估性能,因为平均延迟能反映整体体验 B 压测只需测稳态,无需测峰值并发 C 输入长度对推理性能没有影响 D 增大 batch size 通常会提升吞吐但可能增加单请求延迟与显存占用,需在 SLA 约束下权衡 ✓ 正确答案
# 13. 模型校准与置信度测试,预测置信度与实际准确率如何校准(校准曲线、ECE),高置信度误判场景如何识别? A 校准即模型的判别力,校准好代表 AUC 高 B 温度缩放会改变模型预测的类别,因此不能用于校准 C ECE 值越大代表模型越校准 D 校准指预测概率是否反映真实发生频率,用校准曲线与 ECE 度量,高置信度误判可通过校准曲线识别 ✓ 正确答案
# 14. 分布外输入的检测测试,模型遇到训练分布外的输入时如何被识别,OOD 检测器自身的评估方法? A OOD 检测器不需要评估,因为它是自动的 B 只要模型给出高置信度,就必然不是 OOD C 可用 softmax 置信度、距离度量、密度估计等方法识别 OOD,并用 ROC-AUC 与 FPR@TPR 评估检测器自身 ✓ 正确答案 D OOD 检测只存在误报,不存在漏报
# 15. ML 模型测试中的'确定性'挑战,如何设计可重复的模型测试?随机性(Seed)控制策略? A 需要通过固定随机种子、数据划分、超参并记录环境指纹(版本、GPU 型号)来提升可重复性 ✓ 正确答案 B 固定 seed 后即可完全保证可重复,GPU 算子都是确定的 C 随机性只来自初始化,与数据采样无关 D 可重复性测试与模型版本无关
# 16. 特征工程(Feature Engineering)的测试,如何验证特征计算逻辑的正确性和一致性? A 只要特征计算不报错,就说明逻辑正确 B 需用黄金值验证正确性,并要求训练与推理共用同一份特征逻辑,避免 Train-Serve Skew ✓ 正确答案 C 训练与推理的特征逻辑可以各自实现,互不影响 D 特征测试无需覆盖边界情况
# 17. 模型评估,准确率、召回与 F1? A F1 是精确率与召回率的算术平均 B 精确率关注漏报,召回率关注误报 C 在类别严重不平衡时,准确率 Accuracy 可能失真,需结合 Precision/Recall/F1 判断 ✓ 正确答案 D 准确率越高代表模型一定越好,无需考虑其他指标
# 18. 多模态模型(图文/语音/视频)的测试要点,跨模态对齐、模态缺失与生成内容的一致性如何验证? A 需验证跨模态对齐、模态缺失时的降级行为,以及生成内容的跨模态一致性 ✓ 正确答案 B 多模态测试只需分别测试各模态,无需考虑跨模态关联 C 模态缺失时模型应直接报错,不需要优雅降级 D 图像与文字矛盾时模型的选择不重要,无需测试
# 19. 训练数据质量的验证,标签噪声率、类别不平衡与重复样本如何度量,数据问题对评估指标的污染如何识别? A 重复样本无影响,因为模型对所有样本都一视同仁 B 类别不平衡只会影响训练速度,不影响模型偏向 C 需度量标签噪声率、类别不平衡与重复样本,并警惕训练/测试集重叠造成的评估虚高 ✓ 正确答案 D 标签噪声无法度量,只能靠猜测