LLM 评估框架与 CI/CD 集成

共 20 题
#

1. Braintrust、LangSmith、DeepEval、Promptfoo、Arize Phoenix 等评估框架在评估编排、数据集管理、在线/离线评估和团队协作上的核心差异如何按团队规模与数据敏感度选型

A 只有商业平台最好
B 只看开源
C 只看名
D 按团队规模、数据敏感度、生态集成与在线/离线能力综合取舍 ✓ 正确答案
#

2. Prompt CI/CD 流水线如何设计,Prompt 变更触发评估集运行、质量门禁(通过率/回归阈值)、自动阻断与人工审批的分级策略

A 变更触发评估,按通过率与回归阈值自动阻断,高风险变更走人工审批+灰度 ✓ 正确答案
B 所有变更都自动放行
C 所有变更都需人工审批
D 不做门禁
#

3. 回归检测(Regression Detection)如何定义基线、比较窗口和显著性判定,防止 Prompt/模型变更后质量静默退化而数周后才发现

A 冻结基线+比较窗口+显著性判定+趋势告警,持续对比 ✓ 正确答案
B 只做一次评测
C 等用户反馈
D 只看最终分数
#

4. LLM-as-Judge 评估的校准流水线,如何用人工标注子集校准 judge 偏差,judge 版本升级时如何重新校准而不丢失历史可比性

A 重跑人工校准集,量化新旧 judge 分差并映射,保留版本标签 ✓ 正确答案
B 删除历史结果
C 直接换 judge
D 忽略 judge 变化
#

5. 评估数据集的工程化管理,版本控制、分层采样(简单/中等/困难/对抗)、标注一致性检查和污染检测(评估题泄露到训练数据)

A 只做版本控制
B 不做污染检测
C 不设标注规范
D 版本控制+分层采样+标注一致性+污染检测 ✓ 正确答案
#

6. Prompt 变更的 A/B 评估如何控制样本量、置信区间和多指标冲突(质量提升但成本上升),统计显著性与业务显著性如何区分

A 只看 p 值
B 定义主指标与成本约束,区分统计显著性与业务显著性,综合决策 ✓ 正确答案
C 只看质量
D 只看成本
#

7. 评估指标体系设计,任务成功率、事实一致性(Faithfulness)、答案相关性(Relevance)、幻觉率、延迟 P95 和成本/请求如何组合为单一发布决策

A 只看任务成功率
B 主指标达标+硬性约束(幻觉率/延迟/成本上限)不突破,约束类一票否决 ✓ 正确答案
C 只看成本
D 所有指标必须同时提升
#

8. 影子评估,生产流量回放(shadow replay)到新 Prompt/模型版本,离线指标与在线行为如何对齐验证?

A 直接替换线上版本
B 只测延迟
C 用真实流量回放安全对比新旧版本,验证离线指标与在线行为是否对齐 ✓ 正确答案
D 不对比
#

9. 评估集分布漂移,生产输入分布变化后如何发现评估集过时,并增量补充样本保持代表性?

A 让评估集绑定起始版本
B 检测线上与评估集分布差异,按新分布增量补充样本保持代表性 ✓ 正确答案
C 只监控线上
D 永不更新
#

10. DeepEval 的 G-Eval、DAG 和 Hallucination 指标如何与自定义业务指标组合,评估结果如何输出为 CI 可消费的 pass/fail 信号

A 不能接入 CI
B 人工查看
C 用 pytest 集成与 JSON/退出码输出 pass/fail,按关键指标门禁判定 ✓ 正确答案
D 只输出日志
#

11. Promptfoo 的 YAML 配置驱动评估如何嵌入 GitHub Actions/GitLab CI,评估失败时如何生成 diff 报告辅助 Prompt 调试

A 只能本地跑
B 只测输出
C 无法生成报告
D YAML 驱动评估嵌入 CI 自动门禁,失败时生成新旧改动 diff 报告定位退化用例 ✓ 正确答案
#

12. LangSmith 的 Trace→Dataset→Experiment 闭环如何把生产失败案例自动回流为评估样本,回流时如何脱敏和去重

A 避免敏感数据进评估集并去除重复样本,保证安全与统计干净 ✓ 正确答案
B 增加样本量
C 不影响主要功能
D 只去重不脱敏
#

13. 评估结果的可视化与归因,按 Prompt 版本、模型版本、输入类别切片的质量趋势图如何驱动迭代决策

A 只看聚合总分数
B 不切片
C 按 Prompt/模型版本与输入类别切片,用趋势图定位具体改动与受影响类别 ✓ 正确答案
D 只看最新版本
#

14. 多模型对比评估(Model Comparison)如何控制 Prompt 一致性、随机性和位置偏差,结果如何转化为选型决策而非仅排名

A 只看分数排名
B 直接选最高分
C 控制 prompt 一致性、随机性与位置偏差,并用质量/成本/延迟/合规决策矩阵选型 ✓ 正确答案
D 不控偏差
#

15. 评估流水线本身的可靠性,评估超时、judge 服务不可用、数据集损坏时的降级策略与告警

A 只保证评估能跑
B 超时重试、judge 降级、数据集校验+异常告警,保证结果可信 ✓ 正确答案
C 失败不告警
D 不校验数据集
#

16. Braintrust 的 Scorer 组合(精确匹配、语义相似度、LLM judge、自定义函数)如何按任务类型编排,多 Scorer 冲突时如何加权

A 随机取一个
B 全部取平均
C 按可靠性与任务相关性加权合成,关键 Scorer 可一票否决 ✓ 正确答案
D 忽略冲突
#

17. 评估成本预算,LLM-as-Judge 全量评估的 token 成本如何估算,采样、批处理与增量评估如何降本?

A 全量跑不省
B 只用贵 judge
C 不估算成本
D 采样+批处理+增量评估只跑受影响样本 ✓ 正确答案
#

18. 开源评估框架(RAGAS、TruLens、OpenAI Evals)与商业平台在数据合规、可扩展性和支持成本上的取舍

A 开源永远更好
B 商业平台永远更好
C 数据合规、可扩展性、支持成本三者权衡,数据敏感用开源、快速上线用商业 ✓ 正确答案
D 只看价格
#

19. 评估驱动开发(Eval-Driven Development)的工作流,先写评估用例再写 Prompt,如何用评估覆盖率衡量 Prompt 工程完成度

A Prompt 字数
B 延迟
C 模型参数
D 需覆盖场景(正常/边界/对抗/长尾)的用例覆盖度,结合通过率衡量完成度 ✓ 正确答案
#

20. 门禁失败的人工复核,评估失败如何区分数据、judge 与模型问题,复核结论如何回流修正评估集?

A 先认定模型问题
B 逐层排查数据问题→judge 问题→模型问题,结论回流修正评估集 ✓ 正确答案
C 只查 judge
D 不回流