# 1. 基于 LLM-as-Judge 的自动化灰度质量门禁如何设计(阈值、样本量、置信区间),judge 误判如何处理(人工复判、二次评估) A 用几个样本打分即可判定,无需统计 B judge 打分永远准确 C 阈值可以任意设定,不影响结论 D 需按期望功效计算样本量、用置信区间判定,并对 judge 误判做人工复判与校准 ✓ 正确答案
# 2. 如何按用户分群做 AI 功能的灰度放量并监控质量指标 A 所有用户一次性放量即可 B 高风险群应最先放量 C 按地域/活跃度/风险等维度分群,先放低风险群,并按群粒度监控质量指标逐步放量 ✓ 正确答案 D 分群灰度与质量监控无关
# 3. Prompt/模型版本变更如何用影子流量(Shadow)安全验证 A 影子验证不需要真实流量 B 影子流量直接把新版本结果返回给用户 C 影子流量与生产流量完全无关 D 把生产流量复制到影子环境并行运行新版本,仅做离线对比,达标后再转真实灰度 ✓ 正确答案
# 4. AI 生成的不可预测性给灰度判定(好坏样本)带来哪些挑战 A 由于输出随机,只能拍脑袋判定 B 输出随机与标准主观导致好坏样本不稳定,需固定 seed 对比、分场景统计并做人工复核 ✓ 正确答案 C AI 输出是确定性的,无挑战 D 只需看均值即可,无需分场景
# 5. 阶梯放量节奏,5%→全量的放量步骤、每阶段停留时长与暂停/继续判定标准如何设计? A 5% 放量后可直接跳到全量 B 放量只需看时间,不看指标 C 暂停标准与质量无关 D 每阶段按指标置信达成决定停留时长,质量/延迟/成本达标才继续,不达标则暂停或回退 ✓ 正确答案
# 6. 缓存隔离,新旧版本共用语义缓存或响应缓存时如何防止结果串扰与污染? A 新旧版本可以共用同一缓存键 B 语义缓存不会串扰 C 缓存结果与版本无关 D 缓存键必须包含版本维度并做命名空间隔离,避免旧版本结果被新版本命中 ✓ 正确答案
# 7. 灰度指标异常时如何自动熔断并回退到稳定模型 A 熔断后无需记录现场 B 指标单次波动就立即熔断 C 连续超过阈值触发熔断并自动切回稳定版本,用连续窗口防抖动并保留现场 ✓ 正确答案 D 熔断会破坏会话,应避免回退
# 8. AI 应用灰度与业务指标(转化/留存)的因果归因方法 A 相关即因果,无需对照组 B 辛普森悖论不影响归因 C 转化率指标无需考虑样本量 D 用随机化 A/B 或准实验方法(DID 等)控制混淆,才能可靠归因业务变化 ✓ 正确答案
# 9. Prompt 热更新机制如何与灰度标签联动,使指定用户群命中新 Prompt 并可快速收回 A 更新 Prompt 必须重启服务 B 通过标签→Prompt 版本映射在配置层路由,命中指定用户群并可一键收回 ✓ 正确答案 C 灰度标签无法命中特定用户 D 收回新版必须回滚代码
# 10. 灰度期间如何对实验组与对照组做成本差异隔离统计 A 只需看整体平均成本即可 B 按实验组/对照组标签归集成本,分别统计 token 与单请求成本并做差异显著性检验 ✓ 正确答案 C 成本差异无需统计 D 新版本成本必然被平均掩盖
# 11. AI 功能回滚时如何保留用户已产生的对话上下文连续 A 回滚后对话必然丢失 B 把上下文持久化并与版本解耦,回滚时用同一份上下文接续,必要时做格式迁移 ✓ 正确答案 C 上下文只能存在内存中 D 版本切换与上下文无关
# 12. 生成质量的主观评分如何纳入灰度验收门槛 A 主观评分无意义,只看客观指标 B 用结构化评分表量化主观体验,与客观指标分层设门槛,并做统计化判定 ✓ 正确答案 C 主观评分不能量化 D 主观评分只需看一个样本
# 13. 灰度期间的质量指标与成本指标如何做实验组隔离统计,防止新版本成本上升被整体均值掩盖 A 按版本分桶独立归集质量/成本/延迟指标,对新版本单独设告警,避免被整体均值掩盖 ✓ 正确答案 B 新版本小流量问题无需关注 C 看整体均值即可发现所有问题 D 隔离统计会掩盖质量问题
# 14. 模型/提示的灰度,流量切分方式、指标对比口径与显著性判定应如何设计,避免灰度结论失真 A 灰度结论可以凭感觉判断 B 样本量不影响灰度结论 C 指标口径可以两组不同 D 用随机一致哈希分桶、统一指标口径、做统计显著性检验,避免结论失真 ✓ 正确答案
# 15. 灰度与实验的边界,放量与 A/B 实验的目标、指标口径与终止规则有何不同? A 灰度是渐进上线的安全流程,A/B 是因果验证,二者在目标、指标口径与终止规则上不同 ✓ 正确答案 B 两者目标完全相同 C 灰度最终不一定会全量 D A/B 实验必然扩大流量
# 16. AI 功能上线为何比传统功能更需要金丝雀(Canary)而非全量 A AI 输出可预测,全量安全 B AI 输出不可预测、质量难预先验证,金丝雀用小流量观察真实表现再放量,降低风险 ✓ 正确答案 C AI 功能与传统功能无差异 D 金丝雀对 AI 无意义
# 17. 多模型并行灰度(A/B/C)时流量分配与显著性判定 A 保证每组样本量充足、固定分流,两两比较时做多重比较校正 ✓ 正确答案 B 多版本不需要分流 C 多组间随意比较,无需校正 D 显著性判定无关紧要
# 18. 灰度验收指标应同时看质量(准确率、引用支持率)、延迟(TTFT、P95)与成本(单请求成本)三类,停止规则如何联合设定 A 只看质量指标即可 B 质量/延迟/成本三类联合设定,质量是底线,任一硬门槛跌破即停,并明确优先级 ✓ 正确答案 C 成本指标可以无限超支 D 延迟不影响验收
# 19. 自动回滚的条件,错误率阈值、延迟异常与成本突增应如何联合触发回滚,回滚后如何恢复灰度 A 单点波动就触发回滚 B 用连续窗口+阈值联合触发(错误率/延迟/成本),回滚后修复并重新走灰度流程 ✓ 正确答案 C 回滚后可直接全量 D 回滚无需保留现场
# 20. 灰度期反馈闭环,主动收集问题上报与满意度信号,如何回流为放量与回滚决策? A 主动收集问题上报与满意度信号并量化,回流为放量/回滚决策,高危反馈即时告警 ✓ 正确答案 B 只需看机器指标,无需用户反馈 C 用户反馈无法量化 D 反馈闭环与放量决策无关