# 1. SaaS 与自托管 LLMOps 在数据主权、运维、扩展和成本上如何选型 A SaaS 永远最优 B 数据主权无关紧要 C 自托管永远最便宜 D 强合规/数据主权选自托管,快速迭代/运维弱选 SaaS,可混合部署 ✓ 正确答案
# 2. 评测分数与 Judge 模型的双漂移如何监控,出现分数下降时如何区分应用质量退化与评估器过期 A 分数下降就是应用退化 B 用固定样本自检评估器稳定性作对照,区分应用退化与评估器过期 ✓ 正确答案 C 评估器不会漂移 D 无法区分
# 3. 多人协作下 Prompt 资产管理如何做 code review 与变更审计(变更 diff、审批人、关联评估结果),防止线上 Prompt 被无评审修改 A 按代码管理:版本控制、PR 评审、关联评估结果、环境隔离、权限与审计日志 ✓ 正确答案 B Prompt 可直接线上修改 C 无需评审 D 审计日志是多余的
# 4. Prompt/响应进入平台前如何做字段级脱敏、采样、保留期和基于角色的访问控制 A 原始数据直接进平台 B 进入前做字段级脱敏、采样、设定保留期与 RBAC 权限控制 ✓ 正确答案 C 无需脱敏 D 保留期无关紧要
# 5. 在线评估会增加延迟和成本时,如何异步采样并保证高风险事件必评 A 异步队列评估,低风险采样、高风险必评,控制延迟成本又不漏风险 ✓ 正确答案 B 同步评估保证时效 C 所有样本全量评估 D 高风险可采样
# 6. 多团队共用同一 LLMOps 平台时,如何做项目隔离、权限控制与数据共享的平衡 A 所有数据完全开放 B 项目私有数据隔离、公共资产共享、RBAC 控制边界,平衡隔离与共享 ✓ 正确答案 C 完全隔离无共享 D 无需权限控制
# 7. 怎样验证 LLMOps 平台的自动评分不是黑盒单点真相,保留哪些人工校准流程 A 抽样人工复核、自有 golden 校准、多信号交叉与人工仲裁兜底,防止黑盒单点真相 ✓ 正确答案 B 平台评分即真相 C 无需人工校准 D 平台评分逻辑无需透明
# 8. Prompt 变更流程的环境隔离与权限控制如何做,防止开发态 Prompt 误推生产 A 可直改生产 Prompt B 环境隔离、受控发布流程、权限最小化、环境标签校验与审计多重防线 ✓ 正确答案 C 无需权限控制 D 环境可混用
# 9. 平台版本和产品能力变化较快时,采购与架构记录应如何标注核查日期和退出方案 A 平台能力不会变 B 无需退出方案 C 记录标注核查日期、定期重验,并规划数据导出与退出方案防锁定 ✓ 正确答案 D 平台价格永不变
# 10. LLMOps 平台的告警(异常指标)应如何避免“告警风暴”,采用哪些降噪策略 A 告警越多越好 B 合理阈值、分级、聚合去重、去抖与关联分析,让告警少而准 ✓ 正确答案 C 无需去抖 D 所有告警都该 P0
# 11. 平台导出 API 的稳定性和覆盖度(哪些字段支持导出)应作为采购核心评估项 A 导出能力无关紧要 B 平台不会锁定数据 C 导出 API 的稳定性与字段覆盖度决定数据主权与是否被锁定,是采购核心评估项 ✓ 正确答案 D 只需评估价格
# 12. LLMOps 平台本身的 SLA(可用性、数据保留、查询性能) A 无需评估平台 SLA B 评估可用性、数据保留与删除、查询性能等 SLA,核对并验证 ✓ 正确答案 C 平台无需 SLA D 数据保留无要求
# 13. 应记录哪些延迟、Token、完成原因、检索分数、工具结果和错误类别,哪些正文默认不记录 A 完整正文必须全量记录 B 错误类别无需记录 C 正文记录无风险 D 记录延迟、Token、完成原因、检索分数、工具结果与错误类别,正文默认不记录或脱敏 ✓ 正确答案
# 14. 首 Token 延迟、每 Token 延迟与总耗时如何分解,怎样识别网络慢、排队慢还是模型慢 A 分解 TTFT/TPOT/总耗时,按网络、排队、模型分段归因定位瓶颈 ✓ 正确答案 B 总耗时长就是模型慢 C 无法定位延迟瓶颈 D 网络慢不影响延迟
# 15. 如何把用户反馈和任务结果关联到 trace,同时避免在标签中放高基数敏感数据 A 标签可放用户 ID B 用 trace ID 关联反馈,标签只用低基数非敏感聚合值,高基数敏感数据放外部表 ✓ 正确答案 C 标签基数越高越好 D 反馈无需关联 trace
# 16. 首 Token 延迟(TTFT)应如何精确测量,从请求发出到首个 SSE event,还是到首个非心跳 delta A TTFT 应测到首个非心跳、含实际内容的 delta 事件,排除心跳与空事件 ✓ 正确答案 B 首个 SSE event 就是 TTFT C 心跳也算内容 D 无法精确测量 TTFT
# 17. Prompt 与响应日志应保留哪些“调试必要”字段(trace ID、model、params) A 只保留 trace ID 即可 B 正文必须全量 C 保留 trace ID、model、params、时间、结果等可复现可归因字段,正文脱敏摘要 ✓ 正确答案 D 参数无需记录
# 18. 不同用户画像(免费、付费、企业)的请求应如何在可观测性数据中区分而不暴露 PII A 用用户 ID 打标签 B 用户 ID 非敏感 C 用低基数画像桶标签区分,用户 ID 等 PII 放外部关联表,聚合分析 ✓ 正确答案 D 无法区分用户画像
# 19. 错误率(错误数 / 请求数)应按 Provider、模型、租户、错误类型分别统计,单一全局指标为何掩盖问题 A 按 Provider、模型、租户、错误类型细分,避免全局指标掩盖局部故障 ✓ 正确答案 B 全局错误率足够 C 全局错误率能反映所有问题 D 错误类型无需区分
# 20. 为什么密钥、完整个人数据和内部思考不应进入日志,即使日志平台声明加密 A 即使加密,密钥/个人数据/内部思考也不应进日志,应在源头避免记录 ✓ 正确答案 B 加密后可放心记录 C 加密日志无泄露风险 D 密钥可进日志
# 21. OpenTelemetry GenAI Semantic Conventions 在 LLM 可观测性标准化的工程意义(LLM span attributes / token 用量 / tool 调用追踪)? A 各框架自定语义即可 B 标准化 LLM span 属性、token 用量与 tool 调用语义,实现跨工具可移植与互操作 ✓ 正确答案 C 标准化无意义 D 只标准化 token
# 22. 会话级聚合分析应如何从单条 trace 聚合出多轮对话的任务完成漏斗(发起→澄清→工具成功→解决),跨 trace 的关联键如何设计 A 用会话 ID 关联多轮 trace,构建发起→澄清→工具→解决漏斗,关联键低基数非敏感 ✓ 正确答案 B 单条 trace 即可分析 C 关联键用用户 ID 即可 D 漏斗分析无意义
# 23. 如何用 OTel Profile(持续剖析)定位 AI 服务的 CPU 与内存瓶颈,与传统 APM 区别是什么 A APM 能定位函数级瓶颈 B APM 定位请求级延迟,Profile 定位函数级 CPU/内存瓶颈,两者互补 ✓ 正确答案 C Profile 只看延迟 D 两者功能相同
# 24. 会话漏斗中的用户主动离开与系统导致放弃应如何区分,防止漏斗指标被自然流失扭曲 A 所有离开都算流失 B 无需区分 C 用终态、行为、系统事件区分自然离开与系统放弃,只优化系统导致放弃 ✓ 正确答案 D 自然离开也需优化
# 25. 如何建立 Dataset—Experiment—Trace—Feedback—Regression 的闭环并保持版本可追溯 A 各环节独立即可 B 用统一 ID 关联各环节并绑定版本,badcase 回流形成闭环且可追溯 ✓ 正确答案 C 无需版本绑定 D 反馈无法回流
# 26. OpenInference 与 OpenTelemetry 如何降低平台锁定,哪些语义仍需要应用自定义 A 标准语义增加锁定 B 标准语义让数据可移植降锁定,业务特有语义仍需自定义补充 ✓ 正确答案 C 无需自定义任何语义 D 标准覆盖所有业务
# 27. Prompt 版本管理(Prompt Management) A Prompt 无需版本管理 B 版本化、环境绑定、审计、回滚与灰度发布,让 Prompt 变更像代码一样可控 ✓ 正确答案 C Prompt 只能单版本 D 无法回滚 Prompt
# 28. LLMOps 平台与 OTel / OpenInference 集成的成熟度差异,按官方最新状态应如何评估 A 所有平台集成度相同 B 集成度不影响迁移 C 无需核查 D 核对官方文档验证标准支持、导出与互操作,按最新状态评估集成成熟度 ✓ 正确答案
# 29. 为什么“把所有 Prompt 都放进 LLMOps 平台”并不总是好的,应区分开发、灰度、生产环境 A 所有 Prompt 都该进平台 B 开发态轻量快速、灰度态验证、生产态受控,分级管理避免过度治理 ✓ 正确答案 C 平台化无成本 D 开发态也应严格平台化
# 30. 一次 AI 请求应如何串联前端、Java 服务、模型、检索、工具和 Agent 节点的 Trace ID A 各节点独立 trace ID B 入口生成 trace ID,经 HTTP/异步/外部调用跨节点传播,统一汇聚成完整链路 ✓ 正确答案 C 无需传播 trace context D 外部调用无需关联
# 31. AI 请求的端到端 Trace 应包含哪些关键节点,前端意图、后端路由、检索、Prompt 组装、模型、工具调用、生成 A 只需记录模型调用 B 无需记录检索 C 记录意图、路由、检索、Prompt 组装、模型、工具、生成等关键节点 span ✓ 正确答案 D trace 只用于调试
# 32. Trace 上下文(Trace ID、BAGGAGE)如何在 Java 服务、WebFlux、Agent 节点之间正确传播 A 响应式链路自动传播 B Baggage 无需处理 C 同步靠 SDK 自动、WebFlux 异步需显式 context 传播、Agent 用 Baggage 传业务上下文 ✓ 正确答案 D 异步不丢失 context
# 33. 如何用 OpenTelemetry GenAI 语义约定记录 Token、TTFT、TPOT、cache hit 等低基数指标 A token 只能进日志 B 用 span attribute 记明细、metric 聚合统计,token/TTFT/TPOT/cache 用低基数标签 ✓ 正确答案 C 指标无需标签 D TTFT 无法记录
# 34. W3C TraceContext、Baggage、OpenTelemetry 和 OpenInference 在跨服务关联中如何协作 A 各标准互相独立无协作 B Baggage 负责链路关联 C TraceContext 关联链路、Baggage 传业务上下文、OTel 采集、OpenInference 定义 AI 语义,协作构成体系 ✓ 正确答案 D OpenInference 替代 OTel
# 35. Trace 中的用户反馈(点赞、点踩)应如何回填,关联的 key 设计应避免高基数问题 A 用 trace ID 关联反馈,标签用低基数聚合值,高基数敏感数据放外部表 ✓ 正确答案 B 反馈标签可放用户 ID C 标签基数越高越好 D 反馈无法回填
# 36. AI 应用的 SLI/SLO 应如何把质量类指标(任务成功率、引用支持率)与可用性、延迟一起纳入,错误预算如何分配与消耗 A 只含可用性延迟 B 质量指标不能进 SLO C 把任务成功率、引用支持率等质量指标与可用性延迟一起纳入 SLO,错误预算消耗完触发冻结/回滚 ✓ 正确答案 D 错误预算无需管理
# 37. 为什么不应在 Trace 中存储完整对话文本(隐私、成本),应保留哪些聚合指纹 A 完整文本必须存 B 默认存结构化聚合指纹,完整正文按需脱敏采样,控隐私与成本 ✓ 正确答案 C 完整文本无隐私风险 D 无需摘要
# 38. 如何用 Exemplar 把异常指标跳转到具体 Trace,避免人工“盲找” A Exemplar 是采样语法 B Exemplar 与 trace 无关 C Exemplar 为异常指标值附带具体 trace 引用,异常时可直接跳转 trace 定位 ✓ 正确答案 D 无法从指标跳转 trace
# 39. OpenTelemetry Baggage 适合传递哪些上下文(租户 ID、实验分组) A Baggage 适合传敏感数据 B Baggage 可传大文本 C Baggage 管链路关联 D Baggage 适合传租户 ID、实验分组等低基数非敏感业务上下文,不适合敏感/高基数数据 ✓ 正确答案
# 40. LLMOps 中 prompt version control / dataset version control 与传统 CI/CD 工具的差异? A AI 资产需绑定模型/评估、用评估验证、专门治理,与代码 CI/CD 互补而非相同 ✓ 正确答案 B 与传统版本控制完全相同 C Git 足以管理所有 D dataset 无需版本控制
# 41. 不同语言(Java、Python、Node)的 OTel SDK 在 GenAI 场景的成熟度差异,按最新状态应如何选择 A 各语言成熟度相同 B 无需关注语言差异 C Java 最成熟 D Python 生态最成熟,Java/Node 在演进,按官方最新状态与业务框架选型 ✓ 正确答案
# 42. Trace 采样策略(head-based vs tail-based) A head-based 能精准捕异常 B head-based 简单省开销、tail-based 精准捕异常,可混合用 head 基础采样 + tail 保留异常 ✓ 正确答案 C tail-based 开销最小 D 采样策略无差别
# 43. AI 应用的可观测性应覆盖哪些维度,质量指标 + 可用性 + 延迟 + 成本 A 只需看可用性延迟 B 成本无需监控 C 质量不属于可观测 D 覆盖质量、可用性、延迟、成本四维,用 trace/metric/评估一体化观测 ✓ 正确答案
# 44. LangSmith、Langfuse、Phoenix 与 Helicone 在 tracing、评估、Prompt 管理和网关能力上如何比较 A 各平台能力完全相同 B Phoenix 是网关 C Helicone 评估最强 D LangSmith/Langfuse 评估全面、Phoenix 侧重可观测探索、Helicone 侧重网关成本,按需选型 ✓ 正确答案
# 45. 平台迁移时(Langfuse → Helicone)Trace、Prompt、Dataset、评分如何导出与导入 A 用导出 API 与标准格式导出 trace/Prompt/dataset/评分,做 ID 映射与完整性验证,并评估目标平台能力 ✓ 正确答案 B 平台数据无法迁移 C 数据会随迁移丢失 D 无需验证完整性