LLMOps 平台

共 45 题
#

1. SaaS 与自托管 LLMOps 在数据主权、运维、扩展和成本上如何选型

A SaaS 永远最优
B 数据主权无关紧要
C 自托管永远最便宜
D 强合规/数据主权选自托管,快速迭代/运维弱选 SaaS,可混合部署 ✓ 正确答案
#

2. 评测分数与 Judge 模型的双漂移如何监控,出现分数下降时如何区分应用质量退化与评估器过期

A 分数下降就是应用退化
B 用固定样本自检评估器稳定性作对照,区分应用退化与评估器过期 ✓ 正确答案
C 评估器不会漂移
D 无法区分
#

3. 多人协作下 Prompt 资产管理如何做 code review 与变更审计(变更 diff、审批人、关联评估结果),防止线上 Prompt 被无评审修改

A 按代码管理:版本控制、PR 评审、关联评估结果、环境隔离、权限与审计日志 ✓ 正确答案
B Prompt 可直接线上修改
C 无需评审
D 审计日志是多余的
#

4. Prompt/响应进入平台前如何做字段级脱敏、采样、保留期和基于角色的访问控制

A 原始数据直接进平台
B 进入前做字段级脱敏、采样、设定保留期与 RBAC 权限控制 ✓ 正确答案
C 无需脱敏
D 保留期无关紧要
#

5. 在线评估会增加延迟和成本时,如何异步采样并保证高风险事件必评

A 异步队列评估,低风险采样、高风险必评,控制延迟成本又不漏风险 ✓ 正确答案
B 同步评估保证时效
C 所有样本全量评估
D 高风险可采样
#

6. 多团队共用同一 LLMOps 平台时,如何做项目隔离、权限控制与数据共享的平衡

A 所有数据完全开放
B 项目私有数据隔离、公共资产共享、RBAC 控制边界,平衡隔离与共享 ✓ 正确答案
C 完全隔离无共享
D 无需权限控制
#

7. 怎样验证 LLMOps 平台的自动评分不是黑盒单点真相,保留哪些人工校准流程

A 抽样人工复核、自有 golden 校准、多信号交叉与人工仲裁兜底,防止黑盒单点真相 ✓ 正确答案
B 平台评分即真相
C 无需人工校准
D 平台评分逻辑无需透明
#

8. Prompt 变更流程的环境隔离与权限控制如何做,防止开发态 Prompt 误推生产

A 可直改生产 Prompt
B 环境隔离、受控发布流程、权限最小化、环境标签校验与审计多重防线 ✓ 正确答案
C 无需权限控制
D 环境可混用
#

9. 平台版本和产品能力变化较快时,采购与架构记录应如何标注核查日期和退出方案

A 平台能力不会变
B 无需退出方案
C 记录标注核查日期、定期重验,并规划数据导出与退出方案防锁定 ✓ 正确答案
D 平台价格永不变
#

10. LLMOps 平台的告警(异常指标)应如何避免“告警风暴”,采用哪些降噪策略

A 告警越多越好
B 合理阈值、分级、聚合去重、去抖与关联分析,让告警少而准 ✓ 正确答案
C 无需去抖
D 所有告警都该 P0
#

11. 平台导出 API 的稳定性和覆盖度(哪些字段支持导出)应作为采购核心评估项

A 导出能力无关紧要
B 平台不会锁定数据
C 导出 API 的稳定性与字段覆盖度决定数据主权与是否被锁定,是采购核心评估项 ✓ 正确答案
D 只需评估价格
#

12. LLMOps 平台本身的 SLA(可用性、数据保留、查询性能)

A 无需评估平台 SLA
B 评估可用性、数据保留与删除、查询性能等 SLA,核对并验证 ✓ 正确答案
C 平台无需 SLA
D 数据保留无要求
#

13. 应记录哪些延迟、Token、完成原因、检索分数、工具结果和错误类别,哪些正文默认不记录

A 完整正文必须全量记录
B 错误类别无需记录
C 正文记录无风险
D 记录延迟、Token、完成原因、检索分数、工具结果与错误类别,正文默认不记录或脱敏 ✓ 正确答案
#

14. 首 Token 延迟、每 Token 延迟与总耗时如何分解,怎样识别网络慢、排队慢还是模型慢

A 分解 TTFT/TPOT/总耗时,按网络、排队、模型分段归因定位瓶颈 ✓ 正确答案
B 总耗时长就是模型慢
C 无法定位延迟瓶颈
D 网络慢不影响延迟
#

15. 如何把用户反馈和任务结果关联到 trace,同时避免在标签中放高基数敏感数据

A 标签可放用户 ID
B 用 trace ID 关联反馈,标签只用低基数非敏感聚合值,高基数敏感数据放外部表 ✓ 正确答案
C 标签基数越高越好
D 反馈无需关联 trace
#

16. 首 Token 延迟(TTFT)应如何精确测量,从请求发出到首个 SSE event,还是到首个非心跳 delta

A TTFT 应测到首个非心跳、含实际内容的 delta 事件,排除心跳与空事件 ✓ 正确答案
B 首个 SSE event 就是 TTFT
C 心跳也算内容
D 无法精确测量 TTFT
#

17. Prompt 与响应日志应保留哪些“调试必要”字段(trace ID、model、params)

A 只保留 trace ID 即可
B 正文必须全量
C 保留 trace ID、model、params、时间、结果等可复现可归因字段,正文脱敏摘要 ✓ 正确答案
D 参数无需记录
#

18. 不同用户画像(免费、付费、企业)的请求应如何在可观测性数据中区分而不暴露 PII

A 用用户 ID 打标签
B 用户 ID 非敏感
C 用低基数画像桶标签区分,用户 ID 等 PII 放外部关联表,聚合分析 ✓ 正确答案
D 无法区分用户画像
#

19. 错误率(错误数 / 请求数)应按 Provider、模型、租户、错误类型分别统计,单一全局指标为何掩盖问题

A 按 Provider、模型、租户、错误类型细分,避免全局指标掩盖局部故障 ✓ 正确答案
B 全局错误率足够
C 全局错误率能反映所有问题
D 错误类型无需区分
#

20. 为什么密钥、完整个人数据和内部思考不应进入日志,即使日志平台声明加密

A 即使加密,密钥/个人数据/内部思考也不应进日志,应在源头避免记录 ✓ 正确答案
B 加密后可放心记录
C 加密日志无泄露风险
D 密钥可进日志
#

21. OpenTelemetry GenAI Semantic Conventions 在 LLM 可观测性标准化的工程意义(LLM span attributes / token 用量 / tool 调用追踪)?

A 各框架自定语义即可
B 标准化 LLM span 属性、token 用量与 tool 调用语义,实现跨工具可移植与互操作 ✓ 正确答案
C 标准化无意义
D 只标准化 token
#

22. 会话级聚合分析应如何从单条 trace 聚合出多轮对话的任务完成漏斗(发起→澄清→工具成功→解决),跨 trace 的关联键如何设计

A 用会话 ID 关联多轮 trace,构建发起→澄清→工具→解决漏斗,关联键低基数非敏感 ✓ 正确答案
B 单条 trace 即可分析
C 关联键用用户 ID 即可
D 漏斗分析无意义
#

23. 如何用 OTel Profile(持续剖析)定位 AI 服务的 CPU 与内存瓶颈,与传统 APM 区别是什么

A APM 能定位函数级瓶颈
B APM 定位请求级延迟,Profile 定位函数级 CPU/内存瓶颈,两者互补 ✓ 正确答案
C Profile 只看延迟
D 两者功能相同
#

24. 会话漏斗中的用户主动离开与系统导致放弃应如何区分,防止漏斗指标被自然流失扭曲

A 所有离开都算流失
B 无需区分
C 用终态、行为、系统事件区分自然离开与系统放弃,只优化系统导致放弃 ✓ 正确答案
D 自然离开也需优化
#

25. 如何建立 Dataset—Experiment—Trace—Feedback—Regression 的闭环并保持版本可追溯

A 各环节独立即可
B 用统一 ID 关联各环节并绑定版本,badcase 回流形成闭环且可追溯 ✓ 正确答案
C 无需版本绑定
D 反馈无法回流
#

26. OpenInference 与 OpenTelemetry 如何降低平台锁定,哪些语义仍需要应用自定义

A 标准语义增加锁定
B 标准语义让数据可移植降锁定,业务特有语义仍需自定义补充 ✓ 正确答案
C 无需自定义任何语义
D 标准覆盖所有业务
#

27. Prompt 版本管理(Prompt Management)

A Prompt 无需版本管理
B 版本化、环境绑定、审计、回滚与灰度发布,让 Prompt 变更像代码一样可控 ✓ 正确答案
C Prompt 只能单版本
D 无法回滚 Prompt
#

28. LLMOps 平台与 OTel / OpenInference 集成的成熟度差异,按官方最新状态应如何评估

A 所有平台集成度相同
B 集成度不影响迁移
C 无需核查
D 核对官方文档验证标准支持、导出与互操作,按最新状态评估集成成熟度 ✓ 正确答案
#

29. 为什么“把所有 Prompt 都放进 LLMOps 平台”并不总是好的,应区分开发、灰度、生产环境

A 所有 Prompt 都该进平台
B 开发态轻量快速、灰度态验证、生产态受控,分级管理避免过度治理 ✓ 正确答案
C 平台化无成本
D 开发态也应严格平台化
#

30. 一次 AI 请求应如何串联前端、Java 服务、模型、检索、工具和 Agent 节点的 Trace ID

A 各节点独立 trace ID
B 入口生成 trace ID,经 HTTP/异步/外部调用跨节点传播,统一汇聚成完整链路 ✓ 正确答案
C 无需传播 trace context
D 外部调用无需关联
#

31. AI 请求的端到端 Trace 应包含哪些关键节点,前端意图、后端路由、检索、Prompt 组装、模型、工具调用、生成

A 只需记录模型调用
B 无需记录检索
C 记录意图、路由、检索、Prompt 组装、模型、工具、生成等关键节点 span ✓ 正确答案
D trace 只用于调试
#

32. Trace 上下文(Trace ID、BAGGAGE)如何在 Java 服务、WebFlux、Agent 节点之间正确传播

A 响应式链路自动传播
B Baggage 无需处理
C 同步靠 SDK 自动、WebFlux 异步需显式 context 传播、Agent 用 Baggage 传业务上下文 ✓ 正确答案
D 异步不丢失 context
#

33. 如何用 OpenTelemetry GenAI 语义约定记录 Token、TTFT、TPOT、cache hit 等低基数指标

A token 只能进日志
B 用 span attribute 记明细、metric 聚合统计,token/TTFT/TPOT/cache 用低基数标签 ✓ 正确答案
C 指标无需标签
D TTFT 无法记录
#

34. W3C TraceContext、Baggage、OpenTelemetry 和 OpenInference 在跨服务关联中如何协作

A 各标准互相独立无协作
B Baggage 负责链路关联
C TraceContext 关联链路、Baggage 传业务上下文、OTel 采集、OpenInference 定义 AI 语义,协作构成体系 ✓ 正确答案
D OpenInference 替代 OTel
#

35. Trace 中的用户反馈(点赞、点踩)应如何回填,关联的 key 设计应避免高基数问题

A 用 trace ID 关联反馈,标签用低基数聚合值,高基数敏感数据放外部表 ✓ 正确答案
B 反馈标签可放用户 ID
C 标签基数越高越好
D 反馈无法回填
#

36. AI 应用的 SLI/SLO 应如何把质量类指标(任务成功率、引用支持率)与可用性、延迟一起纳入,错误预算如何分配与消耗

A 只含可用性延迟
B 质量指标不能进 SLO
C 把任务成功率、引用支持率等质量指标与可用性延迟一起纳入 SLO,错误预算消耗完触发冻结/回滚 ✓ 正确答案
D 错误预算无需管理
#

37. 为什么不应在 Trace 中存储完整对话文本(隐私、成本),应保留哪些聚合指纹

A 完整文本必须存
B 默认存结构化聚合指纹,完整正文按需脱敏采样,控隐私与成本 ✓ 正确答案
C 完整文本无隐私风险
D 无需摘要
#

38. 如何用 Exemplar 把异常指标跳转到具体 Trace,避免人工“盲找”

A Exemplar 是采样语法
B Exemplar 与 trace 无关
C Exemplar 为异常指标值附带具体 trace 引用,异常时可直接跳转 trace 定位 ✓ 正确答案
D 无法从指标跳转 trace
#

39. OpenTelemetry Baggage 适合传递哪些上下文(租户 ID、实验分组)

A Baggage 适合传敏感数据
B Baggage 可传大文本
C Baggage 管链路关联
D Baggage 适合传租户 ID、实验分组等低基数非敏感业务上下文,不适合敏感/高基数数据 ✓ 正确答案
#

40. LLMOps 中 prompt version control / dataset version control 与传统 CI/CD 工具的差异?

A AI 资产需绑定模型/评估、用评估验证、专门治理,与代码 CI/CD 互补而非相同 ✓ 正确答案
B 与传统版本控制完全相同
C Git 足以管理所有
D dataset 无需版本控制
#

41. 不同语言(Java、Python、Node)的 OTel SDK 在 GenAI 场景的成熟度差异,按最新状态应如何选择

A 各语言成熟度相同
B 无需关注语言差异
C Java 最成熟
D Python 生态最成熟,Java/Node 在演进,按官方最新状态与业务框架选型 ✓ 正确答案
#

42. Trace 采样策略(head-based vs tail-based)

A head-based 能精准捕异常
B head-based 简单省开销、tail-based 精准捕异常,可混合用 head 基础采样 + tail 保留异常 ✓ 正确答案
C tail-based 开销最小
D 采样策略无差别
#

43. AI 应用的可观测性应覆盖哪些维度,质量指标 + 可用性 + 延迟 + 成本

A 只需看可用性延迟
B 成本无需监控
C 质量不属于可观测
D 覆盖质量、可用性、延迟、成本四维,用 trace/metric/评估一体化观测 ✓ 正确答案
#

44. LangSmith、Langfuse、Phoenix 与 Helicone 在 tracing、评估、Prompt 管理和网关能力上如何比较

A 各平台能力完全相同
B Phoenix 是网关
C Helicone 评估最强
D LangSmith/Langfuse 评估全面、Phoenix 侧重可观测探索、Helicone 侧重网关成本,按需选型 ✓ 正确答案
#

45. 平台迁移时(Langfuse → Helicone)Trace、Prompt、Dataset、评分如何导出与导入

A 用导出 API 与标准格式导出 trace/Prompt/dataset/评分,做 ID 映射与完整性验证,并评估目标平台能力 ✓ 正确答案
B 平台数据无法迁移
C 数据会随迁移丢失
D 无需验证完整性