# 1. Gemini Live 的模型 ID 从 preview 到 GA 变化较快(如 native-audio 系列),会话能力探测应如何避免绑定会过期的具体模型 ID? A 只要不用 preview 模型,就完全不存在 ID 过期问题 B 应在业务代码中直接硬编码最新模型 ID,保证每次都用新版本 C 通过能力层抽象模型能力,用独立映射表把能力映射到当前可用模型 ID,避免绑定过期 ID ✓ 正确答案 D 模型 ID 过期后必须重写全部前端代码才能恢复
# 2. 文本+音频双向流的会话如何管理输入缓冲、输出音频、转写、工具调用和取消事件 A 打断时应先保留已确认状态,再清空播放队列、停止播放并发送取消信号 ✓ 正确答案 B 转写事件必须等音频全部播放完毕才能处理 C 输入音频与转写事件应合并在同一个 FIFO 队列中顺序处理 D 工具调用事件与音频输出互相冲突,只能二者取其一
# 3. 客户端凭证(Ephemeral Token)如何由后端签发并限制会话时长、模型、工具和音频权限 A 前端应直接持有长期 API Key 以降低延迟 B 临时凭证无需设置有效期,可长期复用 C 临时凭证应包含数据库明文密钥以便前端直接调用 D 临时凭证应短时效并由后端校验用户权限后代签,作用域限定到会话所需的最小模型、工具与音频权限 ✓ 正确答案
# 4. 会话断开、模型切换或音频设备变化时,怎样保存最小状态并安全恢复 A 应保存完整原始音频流,确保恢复后一字不差 B 断开后必须清空全部上下文重新开始 C 设备切换时不需处理播放状态,直接重连即可 D 只保存最小且已确认的状态(会话 ID、截断上下文、工具状态),并以幂等方式恢复 ✓ 正确答案
# 5. WebSocket、WebTransport 与 WebRTC 在音频媒体、双向事件、拥塞控制和浏览器支持上如何选择 A WebRTC 基于 TCP,天然无队头阻塞 B 结构化事件与媒体往往混合使用:控制面用 WebSocket,媒体面用 WebRTC 以获得低延迟与拥塞控制 ✓ 正确答案 C WebSocket 最利于实时音频媒体,拥塞控制最好 D WebTransport 浏览器支持最广,应无条件优先选用
# 6. 用户打断时怎样停止播放、清空待播音频、取消生成并保留已确认的对话状态 A 打断时应停止播放、清空待播队列、取消生成,同时保留已确认的对话状态 ✓ 正确答案 B 打断后应清空全部对话历史以免混淆 C 应先播放完当前音频再处理打断,保证完整性 D 打断只需停止播放,无需向服务端发送取消信号
# 7. 语音中的 Function Calling 如何在播放、工具执行和确认之间协调,避免模型先口头承诺后工具失败 A 应先口头承诺"好的",让用户安心,再执行工具 B 工具调用与语音输出完全无关,无需协调 C 先执行工具并拿到结果,再基于结果生成确认语音,避免先承诺后失败 ✓ 正确答案 D 工具失败时仍应继续播放原承诺语音以保持流畅
# 8. 如何在丢包、弱网和设备切换测试中测量可懂度、打断成功率和恢复时间 A 可懂度只能用主观人听,无法用 ASR 转写量化 B 打断成功率与网络质量无关,无需在弱网下测 C 恢复时间只需测一次的平均值即可,不需分位数 D 通过固定网络剖面注入丢包/抖动,用 ASR 转写计算可懂度、统计打断成功率与恢复时间分位数 ✓ 正确答案
# 9. 多端协同(手机/耳机/Web)切换时如何保持会话连续性和音频权限 A 各端应各自维护独立会话,互不关联 B 音频权限可以跨端共享,无需重新申请 C 切换时无需处理旧端,直接丢弃即可 D 通过共享会话状态与单一活跃端概念,切换时原子交接上下文并重新申请该端音频权限 ✓ 正确答案
# 10. 实时模型工具调用耗时较长时,如何播放可中断的反馈并保持工具结果返回后的语音上下文一致 A 播放可中断的"进行中"反馈,将其纳入上下文,工具结果返回后基于结果生成最终反馈保持连贯 ✓ 正确答案 B 中途反馈不可打断,避免干扰 C 应静默等待工具结果,不播放任何反馈 D 工具结果返回后应清空上下文重新生成
# 11. 如何区分用户自然停顿、端点检测误判和真正的 barge-in,并用延迟与打断率进行调优 A 结合播放状态与 VAD 信号区分三类情形,并用打断延迟与误判率两个指标在灵敏度与稳定性间调优 ✓ 正确答案 B 打断延迟与误判率是同一指标,无需分别度量 C 只要检测到语音活动就立即打断,灵敏度最高 D 自然停顿无法与打断区分,只能统一处理
# 12. 浏览器端实时语音会话如何保护 TURN 凭证、录音数据和 DataChannel 中的工具事件 A TURN 凭证应长期固定,避免频繁轮换 B 短期签发 TURN 凭证、媒体面用加密传输、工具事件由服务端二次校验,可降低泄露面 ✓ 正确答案 C 录音数据可明文直接存浏览器本地 D DataChannel 工具事件无需鉴权,前端可自行执行
# 13. OpenAI Realtime 生产首选 gpt-realtime,旧 gpt-4o-realtime-preview 仅为 preview,这对模型配置和迁移有何影响? A preview 模型已足够稳定,可直接用于生产 B 迁移需核对配置项与事件兼容性,并在影子环境回归后灰度切换、保留回滚 ✓ 正确答案 C 迁移只需替换模型 ID 字符串,其余完全不变 D GA 模型一定比 preview 更差,不宜迁移
# 14. Realtime 会话的生命周期(connect、update、commit、close) A 生命周期应作为状态机管理,connect 初始化、update 改配置、commit 提交输入、close 释放资源并清理凭证 ✓ 正确答案 B close 时无需释放音频设备与凭证 C connect 与 close 之间任意时刻都可随意跳转,无需状态约束 D commit 与 update 是同一概念,可互换
# 15. Realtime 模型如何管理音频输入/输出缓冲、VAD、轮次检测和工具调用事件的一致性 A 音频缓冲可无限增长,无需边界管理 B 工具调用事件与音频输出顺序无关,可乱序处理 C VAD 与轮次检测相互独立,无需对齐 D 通过事件序与 turn 边界管理输入/输出缓冲、VAD 提交与工具调用,保证各事件流顺序一致 ✓ 正确答案
# 16. Realtime 模型与“ASR→LLM→TTS”级联在延迟、可控性、可替换性和调试上如何比较 A 级联延迟一定低于端到端 Realtime B 端到端可单独替换任意 ASR 段,可替换性更强 C 端到端延迟更低但中间不可见,级联可控可替换且便于按段调试,两者是延迟与可控性的权衡 ✓ 正确答案 D 级联没有任何可观测中间产物
# 17. Realtime 会话的 system prompt、tools 和 temperature 如何动态更新而不中断会话 A 通过 session.update 在轮次边界原子地更新 prompt、tools 与 temperature,无需中断会话 ✓ 正确答案 B temperature 无法在会话中修改,只能重建 C 更新 system prompt 必须断开连接重新建立会话 D 更新可以随时进行,即使模型正在生成也不影响
# 18. Realtime 模型支持的多模态输入(图像、文件、视频)如何传与会话上下文结合使用 A 图像上传后模型无法理解,只能存不能读 B 多模态输入无需上下文关联,独立处理即可 C 上传文件获得句柄后作为上下文内容引用传入会话,使模型可理解并支持工具结果以文件形式回流 ✓ 正确答案 D 文件无需校验来源与内容安全,直接使用
# 19. Realtime 会话的费用模型(音频输入/输出 Token、缓存、工具调用) A 音频输入输出不计费,只有文本计费 B 缓存对成本没有影响,无需优化 C 工具调用免费,不消耗 token D 音频按 token 当量计费,缓存命中的稳定前缀按折扣价计费,工具调用也计入 token 消耗 ✓ 正确答案
# 20. Realtime 模型如何处理 Function Calling 与音频输出的同步(先说话还是先返回工具结果) A 先执行工具并拿到结果,再基于结果生成语音,避免先承诺后失败 ✓ 正确答案 B 工具结果与语音内容无需一致 C 模型应先口头承诺"好的",再执行工具 D 工具调用时不可播放任何音频
# 21. Azure Realtime、xAI Voice 等产品状态变化较快,架构文档应怎样记录核查日期与兼容层 A 用兼容层抽象供应商差异,并记录核查日期、状态与兼容约束,让业务与快速变化的产品解耦 ✓ 正确答案 B 供应商产品变化与业务无关,无需文档 C 文档应只写接入日期,不用记录核查日期 D 兼容层会锁死供应商,应避免抽象
# 22. Realtime 模型的工具调用结果如何在 UI 端展示,避免与音频输出脱节 A 工具结果应一次性全部显示,与音频无关 B 工具结果无需在 UI 展示,只播放音频即可 C 用事件序与时间戳把工具结果与对应语音轮次绑定,UI 随音频节奏渲染,避免脱节 ✓ 正确答案 D 工具结果显示与音频播放位置无关,可任意错位
# 23. Realtime 会话的并发上限、速率限制和排队策略如何设计 A 并发无需上限,资源充足即可 B 设置并发上限与速率限制,超限时排队并优雅降级到非实时模式,避免整体不可用 ✓ 正确答案 C 排队超时直接失败即可,无需降级 D 限流与并发无关,无需设计
# 24. Realtime 模型对端侧加密、HIPAA/SOC2 合规的处理能力如何评估 A 只要供应商知名就自动满足 HIPAA/SOC2 B 音频数据无需加密传输 C 合规与数据处置无关,只关注模型效果 D 需评估传输/存储加密、供应商合规认证(HIPAA/SOC2)、数据驻留与删除审计,缺口处以自有层补偿 ✓ 正确答案
# 25. Realtime 会话的可观测性(首音频、打断率、丢包率)如何采集与告警 A 在客户端与服务端埋点采集首音频、打断率、丢包率等指标,分位数聚合并设阈值告警关联会话 ID ✓ 正确答案 B 均值即可代表整体延迟,无需分位数 C 只需采集首音频延迟一个指标即可 D 告警无需关联会话 ID,只报数字即可
# 26. Realtime 场景下的 prompt injection 攻击如何防护(音频隐式指令、多模态越狱) A 只需过滤文本输入,音频无需处理 B 音频中的指令无法被检测,只能放弃 Realtime C 检测到注入后无需限权,继续正常处理即可 D 对音频转写与多模态内容做检测、内容指令分离、强 system prompt 隔离与输出护栏,形成纵深防御 ✓ 正确答案
# 27. 如何处理麦克风采集、VAD、ASR、模型推理和 TTS 的流水线背压,保持低延迟而不积压音频 A 缓冲应无界,保证一条不少 B 背压只影响文本,不影响音频 C 模型推理慢时应无限等待,不降级 D 用有界缓冲与丢弃/降级策略配合流式处理,避免积压并优先保证实时性与可懂度 ✓ 正确答案
# 28. LiveKit、Pipecat 等框架如何组织媒体与 Agent 管线,选型时应关注哪些可观测性和锁定问题 A 应关注框架是否暴露延迟与队列等可观测能力、是否锁定特定供应商、组件是否可替换 ✓ 正确答案 B 框架一定会永久锁死供应商,无法规避 C 框架越封装越好,可观测性不重要 D 选型只看功能多少,无需考虑迁移