Realtime 模型

共 28 题
#

1. Gemini Live 的模型 ID 从 preview 到 GA 变化较快(如 native-audio 系列),会话能力探测应如何避免绑定会过期的具体模型 ID?

A 只要不用 preview 模型,就完全不存在 ID 过期问题
B 应在业务代码中直接硬编码最新模型 ID,保证每次都用新版本
C 通过能力层抽象模型能力,用独立映射表把能力映射到当前可用模型 ID,避免绑定过期 ID ✓ 正确答案
D 模型 ID 过期后必须重写全部前端代码才能恢复
#

2. 文本+音频双向流的会话如何管理输入缓冲、输出音频、转写、工具调用和取消事件

A 打断时应先保留已确认状态,再清空播放队列、停止播放并发送取消信号 ✓ 正确答案
B 转写事件必须等音频全部播放完毕才能处理
C 输入音频与转写事件应合并在同一个 FIFO 队列中顺序处理
D 工具调用事件与音频输出互相冲突,只能二者取其一
#

3. 客户端凭证(Ephemeral Token)如何由后端签发并限制会话时长、模型、工具和音频权限

A 前端应直接持有长期 API Key 以降低延迟
B 临时凭证无需设置有效期,可长期复用
C 临时凭证应包含数据库明文密钥以便前端直接调用
D 临时凭证应短时效并由后端校验用户权限后代签,作用域限定到会话所需的最小模型、工具与音频权限 ✓ 正确答案
#

4. 会话断开、模型切换或音频设备变化时,怎样保存最小状态并安全恢复

A 应保存完整原始音频流,确保恢复后一字不差
B 断开后必须清空全部上下文重新开始
C 设备切换时不需处理播放状态,直接重连即可
D 只保存最小且已确认的状态(会话 ID、截断上下文、工具状态),并以幂等方式恢复 ✓ 正确答案
#

5. WebSocket、WebTransport 与 WebRTC 在音频媒体、双向事件、拥塞控制和浏览器支持上如何选择

A WebRTC 基于 TCP,天然无队头阻塞
B 结构化事件与媒体往往混合使用:控制面用 WebSocket,媒体面用 WebRTC 以获得低延迟与拥塞控制 ✓ 正确答案
C WebSocket 最利于实时音频媒体,拥塞控制最好
D WebTransport 浏览器支持最广,应无条件优先选用
#

6. 用户打断时怎样停止播放、清空待播音频、取消生成并保留已确认的对话状态

A 打断时应停止播放、清空待播队列、取消生成,同时保留已确认的对话状态 ✓ 正确答案
B 打断后应清空全部对话历史以免混淆
C 应先播放完当前音频再处理打断,保证完整性
D 打断只需停止播放,无需向服务端发送取消信号
#

7. 语音中的 Function Calling 如何在播放、工具执行和确认之间协调,避免模型先口头承诺后工具失败

A 应先口头承诺"好的",让用户安心,再执行工具
B 工具调用与语音输出完全无关,无需协调
C 先执行工具并拿到结果,再基于结果生成确认语音,避免先承诺后失败 ✓ 正确答案
D 工具失败时仍应继续播放原承诺语音以保持流畅
#

8. 如何在丢包、弱网和设备切换测试中测量可懂度、打断成功率和恢复时间

A 可懂度只能用主观人听,无法用 ASR 转写量化
B 打断成功率与网络质量无关,无需在弱网下测
C 恢复时间只需测一次的平均值即可,不需分位数
D 通过固定网络剖面注入丢包/抖动,用 ASR 转写计算可懂度、统计打断成功率与恢复时间分位数 ✓ 正确答案
#

9. 多端协同(手机/耳机/Web)切换时如何保持会话连续性和音频权限

A 各端应各自维护独立会话,互不关联
B 音频权限可以跨端共享,无需重新申请
C 切换时无需处理旧端,直接丢弃即可
D 通过共享会话状态与单一活跃端概念,切换时原子交接上下文并重新申请该端音频权限 ✓ 正确答案
#

10. 实时模型工具调用耗时较长时,如何播放可中断的反馈并保持工具结果返回后的语音上下文一致

A 播放可中断的"进行中"反馈,将其纳入上下文,工具结果返回后基于结果生成最终反馈保持连贯 ✓ 正确答案
B 中途反馈不可打断,避免干扰
C 应静默等待工具结果,不播放任何反馈
D 工具结果返回后应清空上下文重新生成
#

11. 如何区分用户自然停顿、端点检测误判和真正的 barge-in,并用延迟与打断率进行调优

A 结合播放状态与 VAD 信号区分三类情形,并用打断延迟与误判率两个指标在灵敏度与稳定性间调优 ✓ 正确答案
B 打断延迟与误判率是同一指标,无需分别度量
C 只要检测到语音活动就立即打断,灵敏度最高
D 自然停顿无法与打断区分,只能统一处理
#

12. 浏览器端实时语音会话如何保护 TURN 凭证、录音数据和 DataChannel 中的工具事件

A TURN 凭证应长期固定,避免频繁轮换
B 短期签发 TURN 凭证、媒体面用加密传输、工具事件由服务端二次校验,可降低泄露面 ✓ 正确答案
C 录音数据可明文直接存浏览器本地
D DataChannel 工具事件无需鉴权,前端可自行执行
#

13. OpenAI Realtime 生产首选 gpt-realtime,旧 gpt-4o-realtime-preview 仅为 preview,这对模型配置和迁移有何影响?

A preview 模型已足够稳定,可直接用于生产
B 迁移需核对配置项与事件兼容性,并在影子环境回归后灰度切换、保留回滚 ✓ 正确答案
C 迁移只需替换模型 ID 字符串,其余完全不变
D GA 模型一定比 preview 更差,不宜迁移
#

14. Realtime 会话的生命周期(connect、update、commit、close)

A 生命周期应作为状态机管理,connect 初始化、update 改配置、commit 提交输入、close 释放资源并清理凭证 ✓ 正确答案
B close 时无需释放音频设备与凭证
C connect 与 close 之间任意时刻都可随意跳转,无需状态约束
D commit 与 update 是同一概念,可互换
#

15. Realtime 模型如何管理音频输入/输出缓冲、VAD、轮次检测和工具调用事件的一致性

A 音频缓冲可无限增长,无需边界管理
B 工具调用事件与音频输出顺序无关,可乱序处理
C VAD 与轮次检测相互独立,无需对齐
D 通过事件序与 turn 边界管理输入/输出缓冲、VAD 提交与工具调用,保证各事件流顺序一致 ✓ 正确答案
#

16. Realtime 模型与“ASR→LLM→TTS”级联在延迟、可控性、可替换性和调试上如何比较

A 级联延迟一定低于端到端 Realtime
B 端到端可单独替换任意 ASR 段,可替换性更强
C 端到端延迟更低但中间不可见,级联可控可替换且便于按段调试,两者是延迟与可控性的权衡 ✓ 正确答案
D 级联没有任何可观测中间产物
#

17. Realtime 会话的 system prompt、tools 和 temperature 如何动态更新而不中断会话

A 通过 session.update 在轮次边界原子地更新 prompt、tools 与 temperature,无需中断会话 ✓ 正确答案
B temperature 无法在会话中修改,只能重建
C 更新 system prompt 必须断开连接重新建立会话
D 更新可以随时进行,即使模型正在生成也不影响
#

18. Realtime 模型支持的多模态输入(图像、文件、视频)如何传与会话上下文结合使用

A 图像上传后模型无法理解,只能存不能读
B 多模态输入无需上下文关联,独立处理即可
C 上传文件获得句柄后作为上下文内容引用传入会话,使模型可理解并支持工具结果以文件形式回流 ✓ 正确答案
D 文件无需校验来源与内容安全,直接使用
#

19. Realtime 会话的费用模型(音频输入/输出 Token、缓存、工具调用)

A 音频输入输出不计费,只有文本计费
B 缓存对成本没有影响,无需优化
C 工具调用免费,不消耗 token
D 音频按 token 当量计费,缓存命中的稳定前缀按折扣价计费,工具调用也计入 token 消耗 ✓ 正确答案
#

20. Realtime 模型如何处理 Function Calling 与音频输出的同步(先说话还是先返回工具结果)

A 先执行工具并拿到结果,再基于结果生成语音,避免先承诺后失败 ✓ 正确答案
B 工具结果与语音内容无需一致
C 模型应先口头承诺"好的",再执行工具
D 工具调用时不可播放任何音频
#

21. Azure Realtime、xAI Voice 等产品状态变化较快,架构文档应怎样记录核查日期与兼容层

A 用兼容层抽象供应商差异,并记录核查日期、状态与兼容约束,让业务与快速变化的产品解耦 ✓ 正确答案
B 供应商产品变化与业务无关,无需文档
C 文档应只写接入日期,不用记录核查日期
D 兼容层会锁死供应商,应避免抽象
#

22. Realtime 模型的工具调用结果如何在 UI 端展示,避免与音频输出脱节

A 工具结果应一次性全部显示,与音频无关
B 工具结果无需在 UI 展示,只播放音频即可
C 用事件序与时间戳把工具结果与对应语音轮次绑定,UI 随音频节奏渲染,避免脱节 ✓ 正确答案
D 工具结果显示与音频播放位置无关,可任意错位
#

23. Realtime 会话的并发上限、速率限制和排队策略如何设计

A 并发无需上限,资源充足即可
B 设置并发上限与速率限制,超限时排队并优雅降级到非实时模式,避免整体不可用 ✓ 正确答案
C 排队超时直接失败即可,无需降级
D 限流与并发无关,无需设计
#

24. Realtime 模型对端侧加密、HIPAA/SOC2 合规的处理能力如何评估

A 只要供应商知名就自动满足 HIPAA/SOC2
B 音频数据无需加密传输
C 合规与数据处置无关,只关注模型效果
D 需评估传输/存储加密、供应商合规认证(HIPAA/SOC2)、数据驻留与删除审计,缺口处以自有层补偿 ✓ 正确答案
#

25. Realtime 会话的可观测性(首音频、打断率、丢包率)如何采集与告警

A 在客户端与服务端埋点采集首音频、打断率、丢包率等指标,分位数聚合并设阈值告警关联会话 ID ✓ 正确答案
B 均值即可代表整体延迟,无需分位数
C 只需采集首音频延迟一个指标即可
D 告警无需关联会话 ID,只报数字即可
#

26. Realtime 场景下的 prompt injection 攻击如何防护(音频隐式指令、多模态越狱)

A 只需过滤文本输入,音频无需处理
B 音频中的指令无法被检测,只能放弃 Realtime
C 检测到注入后无需限权,继续正常处理即可
D 对音频转写与多模态内容做检测、内容指令分离、强 system prompt 隔离与输出护栏,形成纵深防御 ✓ 正确答案
#

27. 如何处理麦克风采集、VAD、ASR、模型推理和 TTS 的流水线背压,保持低延迟而不积压音频

A 缓冲应无界,保证一条不少
B 背压只影响文本,不影响音频
C 模型推理慢时应无限等待,不降级
D 用有界缓冲与丢弃/降级策略配合流式处理,避免积压并优先保证实时性与可懂度 ✓ 正确答案
#

28. LiveKit、Pipecat 等框架如何组织媒体与 Agent 管线,选型时应关注哪些可观测性和锁定问题

A 应关注框架是否暴露延迟与队列等可观测能力、是否锁定特定供应商、组件是否可替换 ✓ 正确答案
B 框架一定会永久锁死供应商,无法规避
C 框架越封装越好,可观测性不重要
D 选型只看功能多少,无需考虑迁移