端侧设备与云边协同

共 24 题
📑 题目列表 24 题
#
★★★

1. 云端主模型加端侧小模型的混合架构如何进行任务路由、结果合并和失败回退

说明云端主模型加端侧小模型的混合架构如何进行任务路由、结果合并和失败回退?

  • 理解混合架构
  • 理解任务路由、结果合并、失败回退
  • 能设计混合推理

任务路由:按任务特征(复杂度、延迟敏感、隐私、网络状态)决定由端侧还是云端处理——简单/隐私敏感/需低延迟用端侧小模型,复杂/需强能力用云端主模型。结果合并:当端侧与云端都参与时,合并结果需协调——端侧预处理结果 + 云端精修结果,或端侧出候选 + 云端确认/重排,用"置信度/一致性"决定最终采用。失败回退:端侧失败(模型不支持、设备算力不足)回退到云端;云端失败(网络、Provider 故障)回退到端侧或降级;双失败则返错/排队。回退要保证"结果仍可用"(端侧给部分结果或云端缓存)。核心是"按任务路由端/云、合并时协调置信度、失败时分层回退(端→云、云→端、双失败兜底)"。

混合架构要处理"谁做、怎么合、挂了怎么办"。路由按任务特征,合并靠置信度协调,回退分级保可用。三环节缺一不可。

#
★★★

2. 云边协同的任务路由如何按延迟、隐私、网络状态和模型能力动态决策,策略如何配置

说明云边协同的任务路由如何按延迟、隐私、网络状态和模型能力动态决策,以及策略如何配置?

  • 理解动态路由的多维因素
  • 理解策略配置
  • 能设计路由决策

动态决策因素:延迟——端侧响应快,对延迟敏感任务优先端侧;隐私——敏感数据必须端侧,不离开设备;网络状态——离线/弱网走端侧,网络好可云侧;模型能力——任务所需能力端侧模型是否具备,不具备则升级云端。策略配置:路由策略做成可配置规则(按任务类型/敏感度/网络阈值/延迟预算),支持动态调整;用"能力矩阵 + 网络状态 + 敏感度"组合判定;策略可灰度(按用户/设备比例)。决策流程:先查隐私(敏感→端侧强制),再查网络(离线→端侧),再查能力(端侧能满足→端侧,否则云侧),最后按延迟/成本权衡。核心是"按隐私+网络+能力+延迟动态路由,策略做成可配置规则,灰度发布"。

路由是"多条件组合判定",隐私与网络是硬约束,能力与延迟是软权衡。策略可配置、可灰度,随设备/网络状态动态变化。

#
★★

3. Apple Foundation Models 与 Gemini Nano 的设备能力如何探测、声明和回退(不支持时如何路由到云)

说明 Apple Foundation Models 与 Gemini Nano 的设备能力如何探测、声明和回退(不支持时如何路由到云)?

  • 理解端侧模型能力探测
  • 理解能力声明
  • 理解回退到云

探测:通过系统 API 检测设备是否支持内置模型(如 Apple/Google 的模型可用性接口),检查设备型号、OS 版本、内存、模型是否已下载/可用。声明:根据探测结果声明"端侧能力"(支持哪些任务、模型是否可用),用于路由决策。回退:端侧模型不支持或不可用时,路由到云端——把请求、上下文按云格式组装,走云侧主模型;回退要处理"能力差异"(端侧支持的任务云侧可能不支持或反之)、上下文传输(脱敏后上云)、用户体验(延迟/质量的提示)。核心是"通过系统 API 探测端侧模型可用性、声明能力矩阵、不支持时回退到云端路由"。

端侧模型是否可用取决于设备。探测(系统 API)+ 声明(能力矩阵)+ 回退(路由到云)是标准流程,回退需处理能力差异与上下文传输。

#
★★

4. 离线请求恢复联网后,怎样决定复用端侧结果、云端复核或重新生成

说明离线请求恢复联网后,怎样决定复用端侧结果、云端复核或重新生成?

  • 理解离线结果的采用决策
  • 理解复核/重生成
  • 能设计决策

决策依据:一是任务重要性——低风险任务(简单问答、摘要)离线端侧结果可复用;高风险任务(决策、财务)需云端复核;二是端侧结果质量——置信度高且任务确定可复用,低置信需云端复核;三是成本与一致性——复用省 token,但高价值任务值得重生成。策略:低风险+高置信→复用端侧结果;高风险或低置信→云端复核(云端检视/修正端侧结果);需要最新/最强→重新生成(云端重跑)。恢复联网后对比端侧结果与云端结果,若一致复用,不一致视重要度决定。核心是"按任务重要性+置信度决定复用/复核/重生成,低风险高置信复用、高风险低置信云端复核或重生成"。

离线结果恢复联网后要"决定是否重做"。复用省成本,复核提质量,重生成保准确。按"重要性 × 置信度"三选一,并用一致性对比辅助。

#
★★

5. 端侧个性化数据如何保持本地,哪些摘要可在获得授权后发送云端

说明端侧个性化数据如何保持本地,哪些摘要可在获得授权后发送云端?

  • 理解隐私分层
  • 理解授权与最小化
  • 能设计本地保留与上云

保持本地:用户的敏感个性化数据(个人信息、行为、对话原文)默认在端侧处理、存储,不上传——端侧模型直接基于本地数据个性化,隐私不出设备。可发送云端的摘要:不含 PII 的聚合/特征摘要(用户的偏好类别、统计特征、非敏感洞察),且必须获得用户授权。授权:明确告知"要上传什么、用于什么",用户同意后才上传;做最小化——只上传完成任务所需的最小非敏感信息,脱敏处理。设计:本地处理个性化(端侧模型),云端只接触"脱敏后的摘要/特征",在授权范围内。核心是"敏感数据本地保留处理,非敏感摘要/特征最小化上报且需授权,脱敏后上云"。

隐私原则是"敏感数据不出设备,非敏感摘要最小化"。授权 + 脱敏 + 最小化保证个性化可用又不泄露隐私。云端只碰脱敏特征。

#
★★

6. 离线推理结果恢复联网后如何决定复核、重生成或直接采用,避免重复请求浪费 Token

说明离线推理结果恢复联网后如何决定复核、重生成或直接采用,避免重复请求浪费 Token?

  • 理解离线结果的采用
  • 理解避免重复请求
  • 能设计决策

决策:恢复联网后,为离线结果决定——直接采用、云端复核、重生成。为避免浪费 token:低风险/高置信/任务确定→直接采用(不重复请求,省 token);需要更高确信→云端复核(用校验而非全量重生成,省 token);确实需要新结果→重生成(可控次数)。避免重复的关键:对"可复用"结果不重复请求;用"复核(轻量校验)"替代"全量重生成";对已确认一致的结果用缓存。核心是"按重要性/置信度决定采用/复核/重生成,用复核替代全量重生成、可复用不重复请求,避免浪费 token"。

避免 token 浪费的关键是"不重复无用请求"。能复用就复用,需验证用轻量复核,确需新结果才重生成,配合缓存与去重。

#
★★

7. 端侧个性化数据如何通过差分隐私或本地 Embedding 在不上传原数据的前提下增强个性化

说明端侧个性化数据如何通过差分隐私或本地 Embedding 在不上传原数据的前提下增强个性化?

  • 理解差分隐私
  • 理解本地 Embedding
  • 理解隐私增强个性化

差分隐私:在端侧对聚合数据加噪声(差分隐私机制),使上传的统计信息不泄露个体,同时保持统计效用,用于"在不泄露个体数据的前提下增强个性化/聚合"。本地 Embedding:在端侧把个性化数据用本地 Embedding 模型转成向量,只上传向量(不传原文),向量本身不可逆推原文,用于检索/匹配的个性化。增强个性化:端侧用本地模型基于本地数据做个性化推理;上传"差分隐私加噪的统计"或"本地 Embedding 向量"用于云端聚合/匹配,而不上传原始数据。设计:隐私保护(差分隐私/本地 Embedding)与个性化(本地推理 + 脱敏向量)结合,保证"个性化可用、原数据不上传"。核心是"用差分隐私加噪统计或本地 Embedding 向量代替原始数据,在不上传原数据的前提下增强个性化"。

隐私增强个性化的核心是"用替代表示(加噪统计/向量)代替原始数据"。差分隐私保统计效用,本地 Embedding 保语义可用,两者都不泄露原文。

#
★★

8. 系统内置模型升级(iOS/Android OS 升级)如何不影响应用主流程,避免 API 变更导致崩溃

说明系统内置模型升级(iOS/Android OS 升级)如何不影响应用主流程,避免 API 变更导致崩溃?

  • 理解系统模型升级的风险
  • 理解 API 兼容处理
  • 能设计防御

系统模型升级风险:OS 升级可能改变内置模型 API、模型行为、能力,导致应用崩溃或行为异常。防御:一是能力探测——每次运行时探测系统模型 API 的可用性与版本,不假设 API 存在;二是降级——系统模型 API 不可用/变化时,降级到云侧模型或自备模型,不阻塞主流程;三是兼容层——对系统模型 API 做适配层,把系统 API 变化隔离在兼容层,应用逻辑不直接依赖;四是崩溃保护——调用系统模型用 try/catch/超时,异常不导致应用崩溃;五是灰度——检测系统版本,按版本适配。核心是"探测系统模型 API、降级到云/自备、兼容层隔离、异常保护,避免 API 变更崩溃"。

系统模型是"外部依赖",升级不可控。应用要通过探测、降级、兼容层、异常保护,把系统 API 变化隔离,保证主流程稳定。

#
★★

9. 设备碎片化下如何设计最低能力矩阵、灰度开关和崩溃保护

说明设备碎片化下如何设计最低能力矩阵、灰度开关和崩溃保护?

  • 理解设备碎片化
  • 理解最低能力矩阵、灰度、崩溃保护
  • 能设计兼容

设备碎片化:不同设备型号、OS 版本、内存、端侧模型支持差异大。设计:最低能力矩阵——定义"支持该功能所需的最低设备能力"(模型、内存、OS 版本),低于则禁用/降级该功能;灰度开关——新功能按设备/用户比例灰度,观察崩溃率/性能再放量;崩溃保护——调用端侧模型加异常捕获、超时、降级,崩溃不阻塞主流程;能力协商——按设备能力声明功能可用性。三者结合:能力矩阵决定"哪些设备可用",灰度决定"何时放量",崩溃保护决定"挂了怎么办"。核心是"最低能力矩阵过滤不支持设备、灰度开关控制放量、崩溃保护兜底,兼容碎片化"。

碎片化要"按能力适配"。能力矩阵做门槛,灰度做渐进,崩溃保护做兜底。三者配合让功能在异构设备上可用且稳定。

#
★★

10. 系统内置模型能力和设备支持变化时,产品为何要按官方能力清单动态探测

说明系统内置模型能力和设备支持变化时,产品为何要按官方能力清单动态探测?

  • 理解能力清单与动态探测
  • 理解能力变化
  • 能设计动态适配

原因:系统内置模型的能力与设备支持会随 OS 升级、设备型号、区域变化,且 Provider 会更新能力清单(如新增模型、调整能力、弃用)。若应用写死"支持某能力",能力变化时会导致功能失效或行为异常。动态探测:按官方能力清单(系统 API 返回的能力声明)在运行时探测实际能力,而不是依赖硬编码假设;据探测结果声明能力矩阵、启用/降级功能。这样能力变化时应用能自适应(支持则启用、不支持则降级到云),避免"写死能力导致上线即崩"。核心是"按官方能力清单动态探测实际能力,自适应启用/降级,避免写死能力假设"。

端侧能力是动态的(随升级/设备/区域变化)。动态探测把"写死假设"变成"运行时感知",能力变化时自适应,是防漂移的关键。

#
★★

11. 端侧 + 云端混合推理的成本、隐私、能耗如何综合评估,用户透明度如何设计

说明端侧 + 云端混合推理的成本、隐私、能耗如何综合评估,以及用户透明度如何设计?

  • 理解成本、隐私、能耗评估
  • 理解混合推理
  • 理解用户透明度

综合评估:成本——端侧无 token 成本但耗设备资源,云端按 token 计费,混合时按"端侧任务占比"评估总成本;隐私——端侧处理保护隐私、云端处理有数据上云风险,按任务敏感度评估;能耗——端侧推理耗设备电量,云端靠网络传输与服务器,评估对设备续航的影响。三者的权衡:用端侧保隐私/省 token 但耗电量,用云端能力强但费 token 与隐私。用户透明度:告知用户"哪些任务在设备端处理、哪些会上云、上传了什么、用于什么";提供隐私偏好设置(是否允许上云);对云端处理给出明确提示。核心是"从成本/隐私/能耗三维评估混合推理,向用户透明披露处理位置与上传内容并给偏好设置"。

混合推理要权衡成本、隐私、能耗三方面,端侧与云端各有取舍。用户透明度要让用户知道"数据去哪了、钱花在哪",并给偏好控制。

#
★★

12. 端侧模型输出与云端基线如何做持续回归,系统模型 OTA 升级后如何用同一评估集检测质量漂移

说明端侧模型输出与云端基线如何做持续回归,系统模型 OTA 升级后如何用同一评估集检测质量漂移?

  • 理解端侧 vs 云端基线回归
  • 理解 OTA 升级漂移检测
  • 能设计评估

持续回归:用同一评估集分别跑端侧模型与云端基线,对比输出质量(准确率、指令遵循、一致性),监控端侧 vs 云端的差距;差距在阈值内可接受,超阈值告警。OTA 升级漂移检测:系统模型 OTA 升级后,端侧模型行为可能变化——用同一评估集在升级前后跑,对比质量指标,检测漂移(质量下降、行为变化);漂移则告警、降级到云或回退。关键:评估集固定(同一批题)、参数固定、记录版本;端侧与云端统一评估口径,便于对比。核心是"用同一评估集持续对比端侧 vs 云端基线,OTA 升级后用同评估集检测质量漂移并告警/降级"。

端侧质量要"锚定云端基线"持续对比。OTA 升级可能改变端侧行为,用同一评估集做前后对比,检测漂移并处理。固定评估集是前提。

#
★★

13. 如何用代表性设备矩阵(旗舰、中端、入门)持续测试首响应、Token 速度和能耗

说明如何用代表性设备矩阵(旗舰、中端、入门)持续测试首响应、Token 速度和能耗?

  • 理解设备矩阵
  • 理解性能与能耗指标
  • 能设计持续测试

设备矩阵:选取代表性设备(旗舰、中端、入门)覆盖不同算力/内存/端侧模型支持。持续测试:在矩阵设备上持续跑基准——首响应(首个 token 延迟)、Token 速度(生成速率,token/s)、能耗(每 token 耗电/电池影响);采集指标并对比不同档位设备的差异;监控端侧模型在不同设备上的可用性。测试要自动化(CI/设备实验室)、按版本/升级回归(系统升级、模型升级后重跑)。目标:保证旗舰体验好、中端可用、入门不崩溃,并优化性能与能耗。核心是"用旗舰/中端/入门设备矩阵持续测试首响应、Token 速度、能耗,按版本回归"。

端侧性能依赖设备档位。设备矩阵覆盖异构,持续测试性能与能耗,按版本回归,保证全档位可用且优化。

#
★★

14. 端侧推理的崩溃保护与降级路径如何设计,避免一次模型错误导致整个 App 卡死

说明端侧推理的崩溃保护与降级路径如何设计,避免一次模型错误导致整个 App 卡死?

  • 理解崩溃保护
  • 理解降级路径
  • 能设计隔离

崩溃保护:把端侧模型调用隔离在独立进程/线程/沙箱,用超时、异常捕获、内存限制防止模型错误影响主进程;模型异常不阻塞主流程。降级路径:端侧模型失败/超时/OOM 时——降级到云端模型,或返回部分结果/提示,或回退到缓存/规则;降级要可配置、可回退。设计要点:模型在独立进程运行(崩溃不拖垮 App);调用设超时;异常捕获兜底;监控崩溃率与失败率,异常告警。核心是"模型隔离(独立进程/沙箱)+ 超时 + 异常捕获 + 降级到云/缓存/提示,避免模型错误卡死 App"。

避免"模型错误卡死 App"的关键是"隔离 + 兜底"。模型在隔离环境跑,超时与异常捕获,失败降级到云/缓存,主进程永不被模型拖垮。

#
★★

15. 端侧模型安全更新(签名、热补丁)如何不依赖应用商店发布,支持紧急修复

说明端侧模型安全更新(签名、热补丁)如何不依赖应用商店发布,支持紧急修复?

  • 理解安全更新机制
  • 理解签名与热补丁
  • 能设计安全更新

端侧模型更新需不依赖应用商店(发布慢、审核慢),支持紧急修复。机制:一是在线拉取模型——通过自有 CDN/服务下发模型更新,不经过应用商店;二是签名校验——模型文件必须签名(数字签名),端侧校验签名与完整性(哈希),防篡改/恶意注入;三是版本管理——端侧记录模型版本,服务端下发新版本,支持灰度与回滚;四是热补丁——对模型/配置做增量更新或热替换,无需整包更新;五是安全——更新通道加密、校验签名链、防中间人。核心是"模型通过自有通道在线更新 + 数字签名/哈希校验 + 版本灰度回滚 + 热补丁,不依赖应用商店且安全"。

紧急修复要求"绕过应用商店、快速下发"。核心是"自有分发通道 + 签名校验(防篡改)+ 版本管理(灰度/回滚)+ 热更新"。安全是重点。

#
★★

16. 端云协同的隐私保护模式(端侧推理、云端仅取聚合统计)应如何在不跨设备更新参数的前提下完成个性化

说明端云协同的隐私保护模式(端侧推理、云端仅取聚合统计)应如何在不跨设备更新参数的前提下完成个性化?

  • 理解端侧推理 + 云端聚合统计
  • 理解不跨设备更新参数
  • 能设计隐私个性化

模式:端侧推理——个性化在设备端完成,模型在本地基于用户数据推理,数据不出设备;云端仅取聚合统计——云端只接收聚合/脱敏后的统计(如差分隐私加噪的分布、类别统计),不接触个体数据。不跨设备更新参数的个性化:个性化参数/模型在端侧本地训练/微调(基于本地数据),不依赖"跨设备参数聚合";云端可提供"全局基线/聚合先验"(非个体),端侧结合本地做个性化。这样个性化"本地完成、云端只给聚合辅助",不把个体数据或参数跨设备传播。核心是"端侧推理 + 本地个性化、云端只取聚合统计作辅助,个体数据与参数不出设备"。

隐私个性化要"个性化在本地、云端只碰聚合"。端侧本地训练/适配,云端给聚合先验,不跨设备传播参数与个体数据。

#
★★

17. 手机端小模型与云端 GPT-5 协同推理时,如何按任务敏感度、复杂度和网络状态动态路由

说明手机端小模型与云端 GPT-5 协同推理时,如何按任务敏感度、复杂度和网络状态动态路由?

  • 理解协同路由因素
  • 理解动态路由
  • 能设计路由

路由因素:敏感度——敏感数据(隐私)强制端侧;复杂度——任务需强能力(复杂推理、多跳)用云端 GPT-5,简单任务(分类、摘要)端侧;网络状态——离线/弱网走端侧,网络好可用云端。动态路由决策:先查敏感度(敏感→端侧强制),再查网络(离线→端侧),再查复杂度(端侧够用→端侧,需强能力→云端),最后按延迟/成本权衡。策略可配置:按任务类型、敏感度、复杂度阈值、网络条件配置路由规则,灰度发布。协同:端侧做轻量/预处理,云端做复杂,结果按需合并。核心是"按敏感度(硬约束)+复杂度(能力需求)+网络(可用性)动态路由,端侧轻任务、云端强任务"。

端云协同路由是"多条件组合",敏感度与网络是硬约束,复杂度决定能力需求。按规则动态路由,让端侧与云端各司其职。

#
★★

18. 云边协同传输上下文前,怎样执行本地脱敏、最小化上传和用户授权,避免隐私数据离开设备

说明云边协同传输上下文前,怎样执行本地脱敏、最小化上传和用户授权,避免隐私数据离开设备?

  • 理解脱敏、最小化、授权
  • 理解隐私保护
  • 能设计上传流程

上传前流程:一是本地脱敏——在设备端对上下文做脱敏处理(掩码 PII、移除敏感内容、匿名化),只保留完成任务所需信息;二是最小化上传——只上传完成任务所需的最小上下文,去除无关敏感内容;三是用户授权——明确告知"上传什么、用于什么",获得用户同意后才上传;四是加密——上传通道加密,传输安全。目标:让隐私数据"尽量不出设备",必须上云时只上传"脱敏、最小化、经授权"的内容。设计:脱敏规则 + 最小化策略 + 授权流程 + 加密传输,作为上传前必经步骤。核心是"上传前本地脱敏 + 最小化 + 用户授权 + 加密,避免隐私数据离开设备"。

避免隐私离开设备的关键是"上传前净化"。脱敏去敏感、最小化减内容、授权保知情、加密保传输。四步作为上传必经流程。

#
★★

19. 设备离线时 Agent 的工具能力会变化,系统如何声明能力、缓存任务并在重新联网后安全续接

说明设备离线时 Agent 的工具能力会变化,系统如何声明能力、缓存任务并在重新联网后安全续接?

  • 理解离线时工具能力变化
  • 理解能力声明与任务缓存
  • 理解联网续接

离线时工具能力变化:部分工具依赖网络(在线查询、外部 API)离线不可用,只有本地工具可用。系统处理:一是能力声明——离线时动态声明"当前可用工具集"(去掉网络依赖工具),让 Agent 基于可用工具工作;二是缓存任务——离线中生成的 Agent 任务(含工具调用链、中间结果)缓存到本地;三是联网续接——重新联网后,把缓存的任务恢复,重新声明可用工具(网络工具恢复),续接未完成部分;四是安全续接——对可能已执行/变化的工具做幂等与校验,避免重复执行或状态错位。核心是"离线时动态声明可用工具、缓存任务中间态、联网后恢复并安全续接(幂等校验)"。

离线时 Agent 能力收缩(网络工具不可用)。要"动态声明可用工具 + 缓存任务 + 联网续接",续接要处理幂等与状态,避免重复/错位。

#
★★

20. 端侧推理的准确率与云端模型差异如何用同一评估集和隐私约束进行可比测量

说明端侧推理准确率与云端模型的差异如何用同一评估集和隐私约束进行可比测量?

  • 理解同一评估集对比
  • 理解隐私约束
  • 能设计可比测量

可比测量:用同一评估集(同一批题、同一指标)分别在端侧与云端跑,对比准确率、错误率等,使端云差异可量化。隐私约束:评估集可能含敏感数据,不能直接上传云端评测——需在设备端本地跑评估(端侧评测本地完成),云端用"脱敏/聚合"的评估结果对比,或用一个去敏的评估集上传云端。设计:端侧在本地用评估集跑并记录指标;云端用同样的评估集(或脱敏版本)跑;对比差异,注意"评估集相同"才能可比;隐私敏感样本留在本地,只上报聚合指标。核心是"同一评估集分别端侧/云端评测,隐私敏感样本本地评测只上报聚合指标,保证可比且不泄露"。

端云对比要"同一评估集 + 同一指标"才可比。隐私约束下,敏感样本在本地评测、只上报聚合指标,脱敏样本可上云,保证可比性与隐私。

#

21. 云端 Provider 故障时,边缘模型应返回部分结果、排队等待还是拒答,怎样制定一致的产品策略

说明云端 Provider 故障时,边缘模型应返回部分结果、排队等待还是拒答,如何制定一致的产品策略?

  • 理解边缘降级选项
  • 理解一致的产品策略
  • 能设计决策

云端故障时边缘模型的处理选项:返回部分结果——边缘能给出部分/降级结果(即时但质量降);排队等待——把请求缓存,云端恢复后处理(质量好但延迟);拒答——明确告知不可用(诚实但拒绝服务)。策略制定:按任务重要性与紧急度——紧急且边缘可处理→返回部分结果;非紧急且需高质量→排队等待;无法处理或高风险→拒答并告知。一致性:策略要统一(按任务类型/阈值一致判定),并对用户透明告知"降级/排队/拒答"及其原因。核心是"按任务紧急度与边缘能力一致决定部分结果/排队/拒答,并透明告知用户,策略统一可配置"。

云端故障时,边缘是"降级出口"。决定"部分结果/排队/拒答"要按任务紧急度与边缘能力,且策略一致、对用户透明,避免不一致体验。

#

22. 端侧 Agent 工具集裁剪与声明式能力协商如何设计,设备不支持某工具时的降级话术与替代路径如何表达

说明端侧 Agent 工具集裁剪与声明式能力协商如何设计,以及设备不支持某工具时的降级话术与替代路径如何表达?

  • 理解工具集裁剪
  • 理解声明式能力协商
  • 理解降级表达

工具集裁剪:端侧 Agent 按设备能力裁剪工具集——只向模型暴露设备支持的本地工具,移除不支持的工具,避免模型调用不可用工具。声明式能力协商:端侧声明"可用工具集 + 能力描述",模型基于声明选择工具;工具可用性变化时更新声明。降级表达:设备不支持某工具时——向用户说明"该功能当前设备不可用",提供替代路径(如"改用云端执行该工具"或"换一种方式");话术要诚实、可行动;替代路径要明确(降级到云端/跳过/简化)。核心是"按设备能力裁剪工具集、声明式协商可用工具,不支持的工具用诚实话术+替代路径降级表达"。

端侧 Agent 要"按能力裁剪工具",避免模型调不可用工具。降级要"诚实告知 + 给替代路径",声明式协商让能力变化自适应。

#

23. 端侧评估结果的采样上报策略如何设计,既不上传敏感输入又能度量设备级质量分布

说明端侧评估结果的采样上报策略如何设计,既不上传敏感输入又能度量设备级质量分布?

  • 理解采样上报
  • 理解隐私保护
  • 能设计质量分布度量

采样上报:端侧对评估结果做采样上报(只上报部分样本的聚合指标,非全部),既能度量质量分布又控制带宽与隐私。隐私保护:不上传敏感输入——只上报"脱敏后的评估指标"(如任务类型、输出是否成功、质量分数、延迟),不包含输入内容;对敏感样本只聚合不上传个体。度量设备级质量分布:按设备型号/OS/区域聚合上报的指标,得到"设备级质量分布"(各档位设备的质量、成功率、延迟),用于发现设备差异。设计:采样率控制(如 5%)、聚合上报(只报统计)、脱敏(不泄露输入)、按设备维度聚合。核心是"采样 + 聚合 + 脱敏上报,只报统计指标不报敏感输入,度量设备级质量分布"。

上报要"度量质量分布"但"不泄露输入"。用采样(控量)+ 聚合(只报统计)+ 脱敏(不报输入),按设备维度汇聚,得到设备级质量画像。

#

24. 如何让端侧语音、OCR 或 Embedding 先完成预处理,再把必要结果发送到云端以降低带宽

说明如何让端侧语音、OCR 或 Embedding 先完成预处理,再把必要结果发送到云端以降低带宽?

  • 理解端侧预处理
  • 理解必要结果上传
  • 能设计带宽优化

端侧预处理:语音——端侧先做语音识别(ASR)转成文本,或降噪/压缩,只传文本或压缩特征;OCR——端侧先做文字识别,只传识别文本而非整张图片;Embedding——端侧先做向量化,只传向量而非原始文本/多媒体。降低带宽:把"大体积原始数据"(音频、图片、长文本)在端侧转成"小体积结果"(文本、向量、压缩特征)再上传,显著降低带宽。设计:端侧用本地模型做预处理(识别/向量化),上传"必要结果"(下游所需的最小信息),云端做后续强处理。权衡:端侧预处理用本地模型(省带宽、保隐私),但增加端侧计算与能耗。核心是"端侧用语音识别/OCR/Embedding 预处理,把原始数据转成文本/向量等小结果上传,降带宽保隐私"。

降带宽的关键是"避免上传原始大文件"。端侧预处理把语音/图片/长文转成文本/向量等小结果,只传必要结果,省带宽且保隐私。