1. Chrome Built-in AI(Gemini Nano)的能力,端侧 LLM 的 API 与限制?
Chrome Built-in AI(Gemini Nano)端侧 LLM 提供了哪些面向浏览器的 API?其能力边界与限制主要有哪些?
- Gemini Nano 在浏览器中的端侧部署方式与 API 家族(Prompt、Summarizer、Translator、Rewriter、Language Detector)
- 模型能力与上下文长度、token 上限等有限性
- 与云端大模型在能力、延迟、隐私上的差异
Chrome Built-in AI 将 Gemini Nano 这一小型端侧 LLM 通过 Chrome 内置的各类 API 暴露给 Web 开发者。核心 API 族包括 Prompt API(window.ai.languageModel)用于自由文本生成与对话、Summarizer API 用于摘要、Translator API 用于翻译、Rewriter API 用于改写、Language Detector API 用于语言检测,它们多通过异步的 capabilities()/availability() 探测设备支持情况。这些 API 在本地运行,无需联网即可推理,数据不出设备,隐私与离线能力是其核心价值。
答案限制与边界: 受限于端侧模型体积与算力,Gemini Nano 的上下文长度、maxTokens 上限与推理速度都远小于云端大模型,复杂推理与长文本生成能力有限;模型能力随浏览器版本分发,版本与行为不一致,需通过 availability() 检测并设计降级策略;部分 API 仍在实验阶段(origin trial),需要权限策略(Permissions Policy)约束,且首用需下载模型,占用 StorageManager 配额。
本题考察对 Chrome 内置 AI 能力全景的把握。回答应既说明 API 家族(体现知识广度),又强调端侧模型在上下文、token、速度、版本一致性上的硬限制,同时点出隐私与离线优势,体现"能力与限制"的辩证视角。