Computer Use API 与 GUI 自动化

共 31 题
#

1. 截图分辨率、缩放、滚动和窗口变化会怎样造成坐标偏移,执行前如何二次定位

A 截图坐标可以直接用于点击,无需考虑分辨率
B 滚动不影响坐标定位
C 应统一屏幕/视口/设备像素坐标系,并在执行前用 elementFromPoint 二次定位验证命中元素 ✓ 正确答案
D 窗口尺寸变化不影响元素位置
#

2. 桌面通知、系统对话框、文件选择器和跨应用拖放为什么是高失败区域

A 它们位于应用沙箱内,可用常规定位工具操作
B 文件选择器与普通输入框完全等价
C 坐标点击可稳定处理所有系统对话框
D 它们跨越到系统原生 UI 层,应优先用应用内 API、快捷键或专门工具替代,并设置人工接管 ✓ 正确答案
#

3. 模型误点后如何通过状态验证、撤销、重规划和人工接管恢复,而非继续盲点

A 应继续点击直到页面恢复正确
B 应按状态验证、撤销、重规划、人工接管依次恢复,避免在同一错误状态盲目操作 ✓ 正确答案
C 误操作后无需验证,直接重试
D 所有误操作都可自动撤销
#

4. 如何控制截图频率、动作轮次、模型成本和速率限制,同时维持任务成功率

A 为降成本应无限降低截图频率和轮次
B 速率限制只影响模型 API,不影响网页操作
C 应用增量截图、动作轮次上限、模型分级与限流平衡成本,同时用步骤预算和验证维持成功率 ✓ 正确答案
D 成本控制必然牺牲所有成功率
#

5. 系统对话框(UAC、sudo、密码输入)出现时为何应强制人工接管而非模型盲点

A 模型可以自由点击这些系统对话框
B 它们涉及系统级权限与认证,应强制人工接管而非模型盲点,并记录审计 ✓ 正确答案
C 盲点系统对话框没有安全风险
D 系统对话框在可访问性树内,模型可完全理解
#

6. 跨应用拖放、文件选择器、特殊控件(右键菜单)的成功率如何评估与提升

A 应优先用 API、快捷键、剪贴板等确定性路径替代,并建立独立评测集量化成功率 ✓ 正确答案
B 只能靠坐标点击完成
C 右键菜单与普通按钮完全相同
D 文件选择器无需特殊处理
#

7. 截图与坐标不一致时是否应回退到无障碍树以减低错误率

A 无障碍树与截图一样不确定
B 应继续依赖坐标点击
C 应回退到无障碍树/DOM 语义定位验证并纠正目标,坐标只负责最终执行 ✓ 正确答案
D 不一致时直接放弃任务
#

8. 不同屏幕分辨率/DPI 下坐标模型迁移的成本如何评估

A 绝对坐标在不同分辨率下天然通用
B 依赖绝对坐标迁移成本高,应优先用语义/相对定位并做多分辨率适配与评测来降低迁移成本 ✓ 正确答案
C 迁移成本与定位方式无关
D 只需重设窗口大小即可迁移
#

9. 跨设备(笔记本、外接显示器)切换时坐标定位与多显示器支持如何处理

A 所有显示器共享同一坐标原点
B 多显示器切换不影响坐标
C 应基于虚拟屏幕坐标与各显示器的范围、DPI、偏移计算,切换后重新校准并识别目标所在显示器 ✓ 正确答案
D 只需记录一个全局固定坐标即可
#

10. 多模态输入(截图 + DOM)与纯坐标输入在结果质量上如何权衡

A 纯坐标输入在质量上优于多模态
B 多模态提供语义理解但成本高,纯坐标成本低但易错,实践中常采用多模态理解加坐标执行的混合方案 ✓ 正确答案
C 多模态输入成本最低
D 纯坐标输入能理解页面语义
#

11. 截图分辨率与模型视觉识别精度之间的帕累托边界如何选定

A 分辨率越高一定越好,无需考虑成本
B 应通过成本—精度扫描找到帕累托前沿与收益拐点,按任务类型分级选择分辨率 ✓ 正确答案
C 分辨率与 Token 成本无关
D 低分辨率总能获得更高精度
#

12. Computer Use 与 Browser Use 在操作系统范围、坐标精度、可访问性树和沙箱面上有何差异

A 两者作用域完全相同
B Computer Use 的桌面可访问性树比浏览器更完整
C Browser Use 局限浏览器内、语义精度高、攻击面小;Computer Use 覆盖整个系统、依赖坐标、攻击面大 ✓ 正确答案
D Computer Use 坐标精度高于 Browser Use
#

13. Anthropic Computer Use 与 OpenAI Operator / Computer Use 在沙箱边界、模型版本、能力上差异是什么

A 两者在模型实现、沙箱运行环境(云端/本地)、能力侧重与成本上存在差异,且都应使用最新模型版本 ✓ 正确答案
B 两家都不支持截图观察
C 模型版本可以永远固定为旧 preview
D 两家实现完全相同
#

14. 国产 GUI Agent(Qwen2.5-VL、UI-TARS、AutoGLM)

A 它们都是纯文本模型
B 国产 GUI Agent 不支持视觉理解
C 三者完全等价
D Qwen2.5-VL 偏视觉底座,UI-TARS 偏专用 GUI 推理 Agent,AutoGLM 偏产品化 GUI 操作,定位与平台各有侧重 ✓ 正确答案
#

15. Computer Use 在 macOS、Windows、Linux 上的系统级访问(剪贴板、通知、文件系统)

A 应抽象平台无关的接口层处理剪贴板、通知、文件系统与权限差异,按平台实现适配 ✓ 正确答案
B 三个平台的系统 API 完全一致
C macOS 无需任何权限即可访问屏幕
D 剪贴板在三平台 API 相同
#

16. 各 Computer Use 模型 ID 与稳定性为何应按官方模型目录核查,而不写死旧 preview

A 应按官方目录核查当前可用模型 ID,配置化而非写死旧 preview,并监控弃用与版本变化 ✓ 正确答案
B preview 模型最适合生产长期使用
C 模型 ID 永远不变,可写死
D 模型 ID 与区域无关
#

17. GUI Agent 如何与传统 RPA 的选择器、录制流程和确定性规则形成混合方案

A 两者互斥,只能选其一
B RPA 无法处理稳定流程
C GUI Agent 应完全替换 RPA
D 确定性流程用 RPA 选择器与录制,Agent 处理变化与异常,并把稳定路径固化回 RPA ✓ 正确答案
#

18. GUI Agent 的“看—动”循环频率应如何控制,避免截图爆炸与模型过度推理

A 应仅在屏幕变化、决策点或动作后验证时截图,用差异检测与推理预算避免截图爆炸和过度推理 ✓ 正确答案
B 每步都应截图以获得最大准确率
C 截图频率越高越好
D 推理预算与循环频率无关
#

19. Computer Use 的“可观测性”应记录哪些操作(截图、操作类型、坐标、结果)

A 应记录截图、操作类型、坐标、结果与上下文,并脱敏敏感输入,支撑回放、审计与性能分析 ✓ 正确答案
B 只需记录操作类型即可
C 坐标与结果无需记录
D 可观测性记录应包含明文密码
#

20. 为什么 Computer Use 仍需 OCR/视觉模型的辅助做控件识别,模型推理有局限吗

A 通用模型能精确识别所有像素级控件,无需辅助
B 通用模型擅长规划,但精确识别密集控件有局限,需 OCR/视觉模型提供精确文本与控件边界 ✓ 正确答案
C OCR 会降低识别精度
D 视觉模型不适用于 GUI 识别
#

21. Computer Use 的成本控制,模型调用 + 截图 + 视觉推理如何在预算内完成长任务

A 应对截图、模型调用、视觉推理分别优化(增量、裁剪、分级、压缩、预算),在预算内完成长任务 ✓ 正确答案
B 只用强模型就能控制成本
C 视觉推理成本与模型无关
D 长任务成本不可避免,无法控制
#

22. Computer Use 任务失败时如何保存“最终状态截图”以便用户接管

A 失败时无需保存任何状态
B 应保存失败截图、动作序列、失败原因与任务上下文,并脱敏敏感信息,形成可交接的用户接管包 ✓ 正确答案
C 只需保存失败原因文本
D 接管包无需包含当前界面状态
#

23. Anthropic Computer Use、OpenAI Computer Use、Qwen2.5-VL 观察—动作循环的差异

A OpenAI Computer Use 不依赖截图
B 三家实现完全一致
C Qwen2.5-VL 不支持截图观察
D 三家都遵循观察—动作—验证,但 Anthropic 偏工具化、OpenAI 偏云端目标驱动、Qwen2.5-VL 偏可集成视觉底座 ✓ 正确答案
#

24. GUI Agent 与传统 RPA 在工具成熟度、稳定性、生态上有何互补

A RPA 比 GUI Agent 更擅长适应动态页面
B GUI Agent 已完全取代 RPA 生态
C 两者在成熟度上相同
D RPA 成熟稳定、生态完善但难适应变化,GUI Agent 泛化强但较新,两者按稳定性分层互补 ✓ 正确答案
#

25. GUI Agent 是否应被允许在生产环境直接修改业务系统数据而不仅是只读操作

A 应默认允许 Agent 直接修改生产数据
B 只读操作可自动执行,写操作分级授权并强制审批,高风险操作需人工确认与审计 ✓ 正确答案
C 生产数据修改不可逆,因此不应考虑任何写操作
D 写操作无需审批,因为模型很智能
#

26. GUI Agent 的目标检测和 OCR 结果应如何缓存以减少重复视觉推理成本

A 每次操作都要重新做视觉推理
B 缓存永不失效最好
C 应以界面区域为键缓存检测/OCR 结果,用差异检测驱动失效,未变化时复用以降低推理成本 ✓ 正确答案
D 视觉推理成本无法通过缓存降低
#

27. Computer Use 中点击“关闭”按钮与“确认”按钮的风险如何区分

A 关闭按钮风险更高
B 两者风险相同,无需区分
C 应结合按钮文本、可访问性语义与弹窗上下文识别风险,对 Delete/Confirm 等高危按钮施加额外确认与审计 ✓ 正确答案
D 所有按钮都可直接点击
#

28. Computer Use 模型对弹窗、悬浮层等临时元素的处理稳定性如何测试

A 弹窗不影响 GUI 操作,无需测试
B 应设计含各类弹窗与时序临时元素的测试集,验证检测、决策、时序处理与误操作率 ✓ 正确答案
C 所有弹窗都自动关闭即可
D 临时元素稳定性与任务无关
#

29. GUI Agent 在长任务下应如何分层策略,高层规划、低层动作验证

A 长任务无需分层,单层即可
B 低层不需要验证
C 高层应处理所有低层细节
D 高层负责任务分解与规划,低层负责精确执行与每步验证,通过状态协议衔接以保持长任务一致 ✓ 正确答案
#

30. Computer Use 如何与 Browser Use 形成互补(桌面 vs 浏览器场景分工)

A 两者完全替代
B Browser Use 更擅长桌面应用操作
C Computer Use 应覆盖所有网页任务
D 浏览器内任务优先用 Browser Use,桌面/系统任务用 Computer Use,跨域任务协同完成 ✓ 正确答案
#

31. Computer Use 在盲人或低视力用户辅助场景中应如何设计可访问性

A 只需提供更大的屏幕截图即可
B 应以无障碍树、OCR 文本与语音描述等非视觉信息为核心,并支持键盘导航、语音控制等辅助交互 ✓ 正确答案
C 视觉识别能力足够强时就无需其他输出方式
D 可访问性设计只影响界面样式,不影响功能