# 1. 截图分辨率、缩放、滚动和窗口变化会怎样造成坐标偏移,执行前如何二次定位 A 截图坐标可以直接用于点击,无需考虑分辨率 B 滚动不影响坐标定位 C 应统一屏幕/视口/设备像素坐标系,并在执行前用 elementFromPoint 二次定位验证命中元素 ✓ 正确答案 D 窗口尺寸变化不影响元素位置
# 2. 桌面通知、系统对话框、文件选择器和跨应用拖放为什么是高失败区域 A 它们位于应用沙箱内,可用常规定位工具操作 B 文件选择器与普通输入框完全等价 C 坐标点击可稳定处理所有系统对话框 D 它们跨越到系统原生 UI 层,应优先用应用内 API、快捷键或专门工具替代,并设置人工接管 ✓ 正确答案
# 3. 模型误点后如何通过状态验证、撤销、重规划和人工接管恢复,而非继续盲点 A 应继续点击直到页面恢复正确 B 应按状态验证、撤销、重规划、人工接管依次恢复,避免在同一错误状态盲目操作 ✓ 正确答案 C 误操作后无需验证,直接重试 D 所有误操作都可自动撤销
# 4. 如何控制截图频率、动作轮次、模型成本和速率限制,同时维持任务成功率 A 为降成本应无限降低截图频率和轮次 B 速率限制只影响模型 API,不影响网页操作 C 应用增量截图、动作轮次上限、模型分级与限流平衡成本,同时用步骤预算和验证维持成功率 ✓ 正确答案 D 成本控制必然牺牲所有成功率
# 5. 系统对话框(UAC、sudo、密码输入)出现时为何应强制人工接管而非模型盲点 A 模型可以自由点击这些系统对话框 B 它们涉及系统级权限与认证,应强制人工接管而非模型盲点,并记录审计 ✓ 正确答案 C 盲点系统对话框没有安全风险 D 系统对话框在可访问性树内,模型可完全理解
# 6. 跨应用拖放、文件选择器、特殊控件(右键菜单)的成功率如何评估与提升 A 应优先用 API、快捷键、剪贴板等确定性路径替代,并建立独立评测集量化成功率 ✓ 正确答案 B 只能靠坐标点击完成 C 右键菜单与普通按钮完全相同 D 文件选择器无需特殊处理
# 7. 截图与坐标不一致时是否应回退到无障碍树以减低错误率 A 无障碍树与截图一样不确定 B 应继续依赖坐标点击 C 应回退到无障碍树/DOM 语义定位验证并纠正目标,坐标只负责最终执行 ✓ 正确答案 D 不一致时直接放弃任务
# 8. 不同屏幕分辨率/DPI 下坐标模型迁移的成本如何评估 A 绝对坐标在不同分辨率下天然通用 B 依赖绝对坐标迁移成本高,应优先用语义/相对定位并做多分辨率适配与评测来降低迁移成本 ✓ 正确答案 C 迁移成本与定位方式无关 D 只需重设窗口大小即可迁移
# 9. 跨设备(笔记本、外接显示器)切换时坐标定位与多显示器支持如何处理 A 所有显示器共享同一坐标原点 B 多显示器切换不影响坐标 C 应基于虚拟屏幕坐标与各显示器的范围、DPI、偏移计算,切换后重新校准并识别目标所在显示器 ✓ 正确答案 D 只需记录一个全局固定坐标即可
# 10. 多模态输入(截图 + DOM)与纯坐标输入在结果质量上如何权衡 A 纯坐标输入在质量上优于多模态 B 多模态提供语义理解但成本高,纯坐标成本低但易错,实践中常采用多模态理解加坐标执行的混合方案 ✓ 正确答案 C 多模态输入成本最低 D 纯坐标输入能理解页面语义
# 11. 截图分辨率与模型视觉识别精度之间的帕累托边界如何选定 A 分辨率越高一定越好,无需考虑成本 B 应通过成本—精度扫描找到帕累托前沿与收益拐点,按任务类型分级选择分辨率 ✓ 正确答案 C 分辨率与 Token 成本无关 D 低分辨率总能获得更高精度
# 12. Computer Use 与 Browser Use 在操作系统范围、坐标精度、可访问性树和沙箱面上有何差异 A 两者作用域完全相同 B Computer Use 的桌面可访问性树比浏览器更完整 C Browser Use 局限浏览器内、语义精度高、攻击面小;Computer Use 覆盖整个系统、依赖坐标、攻击面大 ✓ 正确答案 D Computer Use 坐标精度高于 Browser Use
# 13. Anthropic Computer Use 与 OpenAI Operator / Computer Use 在沙箱边界、模型版本、能力上差异是什么 A 两者在模型实现、沙箱运行环境(云端/本地)、能力侧重与成本上存在差异,且都应使用最新模型版本 ✓ 正确答案 B 两家都不支持截图观察 C 模型版本可以永远固定为旧 preview D 两家实现完全相同
# 14. 国产 GUI Agent(Qwen2.5-VL、UI-TARS、AutoGLM) A 它们都是纯文本模型 B 国产 GUI Agent 不支持视觉理解 C 三者完全等价 D Qwen2.5-VL 偏视觉底座,UI-TARS 偏专用 GUI 推理 Agent,AutoGLM 偏产品化 GUI 操作,定位与平台各有侧重 ✓ 正确答案
# 15. Computer Use 在 macOS、Windows、Linux 上的系统级访问(剪贴板、通知、文件系统) A 应抽象平台无关的接口层处理剪贴板、通知、文件系统与权限差异,按平台实现适配 ✓ 正确答案 B 三个平台的系统 API 完全一致 C macOS 无需任何权限即可访问屏幕 D 剪贴板在三平台 API 相同
# 16. 各 Computer Use 模型 ID 与稳定性为何应按官方模型目录核查,而不写死旧 preview A 应按官方目录核查当前可用模型 ID,配置化而非写死旧 preview,并监控弃用与版本变化 ✓ 正确答案 B preview 模型最适合生产长期使用 C 模型 ID 永远不变,可写死 D 模型 ID 与区域无关
# 17. GUI Agent 如何与传统 RPA 的选择器、录制流程和确定性规则形成混合方案 A 两者互斥,只能选其一 B RPA 无法处理稳定流程 C GUI Agent 应完全替换 RPA D 确定性流程用 RPA 选择器与录制,Agent 处理变化与异常,并把稳定路径固化回 RPA ✓ 正确答案
# 18. GUI Agent 的“看—动”循环频率应如何控制,避免截图爆炸与模型过度推理 A 应仅在屏幕变化、决策点或动作后验证时截图,用差异检测与推理预算避免截图爆炸和过度推理 ✓ 正确答案 B 每步都应截图以获得最大准确率 C 截图频率越高越好 D 推理预算与循环频率无关
# 19. Computer Use 的“可观测性”应记录哪些操作(截图、操作类型、坐标、结果) A 应记录截图、操作类型、坐标、结果与上下文,并脱敏敏感输入,支撑回放、审计与性能分析 ✓ 正确答案 B 只需记录操作类型即可 C 坐标与结果无需记录 D 可观测性记录应包含明文密码
# 20. 为什么 Computer Use 仍需 OCR/视觉模型的辅助做控件识别,模型推理有局限吗 A 通用模型能精确识别所有像素级控件,无需辅助 B 通用模型擅长规划,但精确识别密集控件有局限,需 OCR/视觉模型提供精确文本与控件边界 ✓ 正确答案 C OCR 会降低识别精度 D 视觉模型不适用于 GUI 识别
# 21. Computer Use 的成本控制,模型调用 + 截图 + 视觉推理如何在预算内完成长任务 A 应对截图、模型调用、视觉推理分别优化(增量、裁剪、分级、压缩、预算),在预算内完成长任务 ✓ 正确答案 B 只用强模型就能控制成本 C 视觉推理成本与模型无关 D 长任务成本不可避免,无法控制
# 22. Computer Use 任务失败时如何保存“最终状态截图”以便用户接管 A 失败时无需保存任何状态 B 应保存失败截图、动作序列、失败原因与任务上下文,并脱敏敏感信息,形成可交接的用户接管包 ✓ 正确答案 C 只需保存失败原因文本 D 接管包无需包含当前界面状态
# 23. Anthropic Computer Use、OpenAI Computer Use、Qwen2.5-VL 观察—动作循环的差异 A OpenAI Computer Use 不依赖截图 B 三家实现完全一致 C Qwen2.5-VL 不支持截图观察 D 三家都遵循观察—动作—验证,但 Anthropic 偏工具化、OpenAI 偏云端目标驱动、Qwen2.5-VL 偏可集成视觉底座 ✓ 正确答案
# 24. GUI Agent 与传统 RPA 在工具成熟度、稳定性、生态上有何互补 A RPA 比 GUI Agent 更擅长适应动态页面 B GUI Agent 已完全取代 RPA 生态 C 两者在成熟度上相同 D RPA 成熟稳定、生态完善但难适应变化,GUI Agent 泛化强但较新,两者按稳定性分层互补 ✓ 正确答案
# 25. GUI Agent 是否应被允许在生产环境直接修改业务系统数据而不仅是只读操作 A 应默认允许 Agent 直接修改生产数据 B 只读操作可自动执行,写操作分级授权并强制审批,高风险操作需人工确认与审计 ✓ 正确答案 C 生产数据修改不可逆,因此不应考虑任何写操作 D 写操作无需审批,因为模型很智能
# 26. GUI Agent 的目标检测和 OCR 结果应如何缓存以减少重复视觉推理成本 A 每次操作都要重新做视觉推理 B 缓存永不失效最好 C 应以界面区域为键缓存检测/OCR 结果,用差异检测驱动失效,未变化时复用以降低推理成本 ✓ 正确答案 D 视觉推理成本无法通过缓存降低
# 27. Computer Use 中点击“关闭”按钮与“确认”按钮的风险如何区分 A 关闭按钮风险更高 B 两者风险相同,无需区分 C 应结合按钮文本、可访问性语义与弹窗上下文识别风险,对 Delete/Confirm 等高危按钮施加额外确认与审计 ✓ 正确答案 D 所有按钮都可直接点击
# 28. Computer Use 模型对弹窗、悬浮层等临时元素的处理稳定性如何测试 A 弹窗不影响 GUI 操作,无需测试 B 应设计含各类弹窗与时序临时元素的测试集,验证检测、决策、时序处理与误操作率 ✓ 正确答案 C 所有弹窗都自动关闭即可 D 临时元素稳定性与任务无关
# 29. GUI Agent 在长任务下应如何分层策略,高层规划、低层动作验证 A 长任务无需分层,单层即可 B 低层不需要验证 C 高层应处理所有低层细节 D 高层负责任务分解与规划,低层负责精确执行与每步验证,通过状态协议衔接以保持长任务一致 ✓ 正确答案
# 30. Computer Use 如何与 Browser Use 形成互补(桌面 vs 浏览器场景分工) A 两者完全替代 B Browser Use 更擅长桌面应用操作 C Computer Use 应覆盖所有网页任务 D 浏览器内任务优先用 Browser Use,桌面/系统任务用 Computer Use,跨域任务协同完成 ✓ 正确答案
# 31. Computer Use 在盲人或低视力用户辅助场景中应如何设计可访问性 A 只需提供更大的屏幕截图即可 B 应以无障碍树、OCR 文本与语音描述等非视觉信息为核心,并支持键盘导航、语音控制等辅助交互 ✓ 正确答案 C 视觉识别能力足够强时就无需其他输出方式 D 可访问性设计只影响界面样式,不影响功能