视觉 Agent

共 17 题
#

1. 视觉理解与 DOM 树结合的混合定位方案如何降低误点率

A 视觉理解识别语义,DOM 树提供精确定位,互校准 ✓ 正确答案
B 只用视觉
C 只用 DOM
D 随机点击
#

2. 医疗影像辅助诊断中多模态模型的合规与责任边界

A 独立诊断
B 无需责任
C 完全替代医生
D 辅助决策,最终由医生决策并承担责任 ✓ 正确答案
#

3. 卫星/无人机图像的语义分割与大模型理解结合价值

A 分割提供精确几何结果,大模型转化为语义问答与决策支持 ✓ 正确答案
B 分割完全替代大模型
C 大模型替代分割
D 无价值
#

4. 零售/电商场景中商品图理解(属性抽取/以图搜货)的工程落地

A 属性关键词
B 商品图嵌入与向量索引检索相似商品 ✓ 正确答案
C 随机匹配
D 仅文本
#

5. 视觉理解服务的批处理与缓存(相同图不同问题)优化

A 缓存图像编码,图级复用,问题单独推理 ✓ 正确答案
B 只缓存问题
C 不缓存
D 只缓存文本
#

6. 视觉 Agent 如何通过截图理解 GUI 状态并决定下一步操作

A 随机
B 仅坐标
C 截图理解出的界面状态与任务目标 ✓ 正确答案
D 仅历史
#

7. 视觉 Agent 在移动 App 自动化测试中的应用与稳定性

A 无等待
B 混合定位、等待机制、重试与操作后状态验证 ✓ 正确答案
C 随机重试
D 无快照
#

8. 视觉 Agent 处理动态页面(动画/弹窗)的鲁棒性设计

A 立即点击
B 随机等待
C 忽略
D 等待界面稳定/加载完成,重截图确认后再操作 ✓ 正确答案
#

9. 工业质检中 VLM 做缺陷识别的少样本适配方法

A 海量标注
B 无适配
C 随机提示
D 提示词加参考示例与 LoRA 微调,结合传统算法兜底 ✓ 正确答案
#

10. 图像内容审核(违规识别)中 VLM 相比规则模型的召回优势

A 语义理解与泛化,召回隐含违规内容 ✓ 正确答案
B 成本更低
C 速度更快
D 无优势
#

11. 高分辨率图像输入对 VLM 推理成本与延迟的影响与降采样策略

A 模型体积
B 网络带宽
C 像素多导致 Token 数多 ✓ 正确答案
D 无可避免
#

12. 视觉 Agent 多步任务如何做端到端成功率评测

A 单步执行
B 点击次数
C 截图数量
D 最终任务目标是否达成 ✓ 正确答案
#

13. 视觉 Agent 的图像理解、元素定位与点击操作之间的误差如何累积,任务成功率应如何分环节评测?

A 预测坐标与真值的距离/命中率 ✓ 正确答案
B 仅文本
C 随机
D 仅点击次数
#

14. VLM 的幻觉(图上不存在之物)如何检测与抑制

A 鼓励自由发挥
B 提示词约束加证据校验与置信度门槛 ✓ 正确答案
C 忽略
D 无兜底
#

15. Set-of-Mark / 视觉提示(visual prompting)如何提升模型定位精度

A 提高坐标精度
B 增加截图
C 用唯一标记指代元素,把定位变成离散标签识别 ✓ 正确答案
D 随机标记
#

16. GUI Agent 的屏幕理解(截图、无障碍树、DOM)与元素定位(坐标、语义描述)应如何组合,跨平台时定位策略如何抽象?

A 只用视觉
B 每平台写死
C 只用坐标
D 抽象统一元素定位层,各平台实现适配 ✓ 正确答案
#

17. 视觉 Agent 的误操作防护,高风险动作(删除、转账)应如何识别并要求确认,截图与操作日志如何脱敏留存?

A 直接执行
B 忽略
C 识别风险并触发确认/授权流程 ✓ 正确答案
D 无审计