# 1. Playwright/Puppeteer 精确脚本与 LLM 驱动浏览器各适合哪些稳定页面和长尾页面 A 所有页面都应优先使用 LLM 驱动浏览器以获得最高泛化能力 B 稳定页面用确定性脚本保证可靠性与低成本,长尾页面用 LLM 智能体获得泛化能力 ✓ 正确答案 C Playwright 脚本无法处理任何动态页面,必须依赖智能体 D LLM 智能体的执行成本总低于确定性脚本
# 2. DOM/可访问性树定位与截图坐标定位在鲁棒性、Token 和视觉理解上如何取舍 A 截图坐标定位永远优于 DOM 定位,因为视觉信息更完整 B DOM 定位应优先使用因为 Token 少且可验证,纯视觉或不可见元素才回退到截图 ✓ 正确答案 C DOM 定位能在任何情况下替代视觉定位 D 截图定位的 Token 消耗远低于 DOM 定位
# 3. 截图 vs DOM 截取在 Token、视觉模型依赖、长尾稳定性上的真实代价如何 A 截图 Token 消耗通常远低于 DOM 截取 B DOM 截取 Token 少、可依赖文本模型,但长尾场景需截图兜底 ✓ 正确答案 C 截图对 DOM 结构变化完全不敏感且成本最低 D DOM 截取必须依赖多模态视觉模型
# 4. 页面改版、弹窗、验证码、登录过期和多标签跳转应如何检测与恢复 A 遇到验证码应反复自动重试直到通过 B 多标签跳转无需跟踪,模型总能找到正确页面 C 登录过期只需刷新页面即可解决 D 恢复前应先验证当前页面状态,再决定重定位、重登录或转人工 ✓ 正确答案
# 5. 如何为浏览任务建立成功率、步骤数、延迟、人工接管率和单位任务成本基准 A 只需关注任务成功率这一单一指标 B 应综合成功率、步骤数、延迟、人工接管率和单位成本,并关注成功率与成本的帕累托关系 ✓ 正确答案 C 人工接管率越高代表系统越智能 D 步骤数越多代表 Agent 越谨慎、质量越高
# 6. 多标签、多 Frame(iframe)的复杂页面中 Agent 如何识别当前焦点与可用操作 A Agent 可以跨 Frame 直接操作任意元素 B 每个动作必须绑定到明确的标签页与 Frame 上下文,并枚举该上下文内的可用操作 ✓ 正确答案 C 多标签无需跟踪,浏览器会自动聚焦正确页面 D iframe 内的元素与主框架元素可以共享同一 DOM 引用
# 7. 如何为浏览器 Agent 建立页面导航、表单填写和提交前检查的状态机,避免误操作不可逆按钮 A 状态机应让模型自由决定是否检查提交内容 B 不可逆按钮无需特殊处理,模型会自动识别 C 状态机只适用于导航,不适用于表单与提交 D 提交前检查应作为强制状态,对不可逆操作施加额外确认与校验 ✓ 正确答案
# 8. 浏览器工具返回网页文本时,怎样隔离页面中的间接提示注入并限制其影响到导航和工具权限 A 应将页面内容作为不可信数据隔离,声明其非指令,并限制其对导航与工具权限的影响 ✓ 正确答案 B 页面文本应被视为可信指令直接执行 C 注入防护只需靠模型自觉,无需权限控制 D 页面文本可以随意触发文件上传等高权限工具
# 9. 如何记录截图、DOM 快照、动作和结果,既支持失败回放又不泄露登录凭证和个人信息 A 日志中的密码可以保留,因为只有内部人员访问 B 应完整记录所有 DOM 文本和截图以便回放 C 应脱敏敏感字段、最小化采集、限制保留期与访问权限,用结构化动作与脱敏快照支撑回放 ✓ 正确答案 D 回放必须使用真实登录凭证
# 10. 浏览器 Agent 遇到验证码、双因素认证或登录过期时,应如何安全暂停并交给人工完成恢复 A Agent 应自动反复尝试验证码直到通过 B 登录过期只需刷新即可继续 C 遇到验证码/2FA/登录过期应安全暂停、转人工并在超时后清理临时凭证干净退出 ✓ 正确答案 D 2FA 可以交给模型自行猜测
# 11. 动态表格采用虚拟滚动后,Agent 如何确认目标行已加载并避免对屏外占位节点执行动作 A 虚拟滚动会渲染所有行,可直接按索引定位 B 应滚动加载并验证目标行真实数据已渲染且非占位节点,再在可视区域内执行动作 ✓ 正确答案 C 虚拟滚动无需等待加载即可操作 D 占位节点与真实行功能完全相同
# 12. SPA 路由切换不触发完整加载事件时,Agent 应用哪些 DOM、网络和可见性信号判断页面稳定 A 应综合目标元素可见、相关请求完成、loading 消失等任务相关信号,而非等待整页空闲 ✓ 正确答案 B 应等待 networkidle,因为没有触发 load 事件 C 只需要等待 DOM 内容变化即可 D SPA 无法判断页面是否稳定
# 13. 视觉模型识别到按钮而 DOM 存在同名隐藏元素时,如何交叉验证可点击性、遮挡和坐标映射 A 应用 elementFromPoint 反向确认实际命中元素,并检查可点击性、遮挡与坐标映射 ✓ 正确答案 B 视觉模型识别出按钮即可直接点击,无需验证 C DOM 中隐藏元素与视觉可见元素无关 D 遮挡不影响坐标点击
# 14. 如何区分真正完成业务目标与仅到达相似页面的假阳性 A 页面标题相似即可判定任务完成 B 假阳性主要影响成本,不影响正确性 C 应定义可验证的业务成功信号,并用多信号交叉确认而非仅凭相似页面 ✓ 正确答案 D 到达目标 URL 即代表真实完成
# 15. 浏览器动作失败后,怎样利用 DOM diff、网络响应和截图变化选择重试、重定位或停止 A 应结合 DOM diff、网络响应和截图变化分类,瞬时失败重试、状态变化重定位、反复失败则停止 ✓ 正确答案 B 失败后直接停止,不做任何分析 C 网络 500 错误应重试但 DOM 变化应忽略 D 无论何种失败都应无限重试直到成功
# 16. 对于富文本编辑器和 Canvas 控件,Agent 如何在语义操作、键盘输入与坐标点击之间安全切换 A 两者都可以用 fill 直接填充 B Canvas 可以直接通过 DOM 修改文本 C 富文本用语义/键盘输入,Canvas 用坐标+键盘,并按控件类型检测后安全切换 ✓ 正确答案 D 富文本编辑器只能坐标点击
# 17. 网页持续轮询或保持长连接时,Agent 如何定义任务相关的稳定条件而不是等待 networkidle A 稳定条件与任务目标无关 B 应始终等待 networkidle 以确保页面稳定 C 长轮询页面必须等待 networkidle D 应等待与任务直接相关的元素与数据就绪,而非等待网络完全空闲 ✓ 正确答案
# 18. 网站可访问树信息缺失或错误时,Agent 如何降级到 DOM 与视觉定位并保留置信度证据 A 应按 DOM 语义→结构定位→视觉定位逐级降级,并记录置信度证据与降级原因 ✓ 正确答案 B 视觉定位与 DOM 定位置信度相同 C 可访问性树缺失时只能失败 D 降级后无需保留证据
# 19. Browser Use 在多步任务(多页面、长表单、登录保持)中的上下文维护与步骤状态管理应如何设计 A 所有状态都应保存在模型上下文里 B 多步任务无法恢复,失败必须重头开始 C 登录态只需存在模型记忆里 D 用持久化会话与存储保存登录态、表单草稿和检查点,模型上下文只保留当前步骤所需信息 ✓ 正确答案
# 20. 为什么不能用一次成功演示证明 Browser Use 可替代稳定 API 集成 A 一次成功就足以证明 Browser Use 可替代 API B 单次成功只是个案,需要用统计评测集证明成功率、可维护性与成本才能替代稳定 API ✓ 正确答案 C Browser Use 与 API 一样是确定性的 D 演示成功即可直接上线生产
# 21. Browser Use 遇到反爬虫(Cloudflare、reCAPTCHA)时如何降级或转人工,绕过尝试有哪些合规与稳定性风险 A 轮换 IP 绕过速率限制无风险 B 应主动破解验证码绕过反爬虫 C 伪造浏览器指纹是完全合规的 D 遇到反爬虫应降级转人工,并认识到绕过尝试有合规与稳定性风险,优先使用合规替代方案 ✓ 正确答案
# 22. Browser Use 任务失败时如何保存 DOM 快照、截图、网络日志用于事后排查 A 只需保存截图即可排查所有失败 B 网络日志应包含所有完整响应体 C 应保存 DOM 快照、截图、网络日志和动作日志并脱敏敏感字段,以支持事后排查与回放 ✓ 正确答案 D 失败取证无需保留动作序列
# 23. 为什么 Browser Use 不应作为“万能集成方案”,仅在 API 缺失或不稳定时使用 A Browser Use 是概率性、高成本的兜底方案,仅在 API 缺失或不稳定时使用,优先用确定性 API ✓ 正确答案 B Browser Use 比 API 更稳定可靠 C Browser Use 成本低于 API D Browser Use 应作为所有集成的首选方案
# 24. Browser Use 的可访问性树(accessibility tree)在元素定位中的价值与局限是什么,缺失时如何降级 A 可访问性树总是完整准确的 B 它提供语义化定位且 Token 少,但依赖页面暴露质量,缺失时需降级到 DOM 与视觉定位 ✓ 正确答案 C 可访问性树能表达所有视觉信息 D 可访问性树缺失时无法定位任何元素
# 25. Browser Use 任务的“成功率”评估集应包含哪些真实用户场景(登录、支付、上传) A 应覆盖登录、支付、上传等高风险与长尾场景,分级定义严格完成断言以反映真实可用性 ✓ 正确答案 B 评测集只需包含简单导航任务 C 高风险场景无需纳入评测 D 评测集越简单越好
# 26. 不同 LLM(GPT、Claude、Gemini)在 Browser Use 中的表现差异如何评测 A 应在相同评测集与工具下固定参数,多次运行统计成功率、成本、延迟等多维度表现 ✓ 正确答案 B 所有模型在 Browser Use 中表现相同 C 单次运行即可判断模型优劣 D 评测只需看成功率,无需看成本
# 27. Browser Use 的截图成本(每次动作一张)应如何用增量截图、差异检测优化 A 每次动作都必须截图以保持准确 B 应用增量截图、差异检测、区域裁剪并结合 DOM 截取,但关键决策点仍保留完整截图 ✓ 正确答案 C 为省成本应完全禁用截图 D 截图成本无法优化
# 28. Browser Use Agent 如何结合 DOM、可访问性树和视觉截图定位元素,何时应避免依赖脆弱的 CSS 选择器 A 应优先使用深层 CSS class 选择器 B nth-child 是最稳定的选择器 C 应优先用可访问性树与稳定语义锚点,避免依赖易改版的深层 CSS 选择器,并保留多级回退 ✓ 正确答案 D 视觉定位应始终优先于 DOM 定位
# 29. 网页布局、登录状态或 A/B 实验变化后,如何让浏览器 Agent 通过语义定位和验证步骤恢复执行 A A/B 实验无需处理,任选一个分支即可 B 页面变化后只能用原始选择器重试 C 应通过语义定位保持鲁棒,并在每步执行前验证状态、适配 A/B 分支与登录态变化 ✓ 正确答案 D 登录态变化不影响任务执行
# 30. Browser Use 与 Playwright、Puppeteer 的职责如何分层,哪些确定性操作不应交给视觉模型决策 A 视觉模型应直接执行所有精确坐标与键盘操作 B Playwright 负责智能决策,模型负责执行 C 两者职责完全相同 D Playwright 负责确定性执行,模型负责目标理解与规划,精确计算交给工具而非模型 ✓ 正确答案
# 31. 同一按钮同时存在 DOM 文本、ARIA 名称和视觉图标时,Browser Use Agent 应如何决定定位信号优先级 A 视觉图标始终是最优先的信号 B DOM 文本永远优先于 ARIA 名称 C 信号冲突时任意选一个即可 D 应综合 ARIA 名称、DOM 文本与视觉图标,结合用户意图与信号一致性确定优先级,冲突时降低置信度 ✓ 正确答案
# 32. 页面使用 Shadow DOM 和跨域 iframe 时,Browser Use Agent 如何建立可验证的分层定位与失败回退 A 普通 DOM 查询可以直接穿透 Shadow DOM 和跨域 iframe B Shadow DOM 与普通 DOM 完全等同 C 需穿透 shadow root 并切换 frame 上下文,建立分层定位并感知边界,失败时回退到可访问性树或视觉定位 ✓ 正确答案 D 跨域 iframe 可以直接通过主文档访问其 DOM
# 33. Browser Use 的登录态与持久会话,storageState 保存、Cookie 复用与登录过期后的自动检测与人工恢复? A 用 storageState 保存并复用登录态,检测登录过期后安全暂停并人工恢复,同时加密保管凭证文件 ✓ 正确答案 B 每次任务都应重新登录 C Cookie 永远有效无需管理 D 登录过期后可自动无限重试登录
# 34. Browser Use Agent 如何处理语言、时区和响应式布局差异,避免定位规则只适用于评测环境 A 定位规则应为评测环境定制即可 B 硬编码文本在多种语言下都有效 C 响应式布局不影响元素定位 D 应改用语义锚点定位,并在多种语言、时区、分辨率下验证,避免过拟合单一评测环境 ✓ 正确答案
# 35. 怎样为 Browser Use Agent 的元素定位建立指标,覆盖首选定位命中率、恢复次数与误点击率 A 只需关注误点击率,其余不重要 B 恢复次数越高越好 C 应覆盖首选命中率、恢复次数与误点击率,反映效率、鲁棒性与正确性并驱动优化 ✓ 正确答案 D 误点击率与定位策略无关
# 36. Browser-Use、Stagehand 和 Skyvern 如何把自然语言目标映射为页面观察与操作,抽象重点有何不同 A 三者抽象方式完全相同 B Skyvern 不维护任务状态 C Stagehand 是纯视觉框架 D Browser-Use 偏通用 Agent,Stagehand 偏 Playwright 集成的语言 DSL,Skyvern 偏生产级视觉状态机 ✓ 正确答案
# 37. Browser-Use、Stagehand、Skyvern 的“自然语言目标 → DOM 操作”链路如何用 Playwright/CDP 串联 A CDP 与 Playwright 无法同时使用 B 模型直接执行浏览器底层命令 C 只需单个 DOM 查询即可完成整条链路 D 框架用 Playwright/CDP 作为执行与观察层,把浏览器能力封装为工具供模型调用形成闭环 ✓ 正确答案
# 38. Browserbase、Steel 等远程浏览器基础设施如何提供会话、隔离、录制和扩缩容 A 它只是远程打开浏览器,无隔离能力 B 所有会话共享同一 Cookie C 它提供按需会话、容器级隔离、录制回放与弹性扩缩容,降低自建浏览器运维负担 ✓ 正确答案 D 它无法录制会话
# 39. Stagehand MCP 等接入方式如何与 Agent 工具权限和审计体系组合 A Agent 通过 MCP 可无限制调用所有浏览器工具 B MCP 工具无需审计 C 权限控制会破坏 MCP 的灵活性而不应添加 D 应按工具分级授权(只读自动、写操作审批、敏感操作显式授权),并全量记录审计日志 ✓ 正确答案
# 40. Browser Use 与 Vercel AI SDK、LangGraph、CrewAI 集成的最佳嵌入点是哪个抽象层 A 最佳嵌入点是工具层,底层封装浏览器细节,上层框架负责规划与编排 ✓ 正确答案 B 应把 Browser Use 嵌入框架核心逻辑 C 集成时必须重写框架 D 工具层无法实现权限与审计
# 41. 多用户并发使用同一 Browserbase 会话时,如何做会话隔离(独立 context、独立 cookies) A 每个用户应用独立 context(甚至独立浏览器实例)与独立 cookies,并隔离网络、存储与凭证 ✓ 正确答案 B 多用户可共享同一 context 以节省资源 C 共享 Cookie 不影响用户隔离 D 只需在应用层切换用户即可
# 42. Browser Use 的合规边界,robots.txt、服务条款与个人数据抓取的合规评估与风控? A robots.txt 具有法律强制力,违反即属违法 B 只要使用官方 API 就无需评估数据用途 C 应从 robots.txt、服务条款与隐私法规三层评估,抓取前做合规审查、限频、脱敏,并对高风险抓取设置人工审批门槛 ✓ 正确答案 D 抓取个人数据不需要任何合法依据