# 1. WCAG 2.1 AA/AAA 符合性如何系统化测试?请说明四个原则(POUR: Perceivable/Operable/Understandable/Robust)在测试用例设计中的具体映射。 A POUR 只包含可感知和可操作两个原则 B 自动化扫描即可完全覆盖 WCAG 测试 C AA 与 AAA 的符合性标准完全相同 D 四个原则(POUR)可分别映射到文本替代、键盘可达、可理解内容、健壮解析等测试用例 ✓ 正确答案
# 2. 屏幕阅读器(NVDA/VoiceOver/JAWS)兼容性测试的操作步骤和验证要点有哪些?如何确保动态内容(SPA/AJAX)的无障碍通知机制正确? A SPA 异步更新的内容无需通知,屏幕阅读器会自动感知 B 自动化扫描可完全替代屏幕阅读器测试 C 动态内容需用 aria-live 区域与焦点管理主动通知屏幕阅读器,并需真实辅助技术人工验证 ✓ 正确答案 D 焦点管理对无障碍无影响
# 3. 键盘可达性、焦点管理与焦点顺序如何系统化测试?'Tab 陷阱'和'焦点丢失'等常见问题的测试方法? A 需用纯键盘完成全流程,并验证 Tab 顺序、无 Tab 陷阱、焦点不丢失且可见 ✓ 正确答案 B 焦点只用于鼠标用户 C Tab 陷阱是正常设计 D 焦点丢失不会影响可用性
# 4. Moderated 与 Unmoderated 可用性测试如何设计与取舍?从成本、数据深度、样本量、任务复杂度四个维度对比。 A Moderated 成本低、样本量大 B 两者完全等价 C Unmoderated 适合复杂探索性任务 D Moderated 数据深度高但成本高、样本小,Unmoderated 成本低可规模化但数据较浅,需按目标取舍 ✓ 正确答案
# 5. 启发式评估(Heuristic Evaluation)与认知走查(Cognitive Walkthrough)的差异是什么?各自在什么阶段使用最有效? A 认知走查是由专家按原则扫描整个界面 B 两者视角完全相同 C 启发式评估用专家按原则扫描界面,适合早期整体排查;认知走查模拟新手逐步走查任务,适合任务流程验证 ✓ 正确答案 D 认知走查适合评估整体布局而非任务
# 6. WCAG 2.2 新增成功标准(目标尺寸、焦点外观、拖动操作)对无障碍测试用例的影响 A WCAG 2.2 没有新增标准 B 目标尺寸、焦点外观、拖动操作等新增标准要求测试补充小目标、焦点可见性与非拖动替代的用例 ✓ 正确答案 C 拖动只需支持拖动即可 D 焦点外观与无障碍无关
# 7. 色彩对比度与色盲友好设计如何验证?自动化对比度检测工具(如 axe-core)的局限性和人工验证的必要性? A axe-core 能完全替代所有对比度与色盲验证 B 自动化工具能算对比度,但无法评估色盲可读性与"信息仅靠颜色传达"的语义问题,需人工验证 ✓ 正确答案 C 色盲设计只需保证没有红绿组合 D 对比度只需满足 3:1 即可
# 8. axe-core/pa11y/Lighthouse 等自动化无障碍扫描的能力边界在哪里?哪些 WCAG 成功标准无法被自动化检测? A 自动化工具能检测所有 WCAG 成功标准 B 自动化只能检测可规则化的语法/结构问题,而文本替代准确性、焦点逻辑、可理解性等需人工验证 ✓ 正确答案 C 人工验证是多余的 D 自动化工具能判断 alt 文本是否准确
# 9. 无障碍测试中'语义化 HTML'与 ARIA 标签的正确使用如何验证?ARIA 误用(如冗余 role)为何比不用更糟? A 尽量用 ARIA 覆盖原生 HTML B 优先用原生语义化 HTML,ARIA 误用会覆盖原生语义并误导辅助技术,比不用更糟 ✓ 正确答案 C 冗余 role 完全无害 D ARIA 不需要与实际交互状态同步
# 10. SUS(System Usability Scale)、UMUX(Usability Metric for User Experience) 等标准化量表如何施测与解读?得分如何指导产品改进优先级? A SUS 按公式换算为 0-100 分并参考基准解释,结合任务表现与问题严重度排定改进优先级 ✓ 正确答案 B SUS 得分可直接代表产品所有方面 C UMUX 比 SUS 更复杂 D 量表得分与改进优先级无关
# 11. 任务完成率、错误率、完成时间等可用性指标如何定义和度量?如何设定合理的基准值(Baseline)? A 任务完成率不需要定义成功标准 B 需明确定义成功、错误、任务口径,用当前版本或竞品设定可比较的基准并与改进后对比 ✓ 正确答案 C 完成时间应排除所有异常 D 基准值与测量口径无关
# 12. A/B 测试在可用性结论上的统计效力(Statistical Power)如何保证?样本量计算和显著性水平选择对结论的影响? A 需按显著性水平、期望效力与最小效应量预先计算样本量,Power 不足会漏掉真实差异 ✓ 正确答案 B 样本量越小越容易得出显著结论 C α 只影响假阴性 D 只看 p 值即可,无需样本量规划
# 13. 可用性测试的样本量选择,Nielsen 五用户法则的适用边界与何时需要更大样本 A 五用户法则适用于定性发现主要问题,当需统计显著性、覆盖异质群体或低概率问题时需更大样本 ✓ 正确答案 B 5 个用户永远够用 C 样本量越大越容易发现所有问题 D 五用户法则只适用于定量测试
# 14. 无障碍回归测试的自动化接入,axe-core 在 CI 中的门禁配置、基线管理与误报治理 A 门禁应拦截所有存量问题并直接失败 B 用基线快照管理存量问题、只拦截新增,并用白名单治理误报 ✓ 正确答案 C 误报无需处理 D 无障碍回归不需要 CI 接入
# 15. 移动端无障碍测试(TalkBack/VoiceOver iOS)与桌面端测试的主要差异有哪些? A 移动端用键盘 Tab 浏览 B 移动端无需考虑触控目标大小 C 桌面与移动端无障碍测试完全相同 D 移动端用触摸手势与滑动浏览,TalkBack 与 VoiceOver 手势机制不同,需在真实设备上分别验证 ✓ 正确答案
# 16. 无障碍合规(如 Section 508/EN 301 549)在测试计划中的体现方式?如何生成合规报告? A Section 508 与 EN 301 549 与 WCAG 无关 B 合规报告只需自动化扫描结果 C 合规测试需把法规转化为可追溯的测试范围与证据,报告汇总扫描、人工测试、缺陷与豁免供审计 ✓ 正确答案 D 合规不需要退出准则
# 17. 可用性测试中'发声思考法(Think Aloud)'的操作规范是什么?如何避免引导性提问影响测试效度? A 主持人应频繁打断用户并给出建议 B 主持人应透露自己的预期答案 C 引导性问题能帮助用户更好完成任务 D 用中性提示鼓励用户边做边说,避免引导性提问与打断以保证效度 ✓ 正确答案
# 18. 远程可用性测试的工具选择和操作注意事项有哪些?与实验室测试相比有哪些效度损失? A 远程测试与实验室测试效度完全一致 B 远程测试在环境控制与非言语观察上仍有损失,但样本广、成本低、更贴近真实场景 ✓ 正确答案 C 远程测试无需关注网络与录制 D 远程测试只能无主持人
# 19. 语音助手/语音界面的可用性与无障碍测试,唤醒词、误识别、多轮打断与无声环境如何设计用例? A 只需测试正常指令识别 B 静音环境不会影响语音界面 C 需覆盖唤醒词、误识别与澄清、多轮打断、静默超时等语音特有边界 ✓ 正确答案 D 误识别无需处理