1. A/B 测试样本量与显著性检验的最小必要知识集合
A/B 测试中样本量与显著性检验的最小必要知识集合是什么?作为工程师,需要掌握哪些统计概念才能设计可信的实验?
- 核心概念:原假设、显著性水平、功效、最小可检测效应
- 样本量估算的逻辑(效应量、方差、显著性、功效四要素)
- 常见误用与可信实验的设计纪律
最小必要知识集合包括六个概念。原假设与备择假设:A/B 测试默认假设"两组无差异",实验的目标是收集证据拒绝它;显著性水平(α,通常 0.05):原假设为真时错误拒绝它的概率,即假阳率上限;p 值:在原假设成立下观察到当前或更极端结果的概率,p < α 才宣称显著;功效(1-β,通常 0.8):真实差异存在时能检测到它的概率,功效不足的实验等于白做;最小可检测效应(MDE):在当前样本量下能够以给定显著性检测到的最小真实差异;置信区间:效应量的估计范围,比 p 值提供更多信息(能看到效应大小与方向)。
样本量估算的核心公式逻辑是"样本量由四个要素决定":最小可检测效应越小(想检测细微差异)、指标方差越大、显著性要求越严、功效要求越高,所需样本量越大;实践中先用历史数据估出指标基线均值和方差,代入样本量计算器得到每组所需样本,再乘以"加速比"(多天运行以覆盖周期效应)。可信实验的设计纪律:实验前确定样本量与运行时长("事后算样本量"会自我欺骗)、控制 alpha 花费(多指标多实验要用校正)、不做无终止的持续盯盘(反复查看结果并提前停止会膨胀假阳率)。工程师不必成为统计学家,但必须掌握这套概念以理解实验报告、质疑可疑结论,并能在实验设计阶段发现"样本量不够/效应太小"等根本性问题。
回答要覆盖六个核心概念与样本量四要素(效应、方差、α、功效),并强调"实验前定样本量与时长"的设计纪律,体现的是"能读懂、能设计、能质疑"的可信实验素养。