P值是在零假设为真的条件下,观察到当前数据或更极端数据的概率。P值越小,拒绝零假设的证据越强。通常以0.05作为显著性阈值,即P值小于0.05时认为结果在统计上显著。但P值不是实验组优于对照组的概率,而是数据与零假设不一致程度的度量。
与本工具的关系:本工具的核心输出之一就是P值,帮助您判断A/B测试结果是否具有统计显著性。
Z统计量是标准化后的检验统计量,表示观测值偏离零假设均值的标准差数。Z统计量的绝对值越大,对应的P值越小。在标准正态分布中,Z值为1.96对应双尾检验的0.05显著性水平。Z检验适用于大样本量(通常n>30)的情况。
与本工具的关系:本工具计算并显示Z统计量,帮助您理解观测值相对于零假设的偏离程度。
零假设是统计检验中的默认假设,通常假设两组之间没有差异。在A/B测试中,零假设通常是"实验组和对照组的转化率相同"。统计检验的目的就是收集证据来拒绝或不拒绝零假设。如果P值很小,我们有足够证据拒绝零假设,认为存在显著差异。
与本工具的关系:本工具基于零假设进行计算,帮助您判断是否有足够证据拒绝零假设。
置信水平是统计检验中预先设定的显著性标准,表示允许犯第一类错误(错误拒绝零假设)的概率。常用的置信水平有90%、95%和99%。95%置信水平意味着有5%的概率会错误地认为存在显著差异。置信水平的选择取决于业务风险容忍度。
与本工具的关系:本工具提供三种置信水平供您选择,影响P值的显著性判断标准。
双尾检验用于检测两组之间是否存在差异,而不预设差异的方向。它同时考虑实验组优于对照组和对照组优于实验组两种情况。当您不确定新设计是否会带来正面或负面影响时,应使用双尾检验。双尾检验比单尾检验更保守,需要更强的证据才能得出显著结论。
与本工具的关系:本工具支持双尾检验,适用于大多数A/B测试场景。
单尾检验只检测一个方向的差异。在A/B测试中,通常使用右尾检验来检测实验组是否显著优于对照组。单尾检验的统计功效比双尾检验高,但前提是有明确的方向性假设。如果实际差异方向与假设相反,单尾检验将无法检测到。
与本工具的关系:本工具支持单尾检验(右尾),适用于有明确方向预期的A/B测试场景。
置信区间是参数估计的区间范围,表示真实参数值有特定概率落在这个区间内。例如,95%置信区间意味着如果重复实验多次,约95%的区间会包含真实参数值。置信区间比点估计提供了更多信息,显示了估计的不确定性程度。区间宽度受样本量和变异性影响。
与本工具的关系:本工具提供置信区间的可视化展示,帮助您理解转化率提升的可能范围。
标准正态分布是均值为0、标准差为1的正态分布,也称为Z分布。它是统计检验中的重要参考分布,许多检验统计量在大样本下近似服从标准正态分布。通过将检验统计量标准化,可以与标准正态分布比较,计算P值和临界值。
与本工具的关系:本工具显示标准正态分布图表,帮助您直观理解Z统计量和P值的关系。
样本量是参与实验的观察单位数量。在A/B测试中,样本量直接影响检验的功效和结果的可靠性。样本量越大,检验越能检测到较小的差异,置信区间也越窄。但样本量过大会增加实验成本和时间。样本量规划是实验设计的重要环节。
与本工具的关系:您需要输入对照组和实验组的访客数作为样本量,这是计算的基础。
转化率是完成目标行为的用户比例,计算公式为:转化数/访客数。在A/B测试中,转化率是衡量实验效果的核心指标。例如,如果1000个访客中有50个购买,则转化率为5%。转化率的差异是A/B测试分析的主要对象。
与本工具的关系:本工具根据您输入的访客数和转化数计算两组的转化率,并进行统计比较。
相对提升是实验组相对于对照组的百分比变化,计算公式为:(实验组转化率 - 对照组转化率) / 对照组转化率。相对提升显示了改进的幅度大小。例如,如果对照组转化率为2%,实验组为2.5%,则相对提升为25%。相对提升是评估业务价值的重要指标。
与本工具的关系:本工具计算并显示相对提升百分比,帮助您评估改进的实际业务价值。
统计功效是在备选假设为真时,正确拒绝零假设的概率。统计功效等于1减去第二类错误(漏报)的概率。通常要求统计功效至少达到80%。统计功效受样本量、效应大小、置信水平等因素影响。功效不足可能导致无法检测到真实存在的差异。
与本工具的关系:虽然本工具不直接计算统计功效,但理解这一概念有助于您合理设计实验和解读结果。
UD5工具箱