无需登录 数据私有 本地保存

箱线图与异常值检测器 - 自动标记极端值

61
0
0
0
箱线图(Box Plot)

箱线图又称盒须图(Box-and-Whisker Plot),是由John Tukey于1977年提出的一种标准化数据可视化方法。它通过五个关键数值来概括数据分布:最小值、第一四分位数(Q1)、中位数(Q2)、第三四分位数(Q3)和最大值。箱线图的核心优势在于能够以紧凑的形式展示数据的集中趋势、离散程度和偏态信息,同时直观标记异常值。在本工具中,箱线图是主要的可视化输出,用户可以通过观察盒子的位置、宽度和须线的长度来快速把握数据的整体特征。

四分位数(Quartile)

四分位数是将一组按大小排列的数据等分为四份的三个数值点。第一四分位数(Q1,25%分位数)表示有25%的数据小于或等于该值;第二四分位数(Q2,中位数)表示50%的数据分界点;第三四分位数(Q3,75%分位数)表示有75%的数据小于或等于该值。本工具使用线性插值法计算四分位数,计算公式为:位置 = (n-1) * p/100,其中n为数据量,p为百分位数。当位置为整数时直接取值,为小数时在相邻两值之间线性插值。四分位数是箱线图的核心构建元素。

IQR 四分位距

IQR(Interquartile Range,四分位距)等于第三四分位数减去第一四分位数,即 IQR = Q3 - Q1。IQR代表了数据中间50%的分布范围,是衡量数据离散程度的重要指标。与标准差不同,IQR对异常值具有稳健性(robustness),不会因为极端值的存在而产生显著变化。在本工具中,IQR是异常值检测的核心参数,异常值的上下界计算直接依赖于IQR值。IQR越大说明数据中间50%的部分越分散,IQR越小说明数据越集中。

中位数(Median)

中位数是将一组数据从小到大排列后处于中间位置的数值,也称为第二四分位数(Q2)。如果数据量为奇数,中位数就是最中间的那个数;如果数据量为偶数,中位数是中间两个数的算术平均值。中位数是衡量数据集中趋势的稳健指标,与均值相比,中位数不受极端值的影响。当均值和中位数接近时,数据通常呈对称分布;当均值明显大于中位数时,数据通常呈右偏分布;反之则呈左偏分布。在箱线图中,中位数以盒子内部的一条线来表示。

异常值(Outlier)

异常值是指与数据集中其他观测值显著不同的数据点。在本工具中,异常值通过IQR方法进行检测:低于下界(Q1 - k * IQR)或高于上界(Q3 + k * IQR)的数据点被判定为异常值,其中k为IQR倍数阈值。异常值的产生原因多种多样,可能源于数据录入错误、测量误差、采样偏差,也可能代表了真实且有价值的极端事件(如金融市场的异常波动、医学研究中的特殊病例)。识别异常值是数据清洗和探索性数据分析的重要步骤,但检测到异常值后应结合领域知识审慎处理,不应盲目删除。

上下界(Fence)

上下界是IQR方法中用于判定异常值的阈值边界。下界(Lower Fence)的计算公式为:Q1 - k * IQR;上界(Upper Fence)的计算公式为:Q3 + k * IQR,其中k为IQR倍数。当k=1.5时,约99.3%的正态分布数据落在上下界之内,超出范围的数据点出现概率极低。工具提供了1.5倍、2.0倍和3.0倍三档可调的k值。k值越大,上下界范围越宽,被判定为异常值的数据点越少(仅捕获更极端的值);k值越小,范围越窄,会有更多数据点被标记为异常值。

标准差(Standard Deviation)

标准差是衡量数据离散程度的常用统计量,表示各数据点与均值之间偏差的平均大小。标准差越大,说明数据分布越分散;标准差越小,说明数据越集中。在正态分布中,约68%的数据落在均值加减1个标准差范围内,约95%落在均值加减2个标准差范围内,约99.7%落在均值加减3个标准差范围内。标准差受极端值影响较大,因此在存在显著异常值的数据集中,标准差可能不能准确反映数据的真实离散程度,此时IQR是更好的替代指标。本工具同时展示标准差和IQR,方便用户对比分析。

偏态(Skewness)

偏态描述了数据分布相对于对称分布的不对称程度。右偏(正偏)分布的特征是数据向右(大值方向)拖尾,中位线靠近Q1,上须线明显长于下须线,均值大于中位数。左偏(负偏)分布的特征是数据向左(小值方向)拖尾,中位线靠近Q3,下须线明显长于上须线,均值小于中位数。对称分布的中位线大致在盒子中央,上下须线长度相近。判断偏态对于选择统计分析方法具有重要参考价值:偏态明显的数据更适合使用非参数检验方法。通过观察箱线图中中位线的位置和须线长度,可以直观判断数据的偏态方向和程度。

须线(Whisker)

须线是箱线图中从盒子两端延伸出去的线条。在本工具中,须线从盒子的Q1端向下延伸到非异常值范围内的最小值,从Q3端向上延伸到非异常值范围内的最大值。须线的长度反映了数据在中心50%范围之外的扩展程度。如果上须线明显长于下须线,说明数据向大值方向有更多的分散或存在右偏趋势;反之则说明数据向小值方向分散或存在左偏趋势。当所有数据都在上下界之内时,须线分别延伸到最小值和最大值;当存在异常值时,须线只延伸到上下界范围内的极值点。

数据量(Sample Size)

数据量是指输入到工具中进行分析的数值数据的总个数,用字母n表示。数据量是影响统计分析可靠性的重要因素。数据量越大,箱线图和统计指标越能代表数据的真实分布特征;数据量较小时,统计结果可能受到个别数据点的显著影响,箱线图的形态也不够稳定。一般来说,进行箱线图分析时建议数据量不少于10个,数据量在30个以上时分析结果较为可靠。本工具在数据输入后会立即显示数据量,帮助用户判断分析结果的可信度。