总和
将数据集中所有数值相加得到的结果,反映数据的总量规模。
均值
算术平均值,等于所有数值之和除以数值个数,是最基础的集中趋势度量。公式为:均值 = Σx / n。
中位数
将数据从小到大排序后位于中间位置的数值。若数据个数为偶数,则取中间两个数的平均值。中位数对极端值不敏感,适合偏态分布数据。
众数
数据集中出现次数最多的数值。一组数据可能有多个众数或没有众数。
方差
衡量数据围绕均值离散程度的指标。总体方差公式为:σ² = Σ(x - μ)² / N;样本方差公式为:s² = Σ(x - x̄)² / (n - 1)。样本方差使用n-1作为分母,称为贝塞尔校正,目的是获得总体方差的无偏估计。
标准差
方差的算术平方根,与原始数据具有相同单位,直观反映数据的波动大小。标准差越小,数据越集中;标准差越大,数据越分散。
四分位数
将排序后的数据等分为四份的三个分割点。Q1(第一四分位数)为25%位置,Q2(第二四分位数)即中位数,Q3(第三四分位数)为75%位置。
四分位距IQR
Q3减去Q1的差值,表示数据中间50%的分布范围。IQR常用于识别离群值,通常将小于Q1-1.5×IQR或大于Q3+1.5×IQR的数据判定为离群值。
变异系数CV
标准差与均值之比的绝对值,以百分比表示。公式为:CV = (σ / |μ|) × 100%。CV消除了量纲影响,适用于比较不同数据集的相对离散程度。
总体方差
对完整数据集计算的方差,分母为数据总个数N。适用于研究对象为全部个体的情况。
样本方差
对从总体中抽取的样本计算的方差,分母为n-1(自由度)。由于样本往往不能完全代表总体,使用n-1可以校正偏差,获得更准确的总体估计。
UD5工具箱