统计

计算数据集的综合统计

如何使用统计

  1. 1以逗号分隔的列表输入数字。
  2. 2计算器会计算均值、中位数、众数、极差与标准差。
  3. 3借助汇总结果理解数据的分布形态与离散程度。

关键统计量

均值 = Σx / n

描述性统计用几个有意义的数字概括数据集。均值反映中心位置,极差与标准差反映离散程度。

这些指标可帮助你比较不同组、发现离群值,并在不逐一绘图的情况下清晰传达结论。

描述一组数据要看四个量:**集中趋势**(均值、中位数)、**离散程度**(标准差、四分位距)、**分布形状**(偏度、峰度)、**异常值**。只看均值会丢掉大量信息——两组数据均值都是 100,一组标准差 5、另一组 50,实际含义完全不同。标准差衡量数据离均值的平均距离,越大越分散。

标准差 σ 与方差 σ² 是平方关系。样本标准差除以 n−1(贝塞尔校正),总体标准差除以 n——**用样本估计总体时必须用 n−1**,否则会系统性低估。Excel 里 STDEV.S 是样本(n−1),STDEV.P 是总体(n),选错会得到偏差结果。当数据近似正态分布时,可用「经验法则」快速判断:约 68% 落在 ±1σ 内,约 95% 落在 ±2σ 内。

范围覆盖比例含义
μ ± 1σ约 68.27%多数数据落在这里
μ ± 2σ约 95.45%常用置信水平对应
μ ± 3σ约 99.73%六西格玛的单侧基准
μ ± 1.96σ95%95% 置信区间的精确倍数
μ ± 2.58σ99%99% 置信区间的精确倍数

正态分布下的标准差覆盖比例(经验法则)

常见问题

均值与中位数有何区别?

均值是所有值的平均;中位数是排序后的中间值。中位数受极端离群值的影响更小。

什么时候用众数?

当你想找出现次数最多的数值时使用,常见于类别与离散计数。

为什么离散程度很重要?

两组数据可能均值相同但表现迥异,离散指标能揭示这种差异。

标准差和四分位距怎么选?

数据近似对称、无极端值时用标准差(利用了全部数据信息,效率高);数据偏斜或有明显离群值时用四分位距 IQR = Q3 − Q1(只取中间 50%,抗干扰)。箱线图的「箱子」就是 IQR,超出 1.5×IQR 的点通常标为异常值。收入、房价、响应时间这类右偏数据更适合用中位数 + IQR 描述。

相关系数为 0.8 算强相关吗?

一般 0.7 以上算强相关,0.4–0.7 中等,0.4 以下弱。但要注意三点:① 相关系数只度量**线性**关系,抛物线型关系可能相关系数接近 0 却有强关联(可画散点图确认);② 对离群值敏感,一个异常点可能大幅改变数值;③ **相关不意味着因果**——冰淇淋销量和溺水人数高度正相关,共同原因是气温。

更多工具