统计
计算数据集的综合统计
如何使用统计
- 1以逗号分隔的列表输入数字。
- 2计算器会计算均值、中位数、众数、极差与标准差。
- 3借助汇总结果理解数据的分布形态与离散程度。
关键统计量
均值 = Σx / n描述性统计用几个有意义的数字概括数据集。均值反映中心位置,极差与标准差反映离散程度。
这些指标可帮助你比较不同组、发现离群值,并在不逐一绘图的情况下清晰传达结论。
描述一组数据要看四个量:**集中趋势**(均值、中位数)、**离散程度**(标准差、四分位距)、**分布形状**(偏度、峰度)、**异常值**。只看均值会丢掉大量信息——两组数据均值都是 100,一组标准差 5、另一组 50,实际含义完全不同。标准差衡量数据离均值的平均距离,越大越分散。
标准差 σ 与方差 σ² 是平方关系。样本标准差除以 n−1(贝塞尔校正),总体标准差除以 n——**用样本估计总体时必须用 n−1**,否则会系统性低估。Excel 里 STDEV.S 是样本(n−1),STDEV.P 是总体(n),选错会得到偏差结果。当数据近似正态分布时,可用「经验法则」快速判断:约 68% 落在 ±1σ 内,约 95% 落在 ±2σ 内。
| 范围 | 覆盖比例 | 含义 |
|---|---|---|
| μ ± 1σ | 约 68.27% | 多数数据落在这里 |
| μ ± 2σ | 约 95.45% | 常用置信水平对应 |
| μ ± 3σ | 约 99.73% | 六西格玛的单侧基准 |
| μ ± 1.96σ | 95% | 95% 置信区间的精确倍数 |
| μ ± 2.58σ | 99% | 99% 置信区间的精确倍数 |
正态分布下的标准差覆盖比例(经验法则)
常见问题
均值与中位数有何区别?
均值是所有值的平均;中位数是排序后的中间值。中位数受极端离群值的影响更小。
什么时候用众数?
当你想找出现次数最多的数值时使用,常见于类别与离散计数。
为什么离散程度很重要?
两组数据可能均值相同但表现迥异,离散指标能揭示这种差异。
标准差和四分位距怎么选?
数据近似对称、无极端值时用标准差(利用了全部数据信息,效率高);数据偏斜或有明显离群值时用四分位距 IQR = Q3 − Q1(只取中间 50%,抗干扰)。箱线图的「箱子」就是 IQR,超出 1.5×IQR 的点通常标为异常值。收入、房价、响应时间这类右偏数据更适合用中位数 + IQR 描述。
相关系数为 0.8 算强相关吗?
一般 0.7 以上算强相关,0.4–0.7 中等,0.4 以下弱。但要注意三点:① 相关系数只度量**线性**关系,抛物线型关系可能相关系数接近 0 却有强关联(可画散点图确认);② 对离群值敏感,一个异常点可能大幅改变数值;③ **相关不意味着因果**——冰淇淋销量和溺水人数高度正相关,共同原因是气温。
