置信区间
计算均值和比例的置信区间
如何使用置信区间
- 1输入样本均值、标准差与样本量。
- 2选择置信水平(90%、95% 或 99%)。
- 3查看误差幅度以及区间的下限与上限。
置信区间说明什么
CI = 均值 ± z × (s / √n);误差幅度 = z × s / √n置信区间给出一个范围,在重复抽样下,该范围有设定百分比的概率包含真实总体参数。
区间越宽代表不确定性越大;增大样本量或降低置信水平都会缩小误差幅度。
置信水平越高,临界值越大,区间越宽——这是在“把握”与“精度”之间权衡:想要更确定包含真值,就得接受更模糊的范围。
当总体标准差未知且样本较小(n < 30)时,应当用 t 分布临界值替代 z;t 分布更“胖尾”,会给出更宽的区间以补偿小样本的不确定性。样本增大后 t 会收敛到 z。
| 置信水平 | z 临界值 | 区间宽度(相对) | 含义 |
|---|---|---|---|
| 90% | 1.645 | 较窄 | 约每 10 次有 1 次不覆盖真值 |
| 95% | 1.960 | 中等 | 最常用的默认水平 |
| 99% | 2.576 | 较宽 | 更保守、更难拒绝原假设 |
常见置信水平对应的 z 临界值(大样本)
常见问题
95% 是否表示真实值在区间内的概率为 95%?
不完全是;它表示在重复抽样中,95% 的此类区间会覆盖真实值。
为何 n 在根号下?
精度随 √n 提升,因此样本量需四倍才能把误差减半。
z 与 t 用哪个?
总体标准差未知且 n 小时用 t;大样本或已知 σ 用 z。
区间窄一定更好吗?
不一定。窄区间可能来自低置信水平或小样本导致的“虚假精确”;要结合置信水平和样本量一起看。
两个区间重叠能否说“无差异”?
不能。重叠不代表差异不显著;判断是否显著需用专门的差异检验,或看差值区间是否包含 0。
置信区间和假设检验有什么关系?
置信区间是看“合理范围是否包含某个参考值”;假设检验则把它变成“能否拒绝该参考值”。两者本质相连,只是表述方式不同。
