P值计算器

p-value
下一步

输入检验统计量(z值、t值或卡方值),并注明相关自由度,计算器便会返回单尾或双尾假设的p值。这是统计学作业和A/B测试中的必备工具:一旦获得数据中的检验统计量,该工具即可将其转换为在零假设下观察到至少同等极端结果的概率。

p值是如何计算的

  1. 1

    选择分布

    z用于大样本均值和比例的检验,t用于已知标准差的小样本均值检验,卡方检验用于拟合优度检验及列联表分析。

  2. 2

    输入统计数据

    您从数据中观察到的z值、t值或卡方值。

  3. 3

    选择尾侧

    双尾检验适用于“在任一方向上存在差异”的假设;单尾检验适用于“大于”或“小于”等方向性假设。

  4. 4

    阅读 p 值

    分布曲线尾部中超出您统计值范围的区域。

参考表(双尾)

统计量 p值 解释
z = 1.64 0.10 边际值
z = 1.96 0.05 经典阈值
z = 2.58 0.01 强烈
z = 3.29 0.001 极强
t(20) = 2.09 0.05 对于自由度 df = 20,相当于约 1.96
t(5) = 2.57 0.05 小样本会提高临界值

p值的含义

p值是在零假设成立的前提下,观测到检验统计量至少与所观察结果同样极端的概率。较小的p值表明数据在零假设下出现的可能性极低,这意味着零假设要么错误,要么你只是运气不好。

p值并不意味着什么

  • 并非零假设成立的概率。
  • 并非您重复该发现的概率。
  • 并非效应量本身。即使效应量微小且无统计学意义,在足够大的样本量下仍可得出 p < 0.001 的结果。
  • 并非区分“真实”与“非真实”的阈值:0.05仅是一种惯例,而非硬性规定。

选择一个尾还是两个尾

仅在事先明确设定真实方向性假设(即您的药物只能产生益处而非危害)时才使用单尾检验;否则应采用双尾检验。事后改为单尾检验以使显著性水平低于0.05属于p值操控行为,会削弱统计推论的可靠性。

常见陷阱

  • 多重比较。 进行20次检验,预计其中至少一次会偶然达到p < 0.05。采用Bonferroni或Benjamini–Hochberg校正方法。
  • 样本量越大,效应越小。 即使样本量达数百万,仅0.1%的差异也会被判定为具有统计学意义。务必同时报告效应量与p值。
  • 二分法划分。“显著 vs 不显著”会丢失信息。p = 0.048 和 p = 0.052 实际上代表相同的证据强度。
  • 卡方值误读。 p值同时取决于统计量和自由度;当自由度为2时,卡方值为10具有显著性(p=0.0067),但在自由度为20时则无显著性(p=0.97)。

常见问题

通常采用0.05作为阈值,但该阈值应与错误判定的成本相匹配。医学试验常使用0.01或更低的阈值;部分领域则主张默认采用0.005。

样本量越大,标准误越小,因此微小效应也会变得“显著”。务必在p值旁同时报告效应量(Cohen’s d、比值比或原始差异)。

默认为双尾分布。仅当在数据收集前已明确设定真实的方向性假设时,单尾分布才具有合理性。

z值适用于已知总体标准差的情况(较为罕见);t值则用于根据样本数据进行估计。当样本量较大时,两者结果趋于一致。

这意味着该数据在零假设下将呈现异常特征。重复实验结果、效应量及作用机制比单一p值更为重要。

相关工具

此工具还提供其他语言版本