相关系数计算器

Pearson r
下一个

皮尔逊相关系数(r)用于量化两个变量之间的线性关系,即它们的变化趋势是否一致。该计算器可输入成对的X/Y数据,计算r值和r²(解释方差的比例),并显示所使用的数据对数。

如何计算相关性

  1. 1

    粘贴配对数据

    每行包含一个X值和一个Y值,用逗号或制表符分隔;也可从电子表格中粘贴数据。

  2. 2

    运行计算

    该计算器可对数据进行配对分析,并计算均值、偏差及皮尔逊系数。

  3. 3

    阅读 r 和 r²

    r的取值范围为-1至+1。 r² 为其平方值,可解释为共享方差的百分比。

  4. 4

    注意样本量

    查看结果中显示的配对数量(n)。样本量较小时r并不可靠,因此请将n与r一起报告。

公式

r = Σ((xᵢ - x̄)(yᵢ - ȳ)) / √(Σ(xᵢ - x̄)² × Σ(yᵢ - ȳ)²)

等价表示为:r = cov(X, Y) / (σ_X × σ_Y)。该协方差值已通过标准差乘积进行归一化处理,从而使结果取值范围限定在[-1,+1]区间内。

解读 r

r 值 线性关系
±0.9 至 ±1.0 极强
±0.7 至 ±0.9
±0.5 至 ±0.7 中等
±0.3 至 ±0.5
±0.0 至 ±0.3 极弱或无

**r²(决定系数)**是指X的线性模型所能解释的Y方差比例。r=0.7意味着 r² =0.49,即约半数方差可由线性模型解释,另一半则无法解释。

当皮尔逊检验并非合适工具时

皮尔逊检验假设数据呈线性关系近似正态分布,且不存在显著异常值。该检验在以下情况下表现极差:

  • 曲线关系:函数y = x² 在[-5,5]区间内虽可完全预测,但相关系数r = 0。
  • 异常值:偏离均值5个标准差的单个点可使r值增加或减半。
  • 秩数据:改用斯皮尔曼 ρ(秩相关系数)进行分析。
  • 二分类或分类变量:根据数据类型选用点二列相关系数、phi 系数或 Cramer V 系数。

相关性并不等同于因果关系:这一经典观点

两个变量可能呈现强相关性,原因如下:

  1. X 导致 Y。
  2. Y导致了X。
  3. 第三个变量Z同时导致两种结果(混杂效应)。
  4. 完全随机(在小样本中)。
  5. 数据收集方式中的选择偏倚。

夏季期间,冰淇淋销量与溺水死亡人数之间存在+0.8的相关性。冰淇淋并非导致溺水的原因,高温天气才是两者共同的诱因。

样本量与统计学显著性

小样本量下的相关系数r可能产生误导。当n=5时,r=0.5与零值在统计学上无显著差异(p≈0.4);而当n=100时,r=0.2明显不为零(p<0.05)。务必同时报告样本量与r值。r值对应的p值用于检验真实相关性为零的零假设。

常见问题

呈中等程度的正线性关系。 r² =0.25,表明X变量可线性解释Y变量约25%的方差;其余75%的方差无法解释。这虽存在实际影响,但远非决定性的关系。

不,这是由算法设计决定的。如果输出结果超出[-1,1]区间,则计算过程存在错误,通常源于数据配对不当或未按标准差进行归一化处理而直接计算协方差。

皮尔逊系数适用于无明显异常值的连续数据中的线性关系;斯皮尔曼等级相关系数适用于单调但非线性的关系,或当异常值影响皮尔逊系数结果时。

并非预测结果,而是对现有样本的描述。交叉验证、保留测试集或r值的置信区间是检验模型稳定性的可靠方法。

相关工具