Współczynniki korelacji liniowej
Kiedy stosować:
Współczynnik korelacji liniowej Pearsona \(r_p\) (ang. Pearson product-moment correlation coefficient, Pearson (1896, 1900)) służy do badania siły związku liniowego pomiędzy dwiema cechami.
Warunki stosowania
- pomiar na skali interwałowej,
- brak obserwacji odstających,
- normalność rozkładu badanych cech lub normalność reszt modelu.
Definicje miar
Współczynnik korelacji liniowej Pearsona \(r_p\) – określa siłę i kierunek związku liniowego pomiędzy dwiema cechami interwałowymi. Wartość \(r_p\in\langle-1;1\rangle\) interpretujemy następująco:
- \(r_p\approx1\) oznacza silną dodatnią zależność liniową, tj. punkty pomiarowe leżą blisko linii prostej, a wzrostowi zmiennej niezależnej odpowiada wzrost zmiennej zależnej;
- \(r_p\approx-1\) oznacza silną ujemną zależność liniową, tj. punkty pomiarowe leżą blisko linii prostej, lecz wzrostowi zmiennej niezależnej odpowiada spadek zmiennej zależnej;
- gdy współczynnik przyjmuje wartość równą lub bardzo bliską zeru, nie istnieje liniowa zależność między badanymi cechami (może jednak istnieć związek nieliniowy).
Wykres 1. Interpretacja graficzna współczynnika \(r_p\).
Gdy jedna z badanych cech jest stała (niezależnie od zmian drugiej cechy), obie cechy nie są związane zależnością, a współczynnika \(r_p\) nie można wyznaczyć.
Współczynnik determinacji \(r_p^2\) – wyraża procent zmienności zmiennej zależnej tłumaczony zmiennością zmiennej niezależnej.
Tworzony model korelacji przedstawia zależność liniową postaci:
gdzie współczynniki \(\beta\) i \(\alpha\) równania regresji liniowej to nachylenie i wyraz wolny prostej regresji.
Wzory:
gdzie:
\(x_i, y_i\) – kolejne wartości cechy \(X\) i \(Y\),
\(\overline{x}, \overline{y}\) – średnie z wartości cechy \(X\) i cechy \(Y\),
\(n\) – liczność próby.
\(R_p\) oznacza współczynnik korelacji Pearsona populacji, natomiast \(r_p\) w próbie.
Współczynniki równania regresji liniowej wyznacza się z wzorów:
Istotność współczynnika korelacji Pearsona
Kiedy stosować ten test:
Test do sprawdzania istotności współczynnika korelacji liniowej Pearsona (ang. test of significance for a Pearson product-moment correlation coefficient) pozwala sprawdzić, czy pomiędzy badanymi cechami populacji istnieje zależność liniowa. Opiera się na współczynniku korelacji liniowej Pearsona \(r_p\) wyliczonym dla próby – im wartość \(r_p\) jest bliższa 0, tym słabszą zależnością związane są badane cechy.
Warunki stosowania
- pomiar na skali interwałowej,
- normalność rozkładu badanych cech w populacji lub normalność reszt modelu.
Jak ustawić analizę
Statystyka \(\to\) Testy parametryczne \(\to\) zależność liniowa (r-Pearsona) (lub poprzez Kreator).

Wykonanie i interpretacja
Przykład 1. (plik wiek-wzrost.pqs)
Wśród uczniów pewnej szkoły baletowej badano zależność pomiędzy wiekiem a wzrostem. W tym celu pobrano próbę obejmującą szesnaścioro dzieci i zapisano dla nich następujące wyniki pomiaru tych cech:
(wiek, wzrost): (5, 128) (5, 129) (5, 135) (6, 132) (6, 137) (6, 140) (7, 148) (7, 150) (8, 135) (8, 142) (8, 151) (9, 138) (9, 153) (10, 159) (10, 160) (10, 162).


Zależność ta jest wprost proporcjonalna, tzn. wraz ze wzrostem wieku dzieci rośnie wysokość ciała. Współczynnik korelacji liniowej Pearsona, a zatem siła związku liniowego pomiędzy wiekiem a wzrostem, wynosi \(r_p=0.8302\). Współczynnik determinacji \(r_p^2=0.6892\) oznacza, że ok. 69% zmienności wzrostu jest tłumaczona zmiennością wieku.
Z równania regresji postaci:
można wyliczyć predykcyjną wartość dla dziecka w wieku np. 6 lat. Przewidywany wzrost takiego dziecka wynosi 136.37 cm.
Hipotezy:
\(\begin{array}{cl} \mathcal{H}_0: & R_p = 0, \\ \mathcal{H}_1: & R_p \ne 0. \end{array}\)
Wzory:
Statystyka testowa ma postać:
gdzie \(\displaystyle SE=\sqrt{\frac{1-r_p^2}{n-2}}\).
Wartość statystyki testowej nie może być wyznaczona, gdy \(r_p=1\) lub \(r_p=-1\) albo gdy \(n<3\). Statystyka testowa ma rozkład \(t\)-Studenta z \(n-2\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Istotność współczynnika nachylenia prostej
Kiedy stosować ten test:
Test \(t\) do sprawdzania istotności współczynników równania regresji liniowej pozwala sprawdzić, czy pomiędzy badanymi cechami populacji istnieje zależność liniowa, opierając się na współczynniku nachylenia prostej \(\beta\) wyliczonym dla próby – im wartość \(\beta\) jest bliższa 0, tym słabszą zależność dopasowana prosta przedstawia. W regresji z jedną zmienną niezależną test ten jest równoważny testowi istotności współczynnika korelacji Pearsona – daje dokładnie tę samą wartość \(p\).
Warunki stosowania
- pomiar na skali interwałowej,
- normalność rozkładu badanych cech w populacji lub normalność reszt modelu.
Wykonanie i interpretacja
Ze względu na równoważność z testem istotności współczynnika korelacji Pearsona przy jednej zmiennej niezależnej, wykonanie i interpretacja tego testu pokrywa się z Przykładem 1 powyżej.
Analiza reszt modelu – wyjaśnienie w module Liniowa Regresja Wieloraka.
Hipotezy:
\(\begin{array}{cl} \mathcal{H}_0: & \beta = 0, \\ \mathcal{H}_1: & \beta \ne 0. \end{array}\)
Wzory:
Statystyka testowa ma postać:
gdzie:
\(\displaystyle SE=\frac{s_{yx}}{sd_x\sqrt{n-1}}\),
\(s_{yx}=sd_y \sqrt{\frac{n-1}{n-2}(1-r^2)}\),
\(sd_x, sd_y\) – odchylenie standardowe wartości cechy \(X\) i cechy \(Y\).
Wartość statystyki testowej nie może być wyznaczona, gdy \(r_p=1\) lub \(r_p=-1\) albo gdy \(n<3\). Statystyka testowa ma rozkład \(t\)-Studenta z \(n-2\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Predykcja
Kiedy stosować:
Predykcja polega na przewidywaniu wartości jednej ze zmiennych (najczęściej zmiennej zależnej \(y_0\)) na podstawie wartości innej zmiennej (najczęściej zmiennej niezależnej \(x_0\)), z wykorzystaniem wyznaczonego równania regresji liniowej. Dokładność wyznaczonej wartości określają obliczone dla niej przedziały predykcji.
Definicje miar
Interpolacja – polega na przewidywaniu wartości zadanej zmiennej leżącej wewnątrz obszaru, dla którego wykonaliśmy model regresji. Interpolacja jest z reguły procedurą bezpieczną – zakłada się tu jedynie ciągłość funkcji wyrażającej zależność obu zmiennych.
Ekstrapolacja – polega na przewidywaniu wartości zadanej zmiennej leżącej poza obszarem, dla którego zbudowaliśmy model regresji. W przeciwieństwie do interpolacji, ekstrapolacja bywa często zabiegiem ryzykownym i dokonuje się jej jedynie w niewielkiej odległości od obszaru, dla którego powstał model regresji.
Jak ustawić analizę
W oknie analizy zależności liniowej Pearsona zaznaczamy przycisk Predykcja i wskazujemy wartości zmiennej niezależnej, dla których chcemy przeprowadzić predykcję.
Wykonanie i interpretacja
Patrz Przykład 1 powyżej – przewidywany wzrost 6-letniego dziecka wyliczony na podstawie równania regresji jest właśnie wynikiem takiej predykcji (interpolacji, ponieważ wiek 6 lat mieści się w zakresie danych, na podstawie których zbudowano model).
PQStat