PQStat Podręcznik Użytkownika PQStat English pqstat.pl

Współczynniki korelacji liniowej

Kiedy stosować:

Współczynnik korelacji liniowej Pearsona \(r_p\) (ang. Pearson product-moment correlation coefficient, Pearson (1896, 1900)) służy do badania siły związku liniowego pomiędzy dwiema cechami.

Warunki stosowania

Definicje miar

Współczynnik korelacji liniowej Pearsona \(r_p\) – określa siłę i kierunek związku liniowego pomiędzy dwiema cechami interwałowymi. Wartość \(r_p\in\langle-1;1\rangle\) interpretujemy następująco:

  • \(r_p\approx1\) oznacza silną dodatnią zależność liniową, tj. punkty pomiarowe leżą blisko linii prostej, a wzrostowi zmiennej niezależnej odpowiada wzrost zmiennej zależnej;
  • \(r_p\approx-1\) oznacza silną ujemną zależność liniową, tj. punkty pomiarowe leżą blisko linii prostej, lecz wzrostowi zmiennej niezależnej odpowiada spadek zmiennej zależnej;
  • gdy współczynnik przyjmuje wartość równą lub bardzo bliską zeru, nie istnieje liniowa zależność między badanymi cechami (może jednak istnieć związek nieliniowy).

Wykres 1. Interpretacja graficzna współczynnika \(r_p\).

figure 1

Gdy jedna z badanych cech jest stała (niezależnie od zmian drugiej cechy), obie cechy nie są związane zależnością, a współczynnika \(r_p\) nie można wyznaczyć.

Uwaga! Błędem jest wyznaczanie współczynnika korelacji, gdy w próbie występują obserwacje odstające, które mogą całkowicie przekłamać wartość i znak współczynnika korelacji Pearsona, gdy próba jest wyraźnie niejednorodna, bądź gdy badana zależność wyraźnie przyjmuje kształt inny niż liniowy.

Współczynnik determinacji \(r_p^2\) – wyraża procent zmienności zmiennej zależnej tłumaczony zmiennością zmiennej niezależnej.

Tworzony model korelacji przedstawia zależność liniową postaci:

\[ Y=\beta X+\alpha, \]

gdzie współczynniki \(\beta\) i \(\alpha\) równania regresji liniowej to nachylenie i wyraz wolny prostej regresji.

DLA ZAINTERESOWANYCH

Wzory:

\[ r_p=\frac{\sum_{i=1}^n(x_i-\overline{x})(y_i-\overline{y})}{\sqrt{\sum_{i=1}^n(x_i-\overline{x})^2}\sqrt{\sum_{i=1}^n(y_i-\overline{y})^2}}, \]

gdzie:
\(x_i, y_i\) – kolejne wartości cechy \(X\) i \(Y\),
\(\overline{x}, \overline{y}\) – średnie z wartości cechy \(X\) i cechy \(Y\),
\(n\) – liczność próby.

\(R_p\) oznacza współczynnik korelacji Pearsona populacji, natomiast \(r_p\) w próbie.

Współczynniki równania regresji liniowej wyznacza się z wzorów:

\[ \displaystyle{\beta=\frac{\sum_{i=1}^n(x_i-\overline{x})(y_i-\overline{y})}{\sum_{i=1}^n(x_i-\overline{x})^2}}, \qquad \alpha=\overline{y}-\beta\overline{x}. \]

Istotność współczynnika korelacji Pearsona

Kiedy stosować ten test:

Test do sprawdzania istotności współczynnika korelacji liniowej Pearsona (ang. test of significance for a Pearson product-moment correlation coefficient) pozwala sprawdzić, czy pomiędzy badanymi cechami populacji istnieje zależność liniowa. Opiera się na współczynniku korelacji liniowej Pearsona \(r_p\) wyliczonym dla próby – im wartość \(r_p\) jest bliższa 0, tym słabszą zależnością związane są badane cechy.

Warunki stosowania

Jak ustawić analizę

Statystyka \(\to\) Testy parametryczne \(\to\) zależność liniowa (r-Pearsona) (lub poprzez Kreator).

Wykonanie i interpretacja

Przykład 1. (plik wiek-wzrost.pqs)
Wśród uczniów pewnej szkoły baletowej badano zależność pomiędzy wiekiem a wzrostem. W tym celu pobrano próbę obejmującą szesnaścioro dzieci i zapisano dla nich następujące wyniki pomiaru tych cech:
(wiek, wzrost): (5, 128) (5, 129) (5, 135) (6, 132) (6, 137) (6, 140) (7, 148) (7, 150) (8, 135) (8, 142) (8, 151) (9, 138) (9, 153) (10, 159) (10, 160) (10, 162).

\(p=0.000069\) (istotne statystycznie, \(\alpha=0.05\))
Istnieje zależność liniowa pomiędzy wiekiem a wzrostem dla populacji dzieci badanej szkoły.


Zależność ta jest wprost proporcjonalna, tzn. wraz ze wzrostem wieku dzieci rośnie wysokość ciała. Współczynnik korelacji liniowej Pearsona, a zatem siła związku liniowego pomiędzy wiekiem a wzrostem, wynosi \(r_p=0.8302\). Współczynnik determinacji \(r_p^2=0.6892\) oznacza, że ok. 69% zmienności wzrostu jest tłumaczona zmiennością wieku.

Z równania regresji postaci:

\[ wzrost=5.09\cdot wiek +105.83 \]

można wyliczyć predykcyjną wartość dla dziecka w wieku np. 6 lat. Przewidywany wzrost takiego dziecka wynosi 136.37 cm.

DLA ZAINTERESOWANYCH

Hipotezy:

\(\begin{array}{cl} \mathcal{H}_0: & R_p = 0, \\ \mathcal{H}_1: & R_p \ne 0. \end{array}\)

Wzory:
Statystyka testowa ma postać:

\[ t=\frac{r_p}{SE}, \]

gdzie \(\displaystyle SE=\sqrt{\frac{1-r_p^2}{n-2}}\).

Wartość statystyki testowej nie może być wyznaczona, gdy \(r_p=1\) lub \(r_p=-1\) albo gdy \(n<3\). Statystyka testowa ma rozkład \(t\)-Studenta z \(n-2\) stopniami swobody.

Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).

Istotność współczynnika nachylenia prostej

Kiedy stosować ten test:

Test \(t\) do sprawdzania istotności współczynników równania regresji liniowej pozwala sprawdzić, czy pomiędzy badanymi cechami populacji istnieje zależność liniowa, opierając się na współczynniku nachylenia prostej \(\beta\) wyliczonym dla próby – im wartość \(\beta\) jest bliższa 0, tym słabszą zależność dopasowana prosta przedstawia. W regresji z jedną zmienną niezależną test ten jest równoważny testowi istotności współczynnika korelacji Pearsona – daje dokładnie tę samą wartość \(p\).

Warunki stosowania

Wykonanie i interpretacja

Ze względu na równoważność z testem istotności współczynnika korelacji Pearsona przy jednej zmiennej niezależnej, wykonanie i interpretacja tego testu pokrywa się z Przykładem 1 powyżej.

Analiza reszt modelu – wyjaśnienie w module Liniowa Regresja Wieloraka.

DLA ZAINTERESOWANYCH

Hipotezy:

\(\begin{array}{cl} \mathcal{H}_0: & \beta = 0, \\ \mathcal{H}_1: & \beta \ne 0. \end{array}\)

Wzory:
Statystyka testowa ma postać:

\[ t=\frac{\beta}{SE} \]

gdzie:
\(\displaystyle SE=\frac{s_{yx}}{sd_x\sqrt{n-1}}\),
\(s_{yx}=sd_y \sqrt{\frac{n-1}{n-2}(1-r^2)}\),
\(sd_x, sd_y\) – odchylenie standardowe wartości cechy \(X\) i cechy \(Y\).

Wartość statystyki testowej nie może być wyznaczona, gdy \(r_p=1\) lub \(r_p=-1\) albo gdy \(n<3\). Statystyka testowa ma rozkład \(t\)-Studenta z \(n-2\) stopniami swobody.

Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).

Predykcja

Kiedy stosować:

Predykcja polega na przewidywaniu wartości jednej ze zmiennych (najczęściej zmiennej zależnej \(y_0\)) na podstawie wartości innej zmiennej (najczęściej zmiennej niezależnej \(x_0\)), z wykorzystaniem wyznaczonego równania regresji liniowej. Dokładność wyznaczonej wartości określają obliczone dla niej przedziały predykcji.

Definicje miar

Interpolacja – polega na przewidywaniu wartości zadanej zmiennej leżącej wewnątrz obszaru, dla którego wykonaliśmy model regresji. Interpolacja jest z reguły procedurą bezpieczną – zakłada się tu jedynie ciągłość funkcji wyrażającej zależność obu zmiennych.

Ekstrapolacja – polega na przewidywaniu wartości zadanej zmiennej leżącej poza obszarem, dla którego zbudowaliśmy model regresji. W przeciwieństwie do interpolacji, ekstrapolacja bywa często zabiegiem ryzykownym i dokonuje się jej jedynie w niewielkiej odległości od obszaru, dla którego powstał model regresji.

Jak ustawić analizę

W oknie analizy zależności liniowej Pearsona zaznaczamy przycisk Predykcja i wskazujemy wartości zmiennej niezależnej, dla których chcemy przeprowadzić predykcję.

Wykonanie i interpretacja

Patrz Przykład 1 powyżej – przewidywany wzrost 6-letniego dziecka wyliczony na podstawie równania regresji jest właśnie wynikiem takiej predykcji (interpolacji, ponieważ wiek 6 lat mieści się w zakresie danych, na podstawie których zbudowano model).