Analiza Hotellinga, zaproponowana przez Hotellinga (1931)[83] (1947)[84] i Mahalanobisa (1930[109], 1936[110]), jest rozszerzeniem testów \(t\)-Studenta na dziedzinę wielu zmiennych. W rezultacie jednoczesnej analizie możemy poddawać wiele różnych cech badanych obiektów.
Test T-kwadrat Hotellinga dla pojedynczej próby
Kiedy stosować ten test:
Test pozwala sprawdzić, czy \(k\) zmiennych w badanej populacji \(X_1,X_2,...,X_k\) charakteryzuje się średnimi zadanymi przez badacza – jest wielowymiarowym rozszerzeniem testu \(t\)-Studenta dla pojedynczej próby.
Warunki stosowania
- pomiar na skali interwałowej,
- wielowymiarowy rozkład normalny lub normalność rozkładu każdej badanej zmiennej.
Przykład – interpretacja elipsy testu Hotellinga dla dwóch zmiennych
Zadany punkt opisany przez wartości średnie (\(\mu_0=(0,0)\)) znajduje się poza elipsą, co oznacza, że test Hotellinga odrzuca hipotezę \(\mathcal{H}_0\), ale stosując podejście jednowymiarowe (przedziały ufności dla każdej zmiennej oddzielnie), nie jesteśmy w stanie odrzucić hipotezy \(\mathcal{H}_0\), by wskazać zmienną, której dotyczą różnice.
Jak ustawić analizę
Statystyka \(\to\) Testy parametryczne \(\to\) T-kwadrat Hotellinga.

Wykonanie i interpretacja
Przykład 1. (plik sport.pqs)
Przebadano grupę sportowców, by uzyskać informację między innymi o takich parametrach zdrowotnych jak:
RBC – liczba czerwonych krwinek,
Hg – hemoglobina [g/dl],
Ferr – ferrytyna [µg/l].
Chcemy wiedzieć, na ile bliskie oczekiwanym przez badaczy wartościom są średnie poziomy RBC, hemoglobiny i ferrytyny dla sportowców uprawiających tzw. sporty „wodne”. Oczekiwane średnie to:
RBC = 4.8,
Hg = 15 [g/dl],
Ferr = 100 [µg/l].
Ponieważ arkusz danych zawiera informacje o badanych parametrach dla większej grupy sportowców, w oknie analizy osoby, które uprawiają sporty wodne, wskazujemy poprzez filtr danych.

Różnic możemy poszukiwać w wyznaczonych jednoczesnych przedziałach ufności lub w przedziałach z korektą Bonferroniego. Dla ferrytyny jednoczesny 95% przedział ufności znajduje się poniżej zadanej wartości, co świadczy o niższej populacyjnej wartości ferrytyny niż zadana przez badaczy. Przedział dla RBC i hemoglobiny zawiera zadane wartości, co wskazuje na brak istotnych statystycznie różnic.

Nieco węższe przedziały uzyskamy, wykorzystując poprawkę Bonferroniego – wówczas nie tylko przedział dla ferrytyny znajduje się poniżej zadanej wartości, ale również przedział dla hemoglobiny.

Podejście jednowymiarowe, ze względu na swoją prostotę, wykorzystywane jest najczęściej. Możemy tu wybrać mniej konserwatywne korekty wielokrotnych porównań niż poprawka Bonferroniego lub Sidaka, uzyskując w ten sposób różnice dotyczące wszystkich badanych parametrów. By wykonać korektę wartości \(p\) testu \(t\)-Studenta, należy przekopiować te wartości do jednej kolumny nowego arkusza danych i z menu Statystyka wybrać Korektę wielokrotnych porównań.


Hipotezy:
gdzie:
\(\mu=(\mu_1, \mu_2,..., \mu_k)\) – średnie zmiennych w populacji reprezentowanej przez próbę,
\(\mu_0=(\mu_{01}, \mu_{02},..., \mu_{0k})\) – zadane przez badacza wartości średnich.
Wzory: statystyka testowa ma postać:
gdzie:
\(n=n_1=n_2=...=n_k\) – liczności poszczególnych zmiennych w próbie,
\(T^2 = n(\overline{x}-\mu_0)^TS^{-1}(\overline{x}-\mu_0)\) – pierwotna statystyka testowa Hotellinga o rozkładzie \(\chi^2\) (zalecana dla prób o dużych licznościach),
\(\overline{x}=(\overline{x}_1, \overline{x}_2,..., \overline{x}_k)\) – średnie zmiennych w próbie,
\(S\) – macierz kowariancji.
Statystyka ta podlega rozkładowi F Snedecora z \(k\) i \(n-k\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Jednoczesne przedziały ufności
Gdy po wykonanej analizie szukamy zmiennych, których dotyczą różnice, wyznaczamy jednoczesne przedziały ufności średnich:
lub przedziały z poprawką Bonferroniego, w celu sprawdzenia, czy znajduje się w nich zadana wartość. Jeśli zadana wartość znajduje się w wyznaczonym przedziale, oznacza to, że w rzeczywistości średnia danej zmiennej może być równa tej zadanej wartości. Stosując tę metodę, należy jednak pamiętać, że wyznaczone przedziały nie uwzględniają powiązań pomiędzy poszczególnymi zmiennymi (które uwzględnia test Hotellinga), a jedynie wielokrotne testowanie.
Szukając zmiennych, których dotyczą różnice, możemy również zastosować podejście jednowymiarowe, wykonując porównania testem \(t\)-Studenta dla pojedynczej próby oddzielnie dla poszczególnych zmiennych. Niestety, nie uwzględnimy tym samym wzajemnych powiązań, ale uzyskane wartości \(p\) testu \(t\)-Studenta możemy skorygować w dziale Wielokrotne porównania.
Test T-kwadrat Hotellinga dla grup zależnych
Kiedy stosować ten test:
Stosuje się w sytuacji, gdy pomiarów badanych \(k\) zmiennych dokonujemy dwukrotnie w różnych warunkach (przy czym zakładamy, że wariancje zmiennych w obu pomiarach są sobie bliskie). Jeśli pierwszy pomiar oznaczymy przez \(X_1,X_2,...,X_k\), a drugi przez \(Y_1,Y_2,...,Y_k\), weryfikujemy hipotezę, że populacyjne średnie zmiennych z pierwszego pomiaru są takie same jak z pomiaru drugiego.
Warunki stosowania
- pomiar na skali interwałowej,
- wielowymiarowy rozkład normalny lub normalność rozkładu każdej badanej zmiennej,
- model zależny.
Jak ustawić analizę
Statystyka \(\to\) Testy parametryczne \(\to\) T-kwadrat Hotellinga dla grup zależnych.

Wykonanie i interpretacja
Przykład 2. (plik nadcisnienie.pqs)
W grupie osób chorujących na nadciśnienie badano wpływ zastosowanego leczenia na zmiany wskaźników takich jak: cholesterol we frakcji HDL i LDL, hemoglobina (HGB), trójglicerydy (TG) oraz wartości ciśnienia skurczowego i rozkurczowego krwi. Pomiary od 44 pacjentów pobrano dwukrotnie (przed leczeniem i po 3 miesiącach stosowania leczenia). Następnie porównano uzyskane wyniki.

Przedziały ufności dla ciśnienia skurczowego oraz rozkurczowego znajdują się powyżej wartości 0, co świadczy o istotnym obniżeniu tych parametrów na skutek leczenia. Przedziały dla pozostałych parametrów zawierają wartość 0, więc nie mamy dowodów na ich zmianę na skutek leczenia.


Podejście jednowymiarowe, ze względu na swoją prostotę, wykorzystywane jest najczęściej. Stosując to podejście wraz z korektą wielokrotnych porównań, również uznamy, że różnice dotyczą jedynie wartości ciśnienia. By wykonać korektę wartości \(p\) testu \(t\)-Studenta, należy przekopiować te wartości do jednej kolumny nowego arkusza danych i z menu Statystyka wybrać Korektę wielokrotnych porównań.


Definicja: równoważnie, gdy wyznaczymy różnice pomiędzy parami pomiarów \(d_1, d_2, ..., d_k\), hipoteza wskaże, że średnie dla różnic w badanej populacji wynoszą 0.
Hipotezy:
gdzie \(\mu_0=(\mu_{01}, \mu_{02},..., \mu_{0k})\) – populacyjne średnie różnic pomiaru pierwszego i drugiego.
Wzory: statystyka testowa ma postać:
gdzie:
\(n=n_1=n_2=...=n_k\) – liczności poszczególnych różnic w próbie,
\(T^2 = n(\overline{x}-\overline{y})^TS^{-1}(\overline{x}-\overline{y})\) – pierwotna statystyka testowa Hotellinga o rozkładzie \(\chi^2\) (zalecana dla prób o dużych licznościach),
\(\overline{x}=(\overline{x}_1, \overline{x}_2,..., \overline{x}_k)\) – średnie zmiennych w próbie dla pierwszego pomiaru,
\(\overline{y}=(\overline{y}_1, \overline{y}_2,..., \overline{y}_k)\) – średnie zmiennych w próbie dla drugiego pomiaru,
\(S\) – macierz kowariancji różnic pomiaru pierwszego i drugiego.
Statystyka ta podlega rozkładowi F Snedecora z \(k\) i \(n-k\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Jednoczesne przedziały ufności
Gdy po wykonanej analizie szukamy zmiennych, których dotyczą różnice, wyznaczamy jednoczesne przedziały ufności dla różnic średnich:
lub przedziały z poprawką Bonferroniego, w celu sprawdzenia, czy znajduje się w nich wartość 0. Jeśli różnica może wynosić 0, oznacza to, że w rzeczywistości różnica pomiędzy badanymi wartościami może nie istnieć. Stosując tę metodę, należy pamiętać, że wyznaczone przedziały nie uwzględniają powiązań pomiędzy zmiennymi towarzyszącymi (które uwzględnia test Hotellinga), a jedynie wielokrotne testowanie.
Szukając zmiennych, których dotyczą różnice, możemy również zastosować podejście jednowymiarowe, wykonując porównania testem \(t\)-Studenta dla grup zależnych oddzielnie dla poszczególnych zmiennych. Niestety, nie uwzględnimy tym samym wzajemnych powiązań, ale uzyskane wartości \(p\) testu \(t\)-Studenta możemy skorygować w dziale Wielokrotne porównania.
Test T-kwadrat Hotellinga dla grup niezależnych
Kiedy stosować ten test:
Test pozwala sprawdzić równość średnich badanych \(k\) zmiennych \(X_1,X_2,...,X_k\) z populacji pierwszej i średnich tych samych \(k\) zmiennych \(Y_1,Y_2,...,Y_k\) z populacji drugiej.
Warunki stosowania
- pomiar na skali interwałowej,
- wielowymiarowy rozkład normalny w obu populacjach lub normalność rozkładu każdej badanej zmiennej w obu populacjach,
- model niezależny,
- równość wariancji badanych zmiennych obu populacji lub równość macierzy kowariancji – warunek szczególnie istotny w przypadku grup o różnych licznościach; gdy warunek nie jest spełniony, powinna zostać wyznaczona korekta.
Jak ustawić analizę
Statystyka \(\to\) Testy parametryczne \(\to\) T-kwadrat Hotellinga dla grup niezależnych.

Wykonanie i interpretacja
Przykład 3. (plik sport.pqs)
Przebadano grupę sportowców, by uzyskać informację o parametrach zdrowotnych takich jak:
| RBC – liczba czerwonych krwinek, | SSF – suma fałdów skórno-tłuszczowych [mm], |
| WBC – liczba białych krwinek, | % Bfat – zawartość tłuszczu w organizmie, |
| Hc – hematokryt [%], | LBM – beztłuszczowa masa ciała [kg], |
| Hg – hemoglobina [g/dl], | Wzrost [cm], |
| Ferr – ferrytyna [µg/l], | Masa ciała [kg]. |
Chcemy wiedzieć, czy kobiety i mężczyźni uprawiający zawodowo analizowane rodzaje sportu różnią się poziomami tych parametrów.
Ze względu na różnice dotyczące kowariancji analizowanych parametrów (wartość \(p\) testu Boxa \(<0.000001\)), analizę przeprowadzamy przy włączonej korekcie różnych macierzy kowariancji.

Uzyskany wynik skorygowanej statystyki Hotellinga jest przedstawiony poniżej.

Według jednoczesnych przedziałów ufności (oraz według przedziałów z korektą Bonferroniego) różnice dotyczą: RBC, Hc, Hg, Ferr oraz LBM (średnio kobiety uzyskują niższe wartości), a także SSF i % Bfat (średnio mężczyźni uzyskują niższe wartości). Pozostałe parametry, czyli WBC, wzrost i masa ciała, nie różnią się istotnie.


Ze względu na swoją prostotę najczęściej stosuje się podejście jednowymiarowe, choć nie uwzględnia ono wielokrotnego testowania ani wzajemnych powiązań między zmiennymi. Jego wyniki wskazują, że różnice dotyczą wszystkich badanych parametrów za wyjątkiem WBC, przy czym wyniki testu \(t\)-Studenta interpretujemy po uwzględnieniu korekty Cochrana-Coxa lub bez tej korekty, w zależności od spełnienia założenia równości wariancji (wynik testu Fishera-Snedecora). Chcąc uwzględnić wielokrotne testowanie, należałoby w tym przypadku zastosować jedną z korekt wartości \(p\), opisanych w dziale Wielokrotne porównania.



Hipotezy:
gdzie:
\(\mu_x=(\mu_{x1}, \mu_{x2},..., \mu_{xk})\) – średnie zmiennych w populacji pierwszej,
\(\mu_y=(\mu_{y1}, \mu_{y2},..., \mu_{yk})\) – średnie zmiennych w populacji drugiej.
Wzory: statystyka testowa ma postać:
gdzie:
\(n=n_x+n_y-1\),
\(n_x\), \(n_y\) – liczności pierwszej i drugiej próby (liczności poszczególnych zmiennych takie same),
\(T^2 = (\overline{x}-\overline{y})^T\left(S\left(\frac{1}{n_x}+\frac{1}{n_y}\right)\right)^{-1}(\overline{x}-\overline{y})\) – pierwotna statystyka testowa Hotellinga o rozkładzie \(\chi^2\) (zalecana dla prób o dużych licznościach),
\(\overline{x}=(\overline{x}_1, \overline{x}_2,..., \overline{x}_k)\) – średnie zmiennych w próbie pierwszej,
\(\overline{y}=(\overline{y}_1, \overline{y}_2,..., \overline{y}_k)\) – średnie zmiennych w próbie drugiej,
\(S\) – macierz kowariancji wspólna (ang. pooled) dla obu prób.
Statystyka ta podlega rozkładowi F Snedecora z \(k\) i \(n-k\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Jednoczesne przedziały ufności
Gdy po wykonanej analizie szukamy zmiennych, których dotyczą różnice, wyznaczamy jednoczesne przedziały ufności dla różnic średnich:
lub przedziały z poprawką Bonferroniego, w celu sprawdzenia, czy znajduje się w nich wartość 0. Jeśli różnica może wynosić 0, oznacza to, że w rzeczywistości różnica pomiędzy badanymi wartościami może nie istnieć. Stosując tę metodę, należy pamiętać, że wyznaczone przedziały nie uwzględniają powiązań pomiędzy zmiennymi (które uwzględnia test Hotellinga), a jedynie wielokrotne testowanie.
Szukając zmiennych, których dotyczą różnice, możemy również zastosować podejście jednowymiarowe, wykonując porównania testem \(t\)-Studenta dla grup niezależnych oddzielnie dla poszczególnych zmiennych. Niestety, nie uwzględnimy tym samym wzajemnych powiązań, ale uzyskane wartości \(p\) testu \(t\)-Studenta możemy skorygować w dziale Wielokrotne porównania.
Test T-kwadrat Hotellinga dla grup niezależnych z korektą dla różnych wariancji
Kiedy stosować ten test:
Poprawka dotyczy testu T-kwadrat Hotellinga dla grup niezależnych i jest wyliczana wówczas, gdy wariancje badanych zmiennych w obu populacjach są różne.
Jak ustawić analizę
Korekta jest opcją dostępną w tym samym oknie co test T-kwadrat Hotellinga dla grup niezależnych.

Wykonanie i interpretacja
Patrz Przykład 3 powyżej – ze względu na istotny wynik testu Boxa, analizę tam przeprowadzono właśnie z zastosowaniem tej korekty.
Wzory: statystyka testowa ma postać:
gdzie:
\(n=n_x+n_y-1\),
\(n_x\), \(n_y\) – liczności pierwszej i drugiej próby (liczności poszczególnych zmiennych równe),
\(T^2 = (\overline{x}-\overline{y})^T\left(\frac{S_x}{n_x}+\frac{S_y}{n_y}\right)^{-1}(\overline{x}-\overline{y})\) – pierwotna statystyka testowa Hotellinga o rozkładzie \(\chi^2\) (zalecana dla prób o dużych licznościach),
\(\overline{x}=(\overline{x}_1, \overline{x}_2,..., \overline{x}_k)\) – średnie zmiennych w próbie pierwszej,
\(\overline{y}=(\overline{y}_1, \overline{y}_2,..., \overline{y}_k)\) – średnie zmiennych w próbie drugiej,
\(S_x\), \(S_y\) – macierz kowariancji dla pierwszej i drugiej próby.
Statystyka ta podlega rozkładowi F Snedecora z \(k\) i \(m\) stopniami swobody (gdzie \(m\) to liczba stopni swobody skorygowana ze względu na różne wariancje).
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
Jednoczesne przedziały ufności
Gdy po wykonanej analizie szukamy zmiennych, których dotyczą różnice, wyznaczamy jednoczesne przedziały ufności dla różnic średnich:
lub przedziały z poprawką Bonferroniego, w celu sprawdzenia, czy znajduje się w nich wartość 0. Jeśli różnica może wynosić 0, oznacza to, że w rzeczywistości różnica pomiędzy badanymi wartościami może nie istnieć. Stosując tę metodę, należy pamiętać, że wyznaczone przedziały nie uwzględniają powiązań pomiędzy zmiennymi (które uwzględnia test Hotellinga), a jedynie wielokrotne testowanie.
Szukając zmiennych, których dotyczą różnice, możemy również zastosować podejście jednowymiarowe, wykonując porównania testem \(t\)-Studenta z korektą Cochrana-Coxa oddzielnie dla poszczególnych zmiennych. Niestety, nie uwzględnimy tym samym wzajemnych powiązań, ale uzyskane wartości \(p\) testu \(t\)-Studenta możemy skorygować w dziale Wielokrotne porównania.
Test Box'a równości macierzy kowariancji
Kiedy stosować ten test:
Test służy do porównania dwóch lub więcej (\(m \geq 2\)) macierzy kowariancji opisujących niezależne populacje.
Warunki stosowania
- pomiar na skali interwałowej,
- wielowymiarowy rozkład normalny w badanych populacjach lub normalność rozkładu każdej badanej zmiennej w każdej populacji,
- model niezależny.
Jak ustawić analizę
Test Boxa jest wyliczany opcjonalnie w Hotellingu dla grup niezależnych lub w analizie MANOVA.
Wykonanie i interpretacja
Patrz Przykład 3.
Hipotezy:
gdzie \(\Sigma_1, \Sigma_2, ..., \Sigma_m\) – populacyjne macierze kowariancji.
Wzory: statystyka testowa ma postać:
gdzie:
\(M=(n-m)\ln|S|-\sum_{j=1}^m(n_j-1)\ln|S_j|\),
\(S\) – wspólna (ang. pooled) macierz kowariancji,
\(S_j\) – macierz kowariancji dla \(j\)-tej próby,
\(b=\frac{df_1}{1-c_1-\frac{df_1}{df-2}}\),
\(df_1=\frac{k(k+1)(m-1)}{2}\),
\(df_2=\frac{df_1+2}{|c_2-c_1^2|}\),
\(k\) – liczba analizowanych zmiennych,
\(n=n_1=n_2=...=n_k\) – liczności poszczególnych zmiennych w próbie.
Statystyka ta podlega rozkładowi F Snedecora z \(df_1\) i \(df_2\) stopniami swobody.
Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).
PQStat