PQStat Podręcznik Użytkownika PQStat English pqstat.pl

Porównywanie modeli regresji wielorakiej mieszanej

Kiedy stosować:

Porównywanie modeli służy do wyboru takiego zestawu zmiennych niezależnych (efektów stałych), który opisuje dane najlepiej przy możliwie małej liczbie parametrów. Działa tak samo jak porównywanie modeli regresji wielorakiej: porównujemy model pełny z modelem zredukowanym (bez części zmiennych) albo pozwalamy programowi wybrać model automatycznie (dobór wsteczny, w przód, krokowy lub przegląd podzbiorów).

W modelach mieszanych obowiązuje jedna dodatkowa zasada: struktura losowa jest wspólna dla wszystkich porównywanych modeli. Dobór dotyczy wyłącznie efektów stałych, a losowy wyraz wolny, losowe nachylenia i typ kowariancji ustalone w oknie pozostają w każdym z modeli. Zmienna, której nadano losowe nachylenie, pozostaje w każdym porównywanym modelu jako efekt stały (nie można usunąć efektu stałego zmiennej, zachowując jej losowe nachylenie). O tym, czy same efekty losowe są potrzebne, decydują testy LR w raporcie regresji wielorakiej mieszanej.

Definicje miar

Modele porównuje się na podstawie kryteriów informacyjnych AIC, AICc i BIC (im mniejsza wartość, tym lepszy model) oraz testu ilorazu wiarygodności (LR) dla modeli zagnieżdżonych: statystyka \(2(\ell_P-\ell_Z)\) (\(\ell_P\), \(\ell_Z\) – logarytm wiarygodności modelu pełnego i zredukowanego) ma rozkład \(\chi^2\) o liczbie stopni swobody równej liczbie usuniętych zmiennych. Nieistotny wynik oznacza, że usunięte zmienne nie wnoszą informacji i należy wybrać model prostszy; wynik istotny – że model pełny jest istotnie lepszy.

Uwaga! Kryteria informacyjne i test LR dla modeli różniących się efektami stałymi są poprawne tylko przy estymacji metodą największej wiarygodności (ML). Dlatego dobór modeli jest zawsze prowadzony metodą ML, niezależnie od ustawienia Współczynniki modeli. To ustawienie decyduje jedynie, jaką metodą (REML czy ML) mają być policzone tabele współczynników prezentowanych modeli – zalecane REML, bo daje nieobciążone wariancje.

Jak ustawić analizę

Statystyka \(\to\) Modele mieszane \(\to\) Regresja wieloraka mieszana – porównywanie modeli.

W oknie wskazujemy zmienną zależną \(Y\), zmienne modelu pełnego i zmienne modelu zredukowanego (lub kryterium doboru automatycznego), tak jak w porównywaniu modeli regresji wielorakiej. Opcje modelu mieszanego:

  • Zmienna grupująca (ID) – kolumna identyfikująca grupę; wspólna dla wszystkich modeli,
  • Losowe nachylenia (z X modelu pełnego) – zmienne, których efekt różni się między grupami; taka zmienna pozostaje w każdym porównywanym modelu,
  • Kowariancja efektów losowychniezależne lub pełna z korelacją, wspólna dla wszystkich modeli,
  • Współczynniki modeli (dobór: ML)REML lub ML dla tabel współczynników; sam dobór zawsze ML,
  • Stopnie swobody efektów stałychSatterthwaite lub test z Walda w tabelach współczynników.

Wyniki i interpretacja

Raport zawiera ramkę z opisem wspólnej struktury losowej (zmienna grupująca, liczba grup, składniki losowe, kowariancja), tabelę Kryteria informacyjne i testy LR z wartościami \(-2LL\) (ML), AIC, AICc, BIC, \(R^2\) brzegowym i warunkowym każdego modelu oraz testem LR między kolejnymi modelami, a także tabele współczynników porównywanych modeli (efekty stałe warunkowe, z wariancjami efektów losowych każdego modelu). Jeśli dla któregoś modelu wystąpiło dopasowanie osobliwe, jest to zaznaczone w tabeli.

Przykład 1. c.d. przykładu 2 (plik ortodoncja.pqs)
W modelu wzrostu odległości przysadka–szczelina skrzydłowo-szczękowa znalazły się: wiek, płeć i interakcja wiek\(\times\)płeć. Sprawdzimy, czy interakcja (różne tempo wzrostu dziewczynek i chłopców) jest rzeczywiście potrzebna, porównując model pełny z modelem zredukowanym bez interakcji. Struktura losowa: losowy wyraz wolny i losowe nachylenie wieku, kowariancja pełna, wspólne dla obu modeli.

Model pełny ma \(-2LL=348.70\) (ML), AIC \(=364.70\), BIC \(=384.52\); model bez interakcji \(-2LL=354.99\), AIC \(=368.99\), BIC \(=386.33\). Test LR: \(\chi^2=354.99-348.70=6.28\), \(df=1\), \(p=0.012\) – usunięcie interakcji istotnie pogarsza dopasowanie, a oba kryteria informacyjne wskazują model pełny. Zostajemy przy modelu z interakcją: dziewczynki i chłopcy rosną w różnym tempie. Gdybyśmy dodatkowo porównali model z samym wiekiem (\(-2LL=360.72\), AIC \(=372.72\)), okazałoby się, że płeć wnosi informację tylko razem z interakcją – w modelu bez interakcji jej efekt to średnia różnica w całym zakresie wieku (\(b=-2.04\), \(p=0.008\)), która ukrywa fakt, że różnica ta rośnie z wiekiem.

test LR pełny vs bez interakcji: \(\chi^2=6.28\), \(df=1\), \(p=0.012\); AIC \(364.70\) vs \(368.99\)
Interakcja wiek\(\times\)płeć pozostaje w modelu.