Walidacja i predykcja dla regresji logistycznej mieszanej
Kiedy stosować:
Zbudowany model można wykorzystać do predykcji prawdopodobieństwa zdarzenia dla nowych obserwacji i do walidacji na zbiorze testowym, jak w walidacji i predykcji dla regresji logistycznej. Tak jak w regresji wielorakiej mieszanej dostępne są dwa rodzaje predykcji:
- populacyjna – z samych efektów stałych; prawdopodobieństwo dla przeciętnej, nieznanej grupy,
- dla grupy – z efektem losowym (BLUP) grupy znanej modelowi; prawdopodobieństwo dla tego konkretnego pacjenta, ośrodka, stada.
Predykcja wystąpienia zdarzenia (1) lub jego braku (0) polega na porównaniu przewidywanego prawdopodobieństwa z punktem odcięcia (domyślnie 0.5).
Jak ustawić analizę
Statystyka \(\to\) Modele mieszane \(\to\) Regresja logistyczna mieszana – predykcja/walidacja.

Wskazujemy model zapisany w programie (raport regresji logistycznej mieszanej przypisany do arkusza) – ręczne wpisanie współczynników nie jest możliwe, bo potrzebne są efekty losowe grup. Następnie wskazujemy kolumny z nowymi wartościami zmiennych, ewentualnie obserwowane \(Y\) (walidacja) oraz opcję Predykcja dla grupy (BLUP wg kolumny ID) z kolumną identyfikatora. Dla identyfikatorów nieznanych modelowi predykcja jest populacyjna.
Wyniki i interpretacja
Raport podaje rodzaj predykcji, liczbę obserwacji, dla których użyto BLUP grupy, oraz dla każdej obserwacji przewidywane prawdopodobieństwo i przewidywaną klasę. W trybie walidacji dodatkowo klasyfikację (czułość, swoistość, udział poprawnych) i AUC na zbiorze testowym.
Przykład 1. c.d. przykładu 1 (plik oddziałyZakażenia.pqs)
Na podstawie modelu zakażeń miejsca operowanego (czas operacji i cukrzyca jako efekty stałe, losowy wyraz wolny oddziału i losowe nachylenie czasu operacji) chcemy oszacować ryzyko zakażenia u pacjenta z cukrzycą, którego operacja trwała o jedno odchylenie standardowe dłużej niż przeciętna (CzasOperacji \(=1\), Cukrzyca \(=1\)), gdyby był operowany na oddziale 1, na oddziale 2 albo na nowym oddziale, którego model nie zna.
Najpierw budujemy i zapisujemy model w oknie Regresja logistyczna mieszana: Zakażenie jako \(Y\) (Grupa (1) \(=1\)), Oddział jako zmienną grupującą, CzasOperacji i Cukrzyca jako \(X\), CzasOperacji na liście losowych nachyleń, kowariancja pełna, z włączoną opcją Efekty losowe grup (BLUP). Następnie dopisujemy do arkusza trzy wiersze z wartościami 1 i 1 w kolumnach CzasOperacji i Cukrzyca oraz identyfikatorami oddziałów 1, 2 i 99, ustawiamy filtr na te wiersze i w oknie predykcji wskazujemy zapisany model oraz opcję Predykcja dla grupy (BLUP wg kolumny ID) z kolumną Oddział.

Efekty stałe modelu: wyraz wolny \(-0.738\), czas operacji \(0.822\), cukrzyca \(0.359\); BLUP oddziału 1: wyraz wolny \(-1.145\), nachylenie \(-0.182\); oddziału 2: \(+1.193\) i \(+0.041\). Dla nowego oddziału (99) predykcja jest populacyjna: logit \(=-0.738+0.822+0.359=0.443\), prawdopodobieństwo \(0.61\). Dla oddziału 1 program dodaje jego BLUP wyrazu wolnego i nachylenia (pomnożone przez czas operacji): logit \(=0.443-1.145-0.182\cdot1=-0.884\), prawdopodobieństwo \(0.29\). Dla oddziału 2: logit \(=0.443+1.193+0.041=1.677\), prawdopodobieństwo \(0.84\). Ten sam pacjent ma więc ryzyko zakażenia od 29% do 84% w zależności od oddziału, a predykcja populacyjna (61%) jest tylko środkiem tego zakresu. Przy punkcie odcięcia 0.5 pacjent na oddziale 1 zostałby zaklasyfikowany jako „bez zakażenia”, na oddziałach 2 i nowym – jako „zakażenie”. W trybie walidacji (ze wskazaną kolumną Zakażenie) na zbiorze testowym raport podałby dodatkowo czułość, swoistość i AUC.
PQStat