Walidacja i predykcja dla regresji wielorakiej
Kiedy stosować:
Walidacja modelu to sprawdzenie jego jakości. W pierwszej kolejności wykonywana jest na danych, na których model był zbudowany (tzw. zbiór uczący), czyli zwracana jest w raporcie opisującym uzyskany model. By można było z większą pewnością osądzić, na ile model nadaje się do prognozy nowych danych, ważnym elementem walidacji jest zastosowanie modelu do danych, które nie były wykorzystywane w estymacji modelu. Jeśli podsumowanie w oparciu o dane uczące będzie satysfakcjonujące, tzn. wyznaczane błędy, współczynniki \(R^2\) i kryteria informacyjne będą na zadowalającym nas poziomie, a podsumowanie w oparciu o nowe dane (tzw. zbiór testowy) będzie równie korzystne, wówczas z dużym prawdopodobieństwem można uznać, że taki model nadaje się do predykcji. Dane testujące powinny pochodzić z tej samej populacji, z której były wybrane dane uczące. Często jest tak, że przed przystąpieniem do budowy modelu zbieramy dane, a następnie w sposób losowy dzielimy je na zbiór uczący, czyli dane które posłużą do budowy modelu, i zbiór testowy, czyli dane które posłużą do dodatkowej walidacji modelu.
Predykcja – najczęściej ostatnim etapem analizy regresji jest wykorzystanie zbudowanego i uprzednio zweryfikowanego modelu do predykcji.
Definicje miar
Oszacowana wartość wyliczana jest z pewnym błędem. Dlatego też dodatkowo dla przewidzianej przez model wartości wyznaczane są granice wynikające z błędu:
- dla wartości oczekiwanej wyznaczane są granice ufności,
- dla pojedynczego punktu wyznaczane są granice predykcji.
Jak ustawić analizę
Statystyki zaawansowane \(\to\) Modele wielowymiarowe \(\to\) Regresja wieloraka – predykcja/walidacja.

By dokonać walidacji lub predykcji, należy wskazać model, na podstawie którego chcemy jej dokonać. Możemy dokonać jej na bazie:
- zbudowanego w PQStat modelu regresji wielorakiej – wystarczy wybrać model spośród modeli przypisanych do danego arkusza, a liczba zmiennych i współczynniki modelu zostaną ustawione automatycznie; zbiór testowy powinien się znaleźć w tym samym arkuszu co zbiór uczący;
- modelu niezbudowanego w programie PQStat, ale uzyskanego z innego źródła (np. opisanego w przeczytanej przez nas pracy naukowej) – w oknie analizy należy podać liczbę zmiennych oraz wpisać współczynniki dotyczące każdej z nich.
W oknie analizy należy wskazać te nowe zmienne, które powinny zostać wykorzystane do walidacji lub predykcji. Predykcja dla jednego obiektu może być wykonywana wraz z budową modelu, czyli w oknie analizy Statystyki zaawansowane\(\to\)Modele wielowymiarowe\(\to\)Regresja wieloraka, natomiast predykcja dla większej grupy nowych danych jest wykonywana poprzez menu Statystyki zaawansowane\(\to\)Modele wielowymiarowe\(\to\)Regresja wieloraka – predykcja/walidacja.
Wykonanie i interpretacja
Kontynuacja przykładu 1 (plik wydawca.pqs): do przewidywania zysku brutto ze sprzedaży książek wydawca zbudował model regresji w oparciu o zbiór uczący pozbawiony pozycji 16 (czyli 39 książek). W modelu znalazły się: koszty produkcji, koszty reklamy i popularność autora (1=autor popularny, 0=nie). Zbudujemy raz jeszcze ten model w oparciu o zbiór uczący, a następnie, by się upewnić, że model będzie działał poprawnie, zwalidujemy go na testowym zbiorze danych. Jeśli model przejdzie tę próbę, to będziemy go stosować do predykcji dla nowych pozycji książkowych. By korzystać z odpowiednich zbiorów, ustawiamy każdorazowo filtr danych.


W tym celu skorzystamy z danych trzech nowych pozycji książkowych dopisanych na końcu zbioru. Wybierzemy opcję Predykcja, ustawimy filtr na nowy zbiór danych i użyjemy naszego modelu do tego, by przewidzieć zysk brutto dla tych książek.

Okazuje się, że najwyższy zysk brutto (pomiędzy 64 a 85 tys. dolarów) jest prognozowany dla pierwszej, najbardziej reklamowanej i najdrożej wydanej książki popularnego autora.
PQStat