PQStat Podręcznik Użytkownika PQStat English pqstat.pl

Walidacja i predykcja dla regresji wielorakiej

Kiedy stosować:

Walidacja modelu to sprawdzenie jego jakości. W pierwszej kolejności wykonywana jest na danych, na których model był zbudowany (tzw. zbiór uczący), czyli zwracana jest w raporcie opisującym uzyskany model. By można było z większą pewnością osądzić, na ile model nadaje się do prognozy nowych danych, ważnym elementem walidacji jest zastosowanie modelu do danych, które nie były wykorzystywane w estymacji modelu. Jeśli podsumowanie w oparciu o dane uczące będzie satysfakcjonujące, tzn. wyznaczane błędy, współczynniki \(R^2\) i kryteria informacyjne będą na zadowalającym nas poziomie, a podsumowanie w oparciu o nowe dane (tzw. zbiór testowy) będzie równie korzystne, wówczas z dużym prawdopodobieństwem można uznać, że taki model nadaje się do predykcji. Dane testujące powinny pochodzić z tej samej populacji, z której były wybrane dane uczące. Często jest tak, że przed przystąpieniem do budowy modelu zbieramy dane, a następnie w sposób losowy dzielimy je na zbiór uczący, czyli dane które posłużą do budowy modelu, i zbiór testowy, czyli dane które posłużą do dodatkowej walidacji modelu.

Predykcja – najczęściej ostatnim etapem analizy regresji jest wykorzystanie zbudowanego i uprzednio zweryfikowanego modelu do predykcji.

Definicje miar

Oszacowana wartość wyliczana jest z pewnym błędem. Dlatego też dodatkowo dla przewidzianej przez model wartości wyznaczane są granice wynikające z błędu:

  • dla wartości oczekiwanej wyznaczane są granice ufności,
  • dla pojedynczego punktu wyznaczane są granice predykcji.

Jak ustawić analizę

Statystyki zaawansowane \(\to\) Modele wielowymiarowe \(\to\) Regresja wieloraka – predykcja/walidacja.

By dokonać walidacji lub predykcji, należy wskazać model, na podstawie którego chcemy jej dokonać. Możemy dokonać jej na bazie:

  • zbudowanego w PQStat modelu regresji wielorakiej – wystarczy wybrać model spośród modeli przypisanych do danego arkusza, a liczba zmiennych i współczynniki modelu zostaną ustawione automatycznie; zbiór testowy powinien się znaleźć w tym samym arkuszu co zbiór uczący;
  • modelu niezbudowanego w programie PQStat, ale uzyskanego z innego źródła (np. opisanego w przeczytanej przez nas pracy naukowej) – w oknie analizy należy podać liczbę zmiennych oraz wpisać współczynniki dotyczące każdej z nich.

W oknie analizy należy wskazać te nowe zmienne, które powinny zostać wykorzystane do walidacji lub predykcji. Predykcja dla jednego obiektu może być wykonywana wraz z budową modelu, czyli w oknie analizy Statystyki zaawansowane\(\to\)Modele wielowymiarowe\(\to\)Regresja wieloraka, natomiast predykcja dla większej grupy nowych danych jest wykonywana poprzez menu Statystyki zaawansowane\(\to\)Modele wielowymiarowe\(\to\)Regresja wieloraka – predykcja/walidacja.

Wykonanie i interpretacja

Kontynuacja przykładu 1 (plik wydawca.pqs): do przewidywania zysku brutto ze sprzedaży książek wydawca zbudował model regresji w oparciu o zbiór uczący pozbawiony pozycji 16 (czyli 39 książek). W modelu znalazły się: koszty produkcji, koszty reklamy i popularność autora (1=autor popularny, 0=nie). Zbudujemy raz jeszcze ten model w oparciu o zbiór uczący, a następnie, by się upewnić, że model będzie działał poprawnie, zwalidujemy go na testowym zbiorze danych. Jeśli model przejdzie tę próbę, to będziemy go stosować do predykcji dla nowych pozycji książkowych. By korzystać z odpowiednich zbiorów, ustawiamy każdorazowo filtr danych.

zbiór uczący: \(R^2_{adj}=0.93\), \(MAE=3.8\) tys. dolarów
Model jest bardzo dobrze dopasowany do danych, na których został zbudowany.


zbiór testowy: \(R^2_{adj}=0.80\), \(MAE=5.9\) tys. dolarów
Jakość dopasowania na zbiorze testowym jest nieco niższa niż na zbiorze uczącym, ale wciąż zadowalająca – model nadaje się do predykcji.


W tym celu skorzystamy z danych trzech nowych pozycji książkowych dopisanych na końcu zbioru. Wybierzemy opcję Predykcja, ustawimy filtr na nowy zbiór danych i użyjemy naszego modelu do tego, by przewidzieć zysk brutto dla tych książek.

Okazuje się, że najwyższy zysk brutto (pomiędzy 64 a 85 tys. dolarów) jest prognozowany dla pierwszej, najbardziej reklamowanej i najdrożej wydanej książki popularnego autora.