PQStat Podręcznik Użytkownika PQStat English pqstat.pl

Krzywa ROC

Kiedy stosować:

Testem diagnostycznym posługujemy się, by odróżnić obiekty z daną cechą (oznaczone jako (+), np. osoby chore) od obiektów bez danej cechy (oznaczone jako (\(-\)), np. osoby zdrowe). Aby test diagnostyczny mógł być uznany za wartościowy, powinien dawać stosunkowo niewielką liczbę błędnych klasyfikacji. Jeśli test opiera się na zmiennej dychotomicznej, wówczas właściwym narzędziem do oceny jego jakości jest analiza tabeli kontyngencji \(2\times2\). Najczęściej jednak testy diagnostyczne opierają się na zmiennych ciągłych lub o uporządkowanych kategoriach. W takiej sytuacji właściwym środkiem oceny zdolności testu do rozróżnienia (+) i (\(-\)) są krzywe ROC (ang. Receiver Operating Characteristic).

Często obserwuje się, że wraz ze wzrostem wartości zmiennej diagnostycznej rosną szanse na wystąpienie badanego zjawiska, lub odwrotnie: wraz ze wzrostem wartości zmiennej diagnostycznej maleją szanse na wystąpienie badanego zjawiska. Wówczas przy użyciu krzywych ROC dokonuje się wyboru optymalnego punktu odcięcia, czyli pewnej wartości zmiennej diagnostycznej, która najlepiej dzieli badaną zbiorowość na dwie grupy: (+), w której występuje dane zjawisko, i (\(-\)), w której dane zjawisko nie występuje. Kiedy w oparciu o badania przeprowadzone na tych samych obiektach są zbudowane dwie lub więcej krzywych ROC, można dokonać porównania tych krzywych pod kątem jakości klasyfikacji.

Warunki stosowania

  • pomiar zmiennej diagnostycznej na skali porządkowej lub interwałowej,
  • znana rzeczywista przynależność każdego obiektu do grupy (+) lub (\(-\)) (tzw. gold-standard).

Definicje miar

Załóżmy, że dysponujemy \(n\)-elementową próbą, w której każdy obiekt uzyskuje jedną z \(k\) wartości zmiennej diagnostycznej. Każda z uzyskanych wartości zmiennej diagnostycznej \(x_1, x_2, ...x_k\) staje się potencjalnym punktem odcięcia \(x_{cat}\). Jeśli zmienna diagnostyczna to:

  • stymulanta (wraz ze wzrostem jej wartości rosną szanse na wystąpienie badanego zjawiska), to wartości większe lub równe punktowi odcięcia (\(x_i\geq x_{cat}\)) zaliczamy do grupy (+);
  • destymulanta (wraz ze wzrostem jej wartości maleją szanse na wystąpienie badanego zjawiska), to wartości mniejsze lub równe punktowi odcięcia (\(x_i\leq x_{cat}\)) zaliczamy do grupy (+).

Dla każdego z \(k\) punktów odcięcia wyznaczamy wartości prawdziwie dodatnie (TP), prawdziwie ujemne (TN), fałszywie dodatnie (FP) i fałszywie ujemne (FN), a na ich podstawie czułość, swoistość oraz pozostałe miary opisane w rozdziale Ocena testu diagnostycznego.

\(AUC\) (ang. area under curve) – wielkość pola pod krzywą ROC, mieści się w przedziale \(\langle0;1\rangle\). Krzywa ROC powstaje na podstawie wyznaczonych wartości czułości i swoistości dla kolejnych punktów odcięcia – na osi odciętych umieszczona jest \(x=1-\)swoistość, a na osi rzędnych \(y=\)czułość, a uzyskane punkty są ze sobą połączone.

Im większe jest pole \(AUC\), tym dokładniej zaklasyfikujemy obiekty do grupy (+) i (\(-\)) na podstawie analizowanej zmiennej diagnostycznej, a więc z tym lepszym skutkiem ta zmienna diagnostyczna może być wykorzystywana jako klasyfikator. Gdy krzywa ROC pokrywa się z przekątną \(y=x\) (czyli \(AUC=0.5\)), decyzja podejmowana na podstawie zmiennej diagnostycznej jest tak samo dobra jak losowy podział badanych obiektów na grupy (+) i (\(-\)).

Uwaga!

Pole \(AUC\), błąd \(SE_{AUC}\) i przedział ufności dla \(AUC\) wyliczane są w oparciu o:

  • \(\star\) metodę nieparametryczną DeLong (DeLong E.R. i inni, 1988[51]; Hanley J.A. i Hajian-Tilaki K.O., 1997[75]) – rekomendowane,
  • \(\star\) metodę nieparametryczną Hanley-McNeil (Hanley J.A. i McNeil M.D., 1982[76]),
  • \(\star\) metodę Hanley-McNeil zakładającą dwu-ujemny rozkład wykładniczy (Hanley J.A. i McNeil M.D., 1982[76]) – wyliczaną tylko wtedy, gdy grupy (+) i (\(-\)) są równoliczne.

Wykonanie i interpretacja

Test istotności pola \(AUC\) jest zawsze wykonywany łącznie z wyborem optymalnego punktu odcięcia – patrz Przykład 1 w kolejnym rozdziale.

DLA ZAINTERESOWANYCH

By klasyfikacja była lepsza niż losowy podział obiektów do dwóch klas, pole pod krzywą ROC powinno być istotnie większe niż pole pod prostą \(y=x\), czyli niż 0.5.

Hipotezy:

\(\begin{array}{cl} \mathcal{H}_0: & AUC=0.5, \\ \mathcal{H}_1: & AUC\neq 0.5. \end{array}\)

Wzory:
Statystyka testowa ma postać:

\[ Z=\frac{AUC-0.5}{SE_{0.5}}, \]

gdzie:
\(SE_{0.5}=\sqrt{\frac{n_{(+)}+n_{(-)}+1}{12n_{(+)}n_{(-)}}}\),
\(n_{(+)}\) – liczność grupy (+), w której dane zjawisko rzeczywiście występuje,
\(n_{(-)}\) – liczność grupy (\(-\)), w której dane zjawisko rzeczywiście nie występuje.

Statystyka \(Z\) ma asymptotycznie (dla dużych liczności) rozkład normalny.

Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).

Dodatkowo, gdy przyjmiemy, że parametr diagnostyczny tworzy wysokie pole (\(AUC\)), możemy wybrać optymalny punkt odcięcia.

Poprawione wartości predykcyjne – wzory:
Program PQStat na podstawie posiadanej próby wylicza współczynnik chorobowości. Wyliczony współczynnik chorobowości będzie odzwierciedlał występowanie badanego zjawiska (choroby) w populacji, gdy są to badania przesiewowe obejmujące dużą próbę reprezentującą populację. Gdy na badania skierowane są tylko osoby z podejrzeniem choroby, wyliczony dla nich współczynnik chorobowości może być znacznie wyższy od tego współczynnika w populacji. Ponieważ zarówno wartość predykcyjna dodatnia, jak i ujemna zależy od współczynnika chorobowości, znając a priori ten współczynnik dla populacji, możemy się nim posłużyć, by wyliczyć dla każdego punktu odcięcia \(x_{cat}\) poprawione wartości predykcyjne zgodnie ze wzorami Bayesa:

\[ PPV_{revised}=\frac{\textrm{Czułość}\cdot P_{a priori}}{\textrm{Czułość}\cdot P_{a priori} + (1-\textrm{Swoistość})\cdot (1-P_{a priori})} \]
\[ NPV_{revised}=\frac{\textrm{Swoistość}\cdot (1-P_{a priori})}{\textrm{Swoistość}\cdot (1-P_{a priori}) + (1-\textrm{Czułość})\cdot P_{a priori}} \]

gdzie \(P_{a priori}\) – zadany przez użytkownika współczynnik chorobowości, tzw. pre-test probability of disease.

Zestawienie:
Wyznaczone dla każdego punktu odcięcia miary zestawia się w tabeli:

\(x_{cat}\)czułośćswoistość\(\textbf{PPV}\)\(\textbf{NPV}\)\(\textbf{LR}_+\)\(\textbf{LR}_-\)\(\textbf{Acc}\)\(\textbf{PPV}_{rev}\)\(\textbf{NPV}_{rev}\)
\(x_1\)czułość\(_1\)swoistość\(_1\)\(PPV_1\)\(NPV_1\)\(LR_{+1}\)\(LR_{-1}\)\(Acc_1\)\(PPV_{rev1}\)\(NPV_{rev1}\)
\(x_2\)czułość\(_2\)swoistość\(_2\)\(PPV_2\)\(NPV_2\)\(LR_{+2}\)\(LR_{-2}\)\(Acc_2\)\(PPV_{rev2}\)\(NPV_{rev2}\)
\(x_k\)czułość\(_k\)swoistość\(_k\)\(PPV_k\)\(NPV_k\)\(LR_{+k}\)\(LR_{-k}\)\(Acc_k\)\(PPV_{revk}\)\(NPV_{revk}\)

Wybór optymalnego punktu odcięcia

Kiedy stosować:

Ten poszukiwany punkt to pewna wartość zmiennej diagnostycznej, która optymalnie dzieli badaną zbiorowość na dwie grupy: (+), w której występuje dane zjawisko, i (\(-\)), w której dane zjawisko nie występuje. Wybór optymalnego punktu odcięcia nie jest łatwy, gdyż wymaga fachowej wiedzy z zakresu tematu badań. Na przykład innego punktu odcięcia będzie wymagał test użyty w badaniach przesiewowych obejmujących dużą grupę osób, np. w badaniu mammograficznym, a innego w badaniach inwazyjnych przeprowadzanych, by potwierdzić wcześniejsze podejrzenie, np. w histopatologii. Stosując zaawansowany aparat matematyczny, możemy znaleźć taki punkt, tzw. cut-off, który będzie najkorzystniejszy z matematycznego punktu widzenia.

Definicje miar

Program PQStat wybór optymalnego punktu odcięcia umożliwia poprzez:

Metodę stycznej (indeks kosztów) – wyliczaną w oparciu o czułość, swoistość, koszty błędnych decyzji i współczynnik chorobowości. Błędy, jakie można popełnić, przydzielając badane obiekty do grupy (+) i do grupy (\(-\)), to wyniki fałszywie dodatnie (\(FP\)) i wyniki fałszywie ujemne (\(FN\)). Jeśli popełnienie tych błędów jest tak samo kosztowne (koszty etyczne, finansowe itd.), to wówczas w polu koszt FP i w polu koszt FN wpisujemy tę samą dodatnią wartość – zwykle 1. Jeśli natomiast uznamy, że jeden rodzaj błędu jest obarczony większym kosztem niż drugi, przypiszemy mu odpowiednio większą wagę. Optymalna wartość odcięcia obliczana jest przy użyciu wielkości \(m\) – nachylenia stycznej do krzywej ROC, określanego w odniesieniu do kosztów błędnych decyzji i współczynnika chorobowości.

Indeks Youdena – koncepcyjnie jest to maksymalna odległość pomiędzy linią będącą przekątną kwadratu o boku 1 a punktem krzywej ROC[177].

Odległość do lewego górnego rogu – koncepcyjnie jest to minimalna odległość pomiędzy lewym górnym rogiem kwadratu o boku 1 (czyli miejscem, w którym czułość i swoistość może być najwyższa) a punktem krzywej ROC.

Wykres kosztów – prezentuje wyliczone wartości błędnej diagnozy wraz z ich kosztami. Zaznaczony na wykresie punkt to minimum funkcji kosztu.

Wykres przecięcia czułości i swoistości – pozwala na zlokalizowanie punktu, w którym wartość czułości i swoistości jest jednocześnie największa.

Jak ustawić analizę

Statystyka zaawansowana \(\to\) Testy diagnostyczne \(\to\) Krzywa ROC.

Wykonanie i interpretacja

Przykład 1. (plik bakteriemia.pqs)

Utrzymująca się wysoka gorączka u niemowlęcia lub małego dziecka bez ustalonych wyraźnych przyczyn jest wskazówką do przeprowadzenia badań w kierunku bakteriemii. Za najbardziej przydatne i wiarygodne parametry służące do przesiewowej diagnostyki i monitorowania zakażeń bakteryjnych uważa się wskaźniki:

  • WBC – liczba białych krwinek (ang. white blood cells),
  • PCT – prokalcytonina (ang. procalcitonin).

Przyjmuje się, że u zdrowego niemowlęcia i małego dziecka WBC nie powinno przekraczać 15 tys/µl, a PCT powinno być niższe niż 0.5 ng/ml. Przykładowe wartości tych wskaźników dla 136 dzieci do 3. roku życia z utrzymującą się gorączką \(>39^0C\) przedstawia poniższy fragment tabeli:

Jednym z możliwych sposobów analizy wskaźnika PCT jest przekształcenie go w zmienną dychotomiczną przez wybranie punktu odcięcia (np. \(x_{cat}=0.5\) ng/ml), powyżej którego badanie jest uznane za „pozytywne”. Jak dobry jest taki podział, wskaże wartość czułości i swoistości. Chcemy jednak wykorzystać bardziej kompleksowe podejście, czyli wyliczyć czułość i swoistość nie tylko dla jednej wartości, ale dla każdej uzyskanej w próbie wartości PCT – czyli zbudować krzywą ROC. Na podstawie uzyskanych w ten sposób informacji chcemy sprawdzić, czy wskaźnik PCT jest rzeczywiście przydatny w rozpoznawaniu bakteriemii, a jeśli tak, jaki jest optymalny punkt odcięcia, powyżej którego możemy uznać badanie za „pozytywne” – wykrywające bakteriemię.

Ponieważ bakteriemii towarzyszy podwyższony poziom PCT, wskaźnik ten uznajemy za stymulantę. W zmiennej stanu musimy określić, która wartość znajdująca się w kolumnie bakteriemia określa jej obecność – tutaj wybieramy wartość „tak”. W raporcie oprócz wyniku testu statystycznego możemy znaleźć dokładny opis każdego z możliwych punktów odcięcia.

\(AUC=0.889\), \(p<0.000001\) (istotne statystycznie, \(\alpha=0.05\))
Rozpoznawanie bakteriemii przy użyciu wskaźnika PCT jest istotnie korzystniejsze niż losowy podział pacjentów na 2 grupy.


Wracamy więc do analizy (przycisk ), by wyznaczyć optymalny punkt odcięcia. Algorytm poszukiwania optymalnego punktu odcięcia uwzględnia koszty błędnych decyzji i współczynnik chorobowości:

  • (1) koszt FN – błędna diagnoza, to koszt uznania, że pacjent nie choruje na bakteriemię, mimo że rzeczywiście jest chory (koszty decyzji fałszywie ujemnej);
  • (2) koszt FP – błędna diagnoza, to koszt uznania, że pacjent choruje na bakteriemię, mimo że rzeczywiście na nią nie choruje (koszty decyzji fałszywie dodatniej).

Ponieważ koszty FN są znacznie poważniejsze niż koszty FP, w polu pierwszym wpisujemy wartość większą niż w polu drugim – uznaliśmy, że będzie to wartość 5. Wartość PCT ma być wykorzystywana w badaniach przesiewowych, nie podajemy więc populacyjnego współczynnika chorobowości (współczynnika chorobowości a priori), który jest bardzo niski, ale pozostajemy przy współczynniku estymowanym z próby – postępujemy tak, by nie przesunąć punktu odcięcia wartości PCT zbyt wysoko i nie zwiększyć liczby fałszywie ujemnych wyników.

optymalny punkt odcięcia PCT = 1.819
Dla tego punktu czułość=0.85, a swoistość=0.96.


Innym sposobem wyboru punktu odcięcia jest analiza wykresu kosztów i wykresu przecięcia czułości:

Analiza wykresu kosztów wskazuje, że minimum kosztów błędnych decyzji przypada na PCT=1.819. Natomiast wartość czułości i swoistości jest podobna dla PCT=1.071.

DLA ZAINTERESOWANYCH

Metoda stycznej (indeks kosztów) – wzór:
Za optymalny punkt odcięcia uznana zostaje taka wartość zmiennej diagnostycznej, przy której wyrażenie:

\[\textrm{Czułość} - m\cdot(1- \textrm{Swoistość})\]

osiąga minimum (Zweig M.H., 1993[183]). Kąt nachylenia \(m\) jest określany w odniesieniu do kosztów błędnych decyzji i współczynnika chorobowości. Standardowo koszty błędnych decyzji są równe 1, a współczynnik chorobowości estymowany jest z próby. Znając a priori współczynnik chorobowości (\(P_{a priori}\)) i koszty błędnych decyzji, użytkownik może wpływać na wartość \(m\), a tym samym na wyszukiwanie optymalnego punktu odcięcia.

Indeks Youdena – wzór:

\[d=\textrm{Czułość} + \textrm{Swoistość} -1\]

Odległość do lewego górnego rogu – wzór:

\[d=\sqrt{(1-\textrm{Czułość})^2+(1-\textrm{Swoistość})^2}\]

Wykres kosztów – wzór:
Wartości błędnej diagnozy wyliczane są zgodnie ze wzorem:

\[ koszt=koszt_{FP}\cdot FP+koszt_{FN}\cdot FN \]

Porównywanie krzywych ROC

Kiedy stosować:

Bardzo często celem badań jest porównanie wielkości pola pod krzywą ROC (\(AUC_1\)) z polem pod inną krzywą ROC (\(AUC_2\)). Krzywa ROC o większym polu pozwala zwykle na dokładniejszą klasyfikację obiektów. Metody służące porównaniu pól zależne są od modelu badania.

Warunki stosowania

  • model zależny – porównywane krzywe ROC powstają na bazie pomiarów dokonanych na tych samych obiektach,
  • model niezależny – porównywane krzywe ROC powstają na bazie pomiarów dokonanych na różnych obiektach.

Jak ustawić analizę

Dla modelu zależnego: Statystyka zaawansowana \(\to\) Testy diagnostyczne \(\to\) Zależne Krzywe ROC – porównywanie.

Dla modelu niezależnego: Statystyka zaawansowana \(\to\) Testy diagnostyczne \(\to\) Niezależne Krzywe ROC – porównywanie.

Wykonanie i interpretacja

Kontynuacja przykładu 1 (plik bakteriemia.pqs): wykonamy 2 porównania – (1) zbudujemy 2 krzywe ROC, by porównać wartość diagnostyczną parametrów WBC i PCT (model zależny – te same dzieci); (2) zbudujemy 2 krzywe ROC, by porównać wartość diagnostyczną parametru PCT dla chłopców i dziewczynek (model niezależny – różne dzieci).

(1) WBC vs PCT (model zależny)
Zarówno parametr WBC, jak i PCT jest stymulantą (wysokie wartości tych parametrów towarzyszą bakteriemii).

\(AUC_{WBC}=0.8613\), \(AUC_{PCT}=0.8956\), \(p=0.130322\) (nieistotne statystycznie, \(\alpha=0.05\))
Nie możemy wskazać, który z parametrów – WBC czy PCT – jest lepszy w rozpoznawaniu bakteriemii.

(2) PCT: dziewczynki vs chłopcy (model niezależny)
Parametr PCT jest stymulantą (jego wysokie wartości towarzyszą bakteriemii); porównujemy jego wartość diagnostyczną osobno dla dziewczynek i chłopców.

\(AUC_k=0.8649\), \(AUC_m=0.9118\), \(p=0.637176\) (nieistotne statystycznie, \(\alpha=0.05\))
Nie możemy wskazać płci, dla której parametr PCT jest lepszy w rozpoznawaniu bakteriemii.
DLA ZAINTERESOWANYCH

Hipotezy (wspólne dla obu modeli):

\(\begin{array}{cl} \mathcal{H}_0: & AUC_1=AUC_2, \\ \mathcal{H}_1: & AUC_1\neq AUC_2. \end{array}\)

Model zależny – wzór:
Statystyka testowa ma postać:

\[ Z=\frac{|AUC_1-AUC_2|}{SE_{AUC_1-AUC_2}}, \]

gdzie \(AUC_1\), \(AUC_2\) i błąd standardowy różnicy pól \(SE_{AUC_1-AUC_2}\) wyliczane są w oparciu o metodę nieparametryczną zaproponowaną przez DeLong (DeLong E.R. i inni, 1988[51]; Hanley J.A. i Hajian-Tilaki K.O., 1997[75]).

Statystyka \(Z\) ma asymptotycznie (dla dużych liczności) rozkład normalny.

Model niezależny – wzór:
Statystyka testowa (Hanley J.A. i McNeil M.D., 1983[77]) ma postać:

\[ Z=\frac{|AUC_1-AUC_2|}{\sqrt{SE_{AUC_1}^2-SE_{AUC_2}^2}}, \]

gdzie \(AUC_1\), \(AUC_2\) i błędy standardowe pól \(SE_{AUC_1}\), \(SE_{AUC_2}\) wyliczane są w oparciu o:

  • \(\star\) metodę nieparametryczną DeLong (DeLong E.R. i inni, 1988[51]; Hanley J.A. i Hajian-Tilaki K.O., 1997[75]) – rekomendowane,
  • \(\star\) metodę nieparametryczną Hanley-McNeil (Hanley J.A. i McNeil M.D., 1982[76]).

Statystyka \(Z\) ma asymptotycznie (dla dużych liczności) rozkład normalny.

Dla obu modeli: wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).