PQStat Podręcznik Użytkownika PQStat English pqstat.pl

Współczynnik Kappa Cohena i test badający jego istotność

Kiedy stosować:

Współczynnik Kappa Cohena (ang. Cohen's Kappa) (Cohen J., 1960[44]) określa stopień zgodności dwukrotnych pomiarów tej samej zmiennej w różnych warunkach. Pomiaru tej samej zmiennej może dokonać dwóch różnych sędziów (odtwarzalność) lub jeden sędzia może dokonać pomiaru dwukrotnie (powtarzalność). Współczynnik \(\hat \kappa\) wyznacza się dla zależnych zmiennych kategorialnych, na podstawie danych surowych albo z wykonanej na ich podstawie tabeli kontyngencji o wymiarach \(c\times c\).

Warunki stosowania

Definicje miar

Współczynnik Kappa (\(\hat \kappa\)) – jego wartość zawiera się w przedziale od \(-1\) do \(1\). Wartość 1 oznacza pełną zgodność, wartość 0 oznacza zgodność na poziomie takim samym, jaki powstałby dla losowego rozłożenia danych w tabeli kontyngencji. Poziom pomiędzy 0 a \(-1\) jest w praktyce niewykorzystywany – ujemna wartość \(\hat \kappa\) oznacza zgodność na poziomie mniejszym niż powstała dla losowego rozłożenia danych w tabeli kontyngencji. \(\hat \kappa\) oznacza współczynnik zgodności w próbie, natomiast \(\kappa\) w populacji.

W zależności od potrzeb można wyznaczać Kappę nieważoną (czyli Kappę Cohena) lub Kappę ważoną. Przydzielane wagi (\(w_{ij}\)) odnoszą się do poszczególnych komórek tabeli kontyngencji: na przekątnej wynoszą 1, a poza przekątną należą do przedziału \(\langle0;1)\).

Kappa nieważona – wyliczana jest dla danych, których kategorii nie da się uporządkować, np. dane pochodzą od pacjentów, których dzielimy ze względu na rodzaj zdiagnozowanej choroby, a chorób tych nie można uporządkować (zapalenie płuc (1), zapalenie oskrzeli (2), inne (3)). W takiej sytuacji można sprawdzać zgodność diagnoz wystawionych przez dwóch lekarzy, stosując nieważoną Kappę, czyli Kappę Cohena. Niezgodność par \(\{(1),(3)\}\) oraz \(\{(1),(2)\}\) traktowana będzie równoważnie, a więc wagi poza przekątną macierzy wag będą zerowane.

Kappa ważona – w sytuacji, gdy kategorie danych mogą być posortowane (np. dane pochodzą od pacjentów, których dzielimy ze względu na stopień zmian chorobowych: brak zmian (1), zmiany łagodne (2), podejrzenie raka (3), rak (4)), zgodność ocen wystawionych przez dwóch radiologów można budować z uwzględnieniem możliwości sortowania. Za bardziej niezgodne pary ocen mogą być wówczas uznane oceny \(\{(1),(4)\}\) niż \(\{(1),(2)\}\). By kolejność kategorii wpływała na wynik zgodności, wyznaczać należy ważoną Kappę. Przydzielane wagi mogą mieć postać liniową (Cicchetti, 1971[37]) lub kwadratową (Cohen, 1968[45]) – im większe oddalenie od przekątnej macierzy, tym mniejsza waga, przy czym wagi liniowe maleją proporcjonalnie, a wagi kwadratowe wolniej w bliższej odległości od przekątnej i szybciej w odległości dalszej. Wagi kwadratowe cieszą się większym zainteresowaniem ze względu na praktyczną interpretację współczynnika Kappa, który w tym przypadku jest tożsamy ze współczynnikiem korelacji wewnątrzklasowej[61].

Jak ustawić analizę

Statystyka \(\to\) Testy nieparametryczne \(\to\) Kappa-Cohena (lub poprzez Kreator).

Wykonanie i interpretacja

Przykład 1. (plik diagnoza.pqs)
Badamy zgodność diagnozy postawionej przez 2 lekarzy. W tym celu pobieramy próbę 110 pacjentów szpitala dziecięcego. Lekarze przyjmują pacjentów w sąsiednich gabinetach. Każdy z pacjentów jest najpierw badany przez lekarza A, a następnie przez lekarza B. Diagnozy postawione przez lekarzy przedstawia poniższa tabela.

Moglibyśmy badać zgodność diagnozy poprzez zwykły procent wartości zgodnych. W naszym przykładzie zgodną diagnozę lekarze postawili dla 73 pacjentów (31+39+3=73), co stanowi 66.36% badanej grupy. Współczynnik Kappa wprowadza korekcję tej wartości o szanse na zgodność (tzn. koryguje o tę zgodność, która pojawia się dla przypadkowego rozłożenia danych w tabeli).

\(\hat\kappa=0.4458\), \(p<0.000001\) (istotne statystycznie, \(\alpha=0.05\))
Diagnozy dwóch lekarzy są statystycznie zgodne.


Zgodność wyrażona współczynnikiem \(\hat \kappa=44.58\%\) jest mniejsza niż ta nieskorygowana o szanse na zgodność.

Przykład 2. (plik radiologia.pqs)
W obrazie radiologicznym oceniano uszkodzenie wątroby w następujących kategoriach: brak zmian (1), zmiany łagodne (2), podejrzenie raka (3), rak (4). Oceny dokonywało dwóch niezależnych radiologów bazując na grupie 70 pacjentów. Chcemy sprawdzić zgodność postawionej diagnozy.

Ze względu na to, że diagnoza wystawiona jest na skali porządkowej, właściwą miarą zgodności byłby ważony współczynnik Kappa.

\(\hat\kappa=0.390194\) dla wag liniowych (\(p=0.000007\)), \(\hat\kappa=0.418658\) dla wag kwadratowych (\(p=0.000431\)) – obie wartości istotne statystycznie, \(\alpha=0.05\)
Diagnozy dwóch radiologów są statystycznie zgodne, niezależnie od zastosowanych wag.


Ponieważ dane koncentrują się głównie na głównej przekątnej macierzy i w jej bliskim sąsiedztwie, współczynnik ważony wagami liniowymi jest niższy niż współczynnik wyznaczony dla wag kwadratowych. Gdyby w ocenach istniała duża niezgodność dotycząca dwóch skrajnych przypadków i para (brak zmian i rak), znajdująca się w prawym górnym rogu tabeli, występowała zdecydowanie częściej, np. 15 razy, wówczas taki duży brak zgodności byłby bardziej widoczny przy wykorzystaniu wag kwadratowych (współczynnik Kappa drastycznie by spadł) niż przy wykorzystaniu wag liniowych.

DLA ZAINTERESOWANYCH

Wagi liniowe – wzór:

\[ w_{ij}=1-\frac{|i-j|}{c-1}. \]

Przykładowe wagi dla macierzy wielkości 5x5:

10.750.50.250
0.7510.750.50.25
0.50.7510.750.5
0.250.50.7510.75
00.250.50.751

Wagi kwadratowe – wzór:

\[ w_{ij}=1-\frac{(i-j)^2}{(c-1)^2}. \]

Przykładowe wagi dla macierzy wielkości 5x5:

10.93750.750.43750
0.937510.93750.750.4375
0.750.937510.93750.75
0.43750.750.937510.9375
00.43750.750.93751

Procedura:
By wyznaczyć zgodność współczynnikiem Kappa, dane przedstawia się w postaci tabeli liczności obserwowanych \(O_{ij}\) (?), którą następnie przekształca się w tabelę kontyngencji prawdopodobieństw \(p_{ij}=O_{ij}/n\).

Współczynnik Kappa (\(\hat \kappa\)) wyraża się wtedy wzorem:

\[ \hat \kappa=\frac{P_o-P_e}{1-P_e}, \]

gdzie:
\(P_o=\sum_{i=1}^c\sum_{j=1}^c w_{ij}p_{ij}\),
\(P_e=\sum_{i=1}^c\sum_{j=1}^c w_{ij}p_{i.}p_{.i}\),
\(p_{i.}\), \(p_{.i}\) – sumy końcowe kolumn i wierszy tabeli kontyngencji prawdopodobieństw.

Błąd standardowy dla Kappa wyraża się wzorem:

\[ SE_{\hat \kappa}=\frac{1}{(1-P_e)\sqrt{n}}\sqrt{\sum_{i=1}^{c}\sum_{j=1}^{c}p_{i.}p_{.j}[w_{ij}-(\overline{w}_{i.}+(\overline{w}_{.j})]^2-P_e^2} \]

gdzie:
\(\overline{w}_{i.}=\sum_{j=1}^{c}p_{.j}w_{ij}\),
\(\overline{w}_{.j}=\sum_{i=1}^{c}p_{i.}w_{ij}\).

Test Z do sprawdzania istotności współczynnika Kappa Cohena (\(\hat \kappa\)) (ang. The Z test of significance for the Cohen's Kappa) (Fleiss, 2003[62]) służy do weryfikacji hipotezy o zgodności wyników dwukrotnych pomiarów \(X^{(1)}\) i \(X^{(2)}\) cechy \(X\) i opiera się na współczynniku \(\hat \kappa\) wyliczonym dla próby.

Hipotezy:

\(\begin{array}{cl} \mathcal{H}_0: & \kappa= 0, \\ \mathcal{H}_1: & \kappa \ne 0. \end{array}\)

Wzory:
Statystyka testowa ma postać:

\[ Z=\frac{\hat \kappa}{SE_{\kappa_{distr}}}, \]

gdzie:

\[ SE_{\kappa_{distr}}=\frac{1}{(1-P_e)\sqrt{n}}\sqrt{\sum_{i=1}^c\sum_{j=1}^c p_{ij}[w_{ij}-(\overline{w}_{i.}+\overline{w}_{.j})(1-\hat \kappa)]^2-[\hat \kappa-P_e(1-\hat \kappa)]^2}. \]

Statystyka \(Z\) ma asymptotycznie (dla dużych liczności) rozkład normalny.

Wyznaczoną na podstawie statystyki testowej wartość \(p\) porównujemy z poziomem istotności \(\alpha\): gdy \(p \le \alpha\), odrzucamy \(\mathcal{H}_0\) na rzecz \(\mathcal{H}_1\); gdy \(p > \alpha\), nie ma podstaw, aby odrzucić \(\mathcal{H}_0\).