ANALIZA SKUPIEŃ
Analiza skupień to szukanie w danych grup podobnych do siebie obiektów (np. klientów, pacjentów, gatunków) – tak, by obiekty wewnątrz jednej grupy (skupienia) były do siebie jak najbardziej podobne, a obiekty z różnych skupień jak najbardziej się różniły. Wyróżnia się dwie główne rodziny metod: metody hierarchiczne, budujące całą hierarchię możliwych podziałów, oraz metody niehierarchiczne, spośród których najpopularniejsza jest metoda k-średnich. Obie rodziny metod opierają swoje działanie na macierzy podobieństwa, czyli na informacji o tym, jak bardzo poszczególne obiekty są do siebie podobne (lub jak bardzo się różnią).
Dokładnie w ten sam sposób, w jaki grupuje się obiekty (np. osoby badane), można grupować również zmienne (cechy) – np. by wskazać zmienne niosące podobną informację. W tym rozdziale metody grupowania opisane zostaną na przykładzie grupowania obiektów.
Metody hierarchiczne
Kiedy stosować:
Hierarchiczną analizę skupień stosuje się, gdy chcemy zobaczyć nie tylko jeden, ostateczny podział obiektów na grupy, ale całą hierarchię możliwych podziałów – od pojedynczych obiektów, poprzez coraz większe skupienia, aż po jedno skupienie zawierające wszystkie obiekty. Metoda buduje tę hierarchię krok po kroku, łącząc w każdym kroku dwa najbardziej do siebie podobne (najbliższe) obiekty lub skupienia, na podstawie macierzy podobieństwa. Dzięki temu badacz sam decyduje później, na jakim poziomie „przeciąć” powstałą hierarchię, by uzyskać interesującą go liczbę skupień.
Warunki stosowania
- możliwość wyliczenia odległości/podobieństwa pomiędzy obiektami – dobór odpowiedniej miary zależy od skali pomiarowej analizowanych zmiennych (patrz Macierz podobieństwa),
- standaryzacja zmiennych przed wyliczeniem macierzy podobieństwa, by żadna z nich (np. wyrażona dużo większymi liczbami) nie zdominowała pozostałych przy budowaniu skupień,
- brak rażąco nietypowych obserwacji (odstających), które mogłyby w istotny sposób zniekształcić odległości pomiędzy pozostałymi obiektami.
Definicje miar
Podobieństwo obiektów
W toku prac związanych z analizą skupień zasadniczą rolę odgrywają miary podobieństwa lub odległości. Wzajemne podobieństwo obiektów umieszczane jest w macierzy podobieństwa. Duża różnorodność metod wyznaczania odległości/niepodobieństwa między obiektami pozwala na wybór takich miar, które najlepiej odzwierciedlają rzeczywiste relacje. Szerzej miary odległości i podobieństwa opisane są w dziale Macierz podobieństwa.
Analiza skupień opiera swoje działania na wyszukiwaniu skupień wewnątrz macierzy podobieństwa. Macierz taka jest budowana w trakcie wykonywania analizy skupień. By analiza skupień przyniosła pożądane skutki, przy wyborze sposobu wyliczania odległości należy pamiętać, że większe wartości liczbowe w macierzy podobieństwa mają wskazywać na większe zróżnicowanie obiektów, a wartości mniejsze na ich podobieństwo.Uwaga! By zwiększyć wpływ wybranych zmiennych na elementy macierzy podobieństwa, należy wskazać odpowiednie wagi przy ustawianiu sposobu definiowania odległości pamiętając jednocześnie o wystandaryzowaniu danych.Np. Dla osób chcących zaopiekować się psem pogrupowanie psów zgodnie z wielkością, umaszczeniem, długością ogona, charakterem, rasą itp. ułatwi dokonanie wyboru. Jednak, identyczne traktowanie wszystkich cech może spowodować umieszczenie zupełnie niepodobnych psów w jednej grupie. Natomiast dla większości z nas ważniejsza jest wielkość psa i jego charakter niż długość jego ogona, dlatego w grupowaniu należałoby ustawić miary podobieństwa tak, by to właśnie wielkość i charakter miały największe znaczenie w budowaniu skupień.
Metody wiązania obiektów i skupień
Metoda pojedynczego wiązania (najbliższe sąsiedztwo) – odległość pomiędzy skupieniami określona jest poprzez odległość tych obiektów każdego skupienia, które znajdują się najbliżej siebie.
Metoda pełnego wiązania (najdalsze sąsiedztwo) – odległość pomiędzy skupieniami określona jest poprzez odległość tych obiektów każdego skupienia, które znajdują się najdalej siebie.
Metoda średnich połączeń – odległość pomiędzy skupieniami określona jest poprzez średnią odległość pomiędzy wszystkimi parami obiektów zlokalizowanych w obrębie dwóch różnych skupień.
- Metoda średnich połączeń ważonych – analogicznie do metody średnich połączeń polega na wyliczeniu średniej odległości, ale średnia ta ważona jest poprzez liczbę elementów każdego skupienia. W rezultacie powinniśmy wybierać tę metodę, gdy oczekujemy uzyskać skupienia o podobnych licznościach.
Metoda Warda – opiera się na zasadzie analizy wariancji – wylicza różnicę między sumami kwadratów odchyleń odległości poszczególnych obiektów od środka ciężkości skupień, do których te obiekty należą. Metoda ta wybierana jest najczęściej ze względu na jej dość uniwersalny charakter.
Dendrogram
Wynik analizy skupień prowadzonej metodą hierarchiczną przedstawia się przy pomocy dendrogramu. Dendrogram jest formą drzewa wskazującego związki pomiędzy poszczególnymi obiektami uzyskane z analizy macierzy podobieństwa. Poziom odcięcia dendrogramu decyduje o liczbie skupień, na które chcemy dzielić zgromadzone obiekty. Wybór sposobu odcięcia określamy podając w procentach długość wiązania, przy którym nastąpi cięcie, gdzie 100% stanowi długość ostatniego i jednocześnie najdłuższego wiązania w dendrogramie.
Jak ustawić analizę
Okno z ustawieniami opcji hierarchicznej analizy skupień wywołujemy poprzez menu Statystyki zaawansowane\(\to\)Grupowanie i Redukcja\(\to\)Hierarchiczna analiza skupień.

Wykonanie i interpretacja
Przykład (1) c.d. (plik iris.pqs)
Analiza przeprowadzona zostanie na klasycznym zestawie danych, dotyczącym podziału kwiatów irysa na 3 odmiany na podstawie szerokości oraz długości płatków i działek kielicha (R.A. Fishera 1936[59]). Ponieważ w tym zestawie danych znajduje się informacja o rzeczywistej odmianie każdego kwiatu, po przeprowadzonej analizie skupień istnieje możliwość określenia dokładności dokonanego podziału.
Przydziału kwiatów do poszczególnych grup dokonujemy na podstawie kolumn od 2 do 5. Wybieramy sposób wyliczania odległości np. odległość Euklidesową i metodę wiązania np. średnią. Podanie poziomu odcięcia skupień pozwoli na takie odcięcie dendrogramu by powstały skupienia – w przypadku tej analizy chcemy uzyskać 3 skupienia i by to osiągnąć zmieniamy poziom odcięcia na 45%. Do raportu dołączamy również dane+skupienia.

Na wykresie typu dendrogram, przedstawiono kolejność wiązań i ich długość.

By zbadać czy wyodrębnione skupienia stanowią 3 rzeczywiste odmiany kwiatów irysa, możemy skopiować kolumnę zawierającą informację o przynależności do skupień z raportu i wkleić do arkusza danych. Podobnie jak skupienia, odmiany opisane są również liczbowo poprzez Kody/Etykiety/Format, dlatego z łatwością można przeprowadzić analizę zgodności. Zgodność naszych wyników z rzeczywistą przynależnością danego kwiatu do odpowiedniego gatunku sprawdzimy metodą Kappa Cohena.

Dla przedstawionego przykładu obserwowaną zgodność przedstawia tabela:


Metoda k-średnich
Kiedy stosować:
Metodę k-średnich (ang. k-means) stosuje się, gdy z góry wiadomo (lub zakłada się), na ile grup (\(k\)) chcemy podzielić obiekty, a interesuje nas przede wszystkim jeden, ostateczny podział – bez budowania całej hierarchii, jak w metodach hierarchicznych. Metoda wzoruje swoje działanie na algorytmie zaproponowanym początkowo przez Stuarta Lloyda i opublikowanym w roku 1982 [107]. Obiekty przenoszone są pomiędzy skupieniami tak, by zróżnicowanie obiektów wewnątrz każdego skupienia było jak najmniejsze, a odległości między skupieniami jak największe.
Warunki stosowania
- pomiar zmiennych umożliwiający wyliczenie odległości euklidesowej pomiędzy obiektami (algorytm bazuje na macierzy odległości euklidesowych),
- z góry założona liczba \(k\) poszukiwanych skupień,
- standaryzacja zmiennych, by żadna z nich nie zdominowała pozostałych w budowie skupień (analogicznie jak w metodach hierarchicznych).
Definicje miar
W metodzie tej obiekty dzieli się na z góry założoną liczbę \(k\) skupień. Początkowe skupienia poprawia się w toku wykonywania procedury aglomeracji, przenosząc pomiędzy nimi obiekty tak by zróżnicowanie obiektów wewnątrz skupienia było jak najmniejsze a odległości skupień jak największe. Algorytm działa w oparciu o macierz odległości euklidesowych pomiędzy obiektami, a parametrami niezbędnymi w procedurze aglomeracji metody k-średnich są: centra startowe i kryterium stopu. Centra startowe są to obiekty od których algorytm rozpocznie budowę skupień, a kryterium stopu to określenie sposobu zatrzymania algorytmu.
Centra startowe
Wybór centrów startowych ma zasadniczy wpływ na zbieżność algorytmu k-średnich dla uzyskania odpowiednich skupień. Centra startowe mogą być wybrane na dwa sposoby:
- k-means++ – optymalny dobór punktów startowych, wykorzystujący algorytm k-means++ zaproponowany w 2007 roku przez Davida Arthura i Sergeia Vassilvitskiego [1]. Gwarantuje on uzyskanie optymalnego rozwiązania algorytmu k-średnich przy możliwie niewielu iteracjach. Algorytm wykorzystuje element losowości, dlatego uzyskiwane wyniki mogą się nieco różnić przy kolejnych uruchomieniach analizy. Jeśli dane nie formułują się w naturalne klastery, użycie k-means++ da zupełnie inne wyniki w kolejnych uruchomieniach analizy k-średnich. Duża powtarzalność wyników świadczy natomiast o możliwości dokonania dobrego podziału na oddzielne skupienia.
- n pierwszych – pozwala by użytkownik wskazał punkty będące centrami startowymi poprzez ustawienie tych obiektów na pierwszych miejscach w tabeli danych.
Kryterium stopu jest to moment, w którym nie zmienia się przynależność punktów do klas lub liczba powtórzeń kroków procedury aglomeracji osiągnie zadaną przez użytkownika liczbę iteracji.
Ze względu na sposób działania algorytmu analizy skupień k-średnich, naturalną jej konsekwencją jest porównanie powstałych skupień przy pomocy jednoczynnikowej analizy wariancji (ANOVA) dla grup niezależnych.
Jak ustawić analizę
Okno z ustawieniami opcji analizy skupień k-średnich wywołujemy poprzez menu Statystyki zaawansowane\(\to\)Grupowanie i Redukcja\(\to\)Analiza skupień k-średnich.

Wykonanie i interpretacja
Przykład (1) c.d. (plik iris.pqs)
Analiza przeprowadzona zostanie na klasycznym zestawie danych, dotyczącym podziału kwiatów irysa na 3 odmiany na podstawie szerokości oraz długości płatków i działek kielicha (R.A. Fishera 1936[59]).
Przydziału kwiatów do poszczególnych grup dokonujemy na podstawie kolumn od 2 do 5. Wskazujemy również, że badane kwiaty chcemy podzielić na 3 grupy.


Różnicę można zaobserwować na wykresach, gdzie przedstawiamy w wybranych dwóch wymiarach przynależność poszczególnych punktów do skupienia:


Powtarzając analizę możemy uzyskać nieco inne wyniki, ale uzyskana zmienność nie będzie duża. Świadczy to o tym, że dane poddane analizie formułują się w naturalne skupienia i przeprowadzanie analizy skupień jest w tym przypadku uzasadnione.
Procedura aglomeracyjna – metody hierarchiczne
- Postępując zgodnie z wskazaną metodą wiązania, algorytm znajduje w macierzy podobieństwa parę podobnych obiektów i łączy je w skupienie;
- Wymiar macierzy podobieństwa zostaje zredukowany o jeden (dwa obiekty zastąpiono jednym) a odległości znajdujące się w macierzy wyliczone są ponownie;
- Kroki 2-3 są powtarzane aż do uzyskania jednego skupienia zawierającego wszystkie obiekty.
Procedura aglomeracyjna – metoda k-średnich
- Wybór centrów startowych;
- Bazując na macierzy podobieństwa algorytm przypisuje każdy obiekt do najbliższego centrum;
- Dla uzyskanych skupień wyznacza się poprawione centra;
- Kroki 2-3 są powtarzane aż do momentu spełnienia kryterium stopu.
PQStat