Ingen sætter navn på dataene. Clustering søger efter naturlige grupperinger inden for et datasæt, sætter lignende punkter sammen og adskiller forskellige. Det er uovervåget læring i sin reneste form, og det viser sig i kundesegmentering, billedkomprimering og anomalidetektion.
Algoritmer adskiller sig i, hvordan de definerer lighed og form. K-means opdeler punkter i et fast antal sfæriske klynger. Hierarkisk klyngedannelse opbygger et træ af indbyggede grupper. DBSCAN finder tætte regioner og mærker sparsomme punkter som støj.
Almindelige klyngemetoder
- K-middelværdier og k-medoider
- Hierarkisk agglomerativ klyngedannelse
- DBSCAN og tæthedsbaserede metoder
- Gaussiske blandingsmodeller
- Spektral klyngedannelse
Det er vanskeligt at evaluere klynger, fordi der ikke findes nogen sandhed på jorden. Silhuet-scorer og albueplots giver vejledning, men domæneviden afgør normalt, om en gruppering er meningsfuld.
Comments
No comments yet. Be the first to share a thought.
Leave a comment