Høydimensjonale data er vanskelige å visualisere, sakte å behandle og utsatt for overtilpasning. Dimensjonalitetsreduksjon komprimerer funksjoner til et mindre sett samtidig som den bevarer så mye nyttig struktur som mulig.
Lineære metoder som prinsipalkomponentanalyse projiserer data i retninger med maksimal varians. Ikke-lineære metoder som t-SNE og UMAP bevarer lokale nabolag, noe som gjør dem populære for å visualisere klynger.
Vanlige teknikker
- Hovedkomponentanalyse
- Lineær diskriminantanalyse
- t-SNE for visualisering
- UMAP for mangfoldig læring
- Autokodere for ikke-lineær komprimering
Reduksjon mister alltid noe. Målet er å redusere støy og redundans samtidig som signalet beholdes. Å velge riktig antall dimensjoner er en vurdering, ofte styrt av nedstrøms ytelse snarere enn bare rekonstruksjonsfeil.
Comments
No comments yet. Be the first to share a thought.
Leave a comment