Højdimensionelle data er svære at visualisere, langsomme at behandle og tilbøjelige til overtilpasning. Dimensionalitetsreduktion komprimerer funktioner til et mindre sæt, samtidig med at så meget nyttig struktur som muligt bevares.
Lineære metoder som principal component analysis projicerer data i retninger med maksimal varians. Ikke-lineære metoder som t-SNE og UMAP bevarer lokale nabolag, hvilket gør dem populære til visualisering af klynger.
Almindelige teknikker
- Analyse af hovedkomponenter
- Lineær diskriminantanalyse
- t-SNE til visualisering
- UMAP til manifold læring
- Autoencodere til ikke-lineær komprimering
Reduktion mister altid noget. Målet er at reducere støj og redundans, samtidig med at signalet bevares. Valg af det rigtige antal dimensioner er et vurderingsspørgsmål, der ofte styres af downstream-ydeevne snarere end rekonstruktionsfejl alene.
Comments
No comments yet. Be the first to share a thought.
Leave a comment