Duże modele wygrywają testy porównawcze. Małe modele są dostarczane. Kompresja modelu zmniejsza rozmiar i moc obliczeniową, zachowując jednocześnie większość pierwotnej dokładności, co umożliwia wdrożenie na telefonach, urządzeniach wbudowanych i serwerach o niskim koszcie.
Łączy się kilka technik. Przycinanie usuwa wagi, które niewiele wnoszą. Kwantowanie zmniejsza precyzję numeryczną. Destylacja uczy mniejszego ucznia. Faktoryzacja niskiego rzędu rozkłada macierze wag. W praktyce inżynierowie stosują te metody w stosach.
Typowe metody kompresji
- Przycinanie nieistotnych wag lub neuronów
- Kwantyzacja do 8 bitów lub niżej
- Przekazywanie wiedzy mniejszym uczniom
- Rozkład macierzy niskiego rzędu
- Poszukiwanie architektury w celu uzyskania efektywnych projektów
Kompresja ma swoje ograniczenia. Dokładność spada, a agresywne metody mogą zaburzać działanie systemu w sposób, który występuje tylko w przypadku rzadkich danych wejściowych. Niezbędne jest przeprowadzenie analizy porównawczej na reprezentatywnych danych przed i po kompresji.
Comments
No comments yet. Be the first to share a thought.
Leave a comment