Model jest budowany w procesie treningu. Wnioskowanie z niego korzysta. Po ustaleniu wag sieć pobiera nowe dane wejściowe i generuje dane wyjściowe, niezależnie od tego, czy jest to etykieta, prawdopodobieństwo, czy wygenerowane zdanie. Nie występują tu żadne aktualizacje gradientu.
Wnioskowanie to obszar, w którym ujawnia się ekonomia sztucznej inteligencji. Szkolenie odbywa się jednorazowo, czasami przez tygodnie. Wnioskowanie odbywa się miliony razy, często w ramach budżetów opóźnień mierzonych w milisekundach. Model zbyt wolny, by odpowiedzieć w oknie czatu lub przez telefon, jest bezużyteczny, niezależnie od jego dokładności.
Typowe ustawienia wnioskowania
- Wnioskowanie wsadowe do przetwarzania offline
- Wnioskowanie w czasie rzeczywistym dla aplikacji interaktywnych
- Wnioskowanie krawędziowe na urządzeniach lokalnych
- Wnioskowanie serwerowe w centrach danych
Optymalizacja koncentruje się na przepustowości i opóźnieniu. Kwantyzacja, przycinanie i specjalistyczny sprzęt – wszystkie te elementy są ukierunkowane na ścieżkę wnioskowania. Ten sam model może zachowywać się bardzo różnie w zależności od sposobu obsługi.
Comments
No comments yet. Be the first to share a thought.
Leave a comment