Trénování vytváří model. Inference ho využívá. Jakmile jsou váhy fixovány, síť přijímá nový vstup a produkuje výstup, ať už se jedná o popisek, pravděpodobnost nebo vygenerovanou větu. Zde nedochází k žádným aktualizacím gradientu.
Inference je místo, kde se projevuje ekonomika umělé inteligence. Trénování probíhá jednou, někdy i v průběhu týdnů. Inference probíhá milionkrát, často s latenčním rozpočtem měřeným v milisekundách. Model, který je příliš pomalý na to, aby reagoval v chatovacím okně nebo na telefonu, je k ničemu, bez ohledu na to, jak je přesný.
Běžná nastavení inference
- Dávková inference pro offline zpracování
- Inference v reálném čase pro interaktivní aplikace
- Odvozování hran na lokálních zařízeních
- Serverová inference v datových centrech
Optimalizace se zaměřuje na propustnost a latenci. Kvantizace, prořezávání a specializovaný hardware se zaměřují na inferenční cestu. Stejný model se může chovat velmi odlišně v závislosti na tom, jak je obsluhován.
Comments
No comments yet. Be the first to share a thought.
Leave a comment