Træning bygger modellen. Inferens bruger den. Når vægtene er fastsat, tager netværket nyt input og producerer output, uanset om det er en etiket, en sandsynlighed eller en genereret sætning. Der sker ingen gradientopdateringer her.
Det er inferens, der viser AI's økonomi. Træning sker én gang, nogle gange over uger. Inferens sker millioner af gange, ofte under latensbudgetter målt i millisekunder. En model, der er for langsom til at reagere i et chatvindue eller på en telefon, er ubrugelig, uanset hvor præcis den er.
Almindelige inferensindstillinger
- Batchinferens til offlinebehandling
- Realtidsinferens til interaktive applikationer
- Kantinferens på lokale enheder
- Serverinferens i datacentre
Optimering fokuserer på gennemløb og latenstid. Kvantisering, beskæring og specialiseret hardware er alle rettet mod inferensstien. Den samme model kan opføre sig meget forskelligt afhængigt af, hvordan den serveres.
Comments
No comments yet. Be the first to share a thought.
Leave a comment