Antrenamentul construiește modelul. Inferența îl folosește. Odată ce ponderile sunt fixate, rețeaua preia noi intrări și produce ieșiri, fie că este vorba de o etichetă, o probabilitate sau o propoziție generată. Nu se produc actualizări ale gradientului aici.
Inferența este punctul în care se manifestă aspectele economice ale inteligenței artificiale. Antrenamentul are loc o singură dată, uneori pe parcursul a săptămânilor. Inferența se întâmplă de milioane de ori, adesea sub bugete de latență măsurate în milisecunde. Un model prea lent pentru a răspunde într-o fereastră de chat sau la telefon este inutil, indiferent cât de precis.
Setări comune de inferență
- Inferență în lot pentru procesare offline
- Inferență în timp real pentru aplicații interactive
- Inferență la margine pe dispozitivele locale
- Inferența serverului în centrele de date
Optimizarea se concentrează pe randament și latență. Cuantizarea, reducerea performanței și hardware-ul specializat vizează calea de inferență. Același model se poate comporta foarte diferit în funcție de modul în care este servit.
Comments
No comments yet. Be the first to share a thought.
Leave a comment