Das Training dient dem Aufbau des Modells. Die Inferenz nutzt dieses Modell. Sobald die Gewichte festgelegt sind, nimmt das Netzwerk neue Eingaben entgegen und erzeugt Ausgaben, sei es eine Bezeichnung, eine Wahrscheinlichkeit oder ein generierter Satz. Gradientenaktualisierungen finden hier nicht statt.
Die Ökonomie der KI zeigt sich bei der Inferenz. Das Training findet einmalig statt, manchmal über Wochen. Die Inferenz hingegen erfolgt millionenfach, oft unter Zeitdruck im Millisekundenbereich. Ein Modell, das zu langsam ist, um in einem Chatfenster oder auf einem Smartphone zu reagieren, ist nutzlos, egal wie genau es ist.
Allgemeine Inferenzeinstellungen
- Batch-Inferenz für die Offline-Verarbeitung
- Echtzeit-Inferenz für interaktive Anwendungen
- Edge-Inferenz auf lokalen Geräten
- Serverinferenz in Rechenzentren
Die Optimierung konzentriert sich auf Durchsatz und Latenz. Quantisierung, Pruning und spezialisierte Hardware zielen alle auf den Inferenzpfad ab. Dasselbe Modell kann sich je nach Bereitstellungsmethode sehr unterschiedlich verhalten.
Comments
No comments yet. Be the first to share a thought.
Leave a comment