학습은 모델을 구축하는 과정이고, 추론은 구축된 모델을 활용하는 과정입니다. 가중치가 확정되면, 네트워크는 새로운 입력을 받아 레이블, 확률 또는 생성된 문장과 같은 출력을 생성합니다. 이 과정에서는 기울기 업데이트가 발생하지 않습니다.
추론은 인공지능의 경제성이 드러나는 핵심 부분입니다. 학습은 한 번만 이루어지거나 몇 주에 걸쳐 진행될 수 있습니다. 반면 추론은 수백만 번 수행되며, 종종 밀리초 단위의 지연 시간 제약 속에서 이루어집니다. 아무리 정확하더라도 채팅창이나 휴대폰에서 응답 속도가 너무 느리면 모델은 무용지물입니다.
일반적인 추론 설정
- 오프라인 처리를 위한 배치 추론
- 대화형 애플리케이션을 위한 실시간 추론
- 로컬 기기에서의 엣지 추론
- 데이터 센터의 서버 추론
최적화는 처리량과 지연 시간에 중점을 둡니다. 양자화, 가지치기, 특수 하드웨어는 모두 추론 경로를 대상으로 합니다. 동일한 모델이라도 제공 방식에 따라 매우 다르게 동작할 수 있습니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment