EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 지식 정제 더 큰 모델의 동작을 모방하도록 작은 모델을 훈련시키는 것.

더 큰 모델의 동작을 모방하도록 작은 모델을 훈련시키는 것.

지식 정제
더 큰 모델의 동작을 모방하도록 작은 모델을 훈련시키는 것.

대형 모델은 학습은 잘하지만 실행 속도가 느립니다. 소형 모델은 실행 속도는 빠르지만 학습량은 적습니다. 지식 증류는 이러한 두 가지 단점을 보완하기 위해, 소형 학생 모델을 훈련시켜 대형 교사 모델을 모방하도록 합니다. 이때 교사 모델의 확정적인 레이블뿐만 아니라 소프트 예측 데이터도 활용합니다.

소프트 예측은 더 많은 정보를 담고 있습니다. 예를 들어, 선생님이 고양이일 확률을 70%, 강아지일 확률을 25%로 지정하면 학생은 고양이와 강아지가 공통적인 특징을 공유한다는 것을 배우게 됩니다. 반면 하드 레이블은 고양이만 언급할 것입니다. 이러한 추가 정보는 학생이 레이블만 사용한 학습보다 일반화 능력을 향상시키는 데 도움이 됩니다.

일반적인 증류 변형

이 기술은 많은 생산 시스템에 활용됩니다. 모바일 비서, 추천 모델, 실시간 탐지기 등은 종종 교사 모델의 정확도를 대부분 유지하면서 비용은 훨씬 절감하는 정제된 학생 모델에 의존합니다.

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment