Большие модели хорошо учатся, но работают медленно. Маленькие модели работают быстро, но учатся меньше. Метод дистилляции знаний находит компромисс, обучая компактную модель-ученика имитировать более крупную модель-учителя, используя мягкие предсказания учителя, а не только жесткие метки.
Мягкие предсказания несут больше информации. Когда учитель присваивает 70-процентную вероятность кошке и 25-процентную собаке, ученик узнает, что кошка и собака имеют общие черты. Жесткие обозначения указывали бы только на кошку. Этот дополнительный сигнал помогает ученику лучше обобщать информацию, чем обучение только на основе обозначений.
Распространенные варианты дистилляции
- Дистилляция на основе ответа из выходных логитов
- Дистилляция на основе признаков из промежуточных слоев
- Дистилляция на основе взаимосвязей между слоями.
- Самодистилляция в рамках одной и той же архитектуры
Эта технология используется во многих производственных системах. Мобильные помощники, рекомендательные модели и детекторы реального времени часто полагаются на оптимизированных учеников, которые сохраняют большую часть точности учителя при значительно меньших затратах.
Comments (2)
Leave a comment