EN - FR - DE - ES - IT - PT -

LexiconDream

🧪 Дистилляция знаний

Обучение малой модели имитировать поведение большой.

Дистилляция знаний

Большие модели хорошо учатся, но работают медленно. Маленькие модели работают быстро, но учатся меньше. Метод дистилляции знаний находит компромисс, обучая компактную модель-ученика имитировать более крупную модель-учителя, используя мягкие предсказания учителя, а не только жесткие метки.

Мягкие предсказания несут больше информации. Когда учитель присваивает 70-процентную вероятность кошке и 25-процентную собаке, ученик узнает, что кошка и собака имеют общие черты. Жесткие обозначения указывали бы только на кошку. Этот дополнительный сигнал помогает ученику лучше обобщать информацию, чем обучение только на основе обозначений.

Распространенные варианты дистилляции

Эта технология используется во многих производственных системах. Мобильные помощники, рекомендательные модели и детекторы реального времени часто полагаются на оптимизированных учеников, которые сохраняют большую часть точности учителя при значительно меньших затратах.


Warning: session_start(): Cannot start session when headers already sent in /var/www/lexicondream.com/inc/functions.php on line 63

Comments (2)

  1. Robert Ashford
    Knowledge distillation is how you compress a large model into a smaller one without losing too much performance. Useful for deployment.
  2. Nadia F.
    The article is clear. Training a small model to mimic the behavior of a larger model. Simple but important in AI.

Leave a comment