Модель, обученная распознавать кошек и собак, уже кое-что знает о краях, текстурах и шерсти. Перенос обучения использует это: вместо того, чтобы начинать со случайных весов, вы начинаете с сети, которая обучалась на большом наборе данных, и дорабатываете ее для решения вашей меньшей, конкретной задачи. Знания, полученные в первой задаче, переносятся на вторую.
Этот подход стал стандартным, потому что размеченных данных мало, а вычислительные ресурсы дороги. Обучение модели компьютерного зрения с нуля на 5000 медицинских изображениях редко дает хорошие результаты. Часто помогает переобучение последних слоев нейронной сети, предварительно обученной на ImageNet. Ранние слои обнаруживают общие признаки; последующие слои специализируются.
Общие стратегии
- Извлечение признаков: заморозить предварительно обученные слои и обучить только новый классификатор.
- Тонкая настройка: разморозьте некоторые или все слои и продолжите обучение с небольшой скоростью обучения.
- Адаптация предметной области: корректировка модели при переходе от одного распределения данных к другому, например, от синтетических данных к реальным.
Крупные языковые модели продвинули это еще дальше. Одна предварительно обученная модель может быть адаптирована для юридического письма, медицинского кодирования или поддержки клиентов с помощью небольшого дополнительного обучения. Однако загвоздка в отрицательном переносе: если исходные и целевые задачи слишком сильно различаются, предварительно обученные веса могут скорее навредить, чем помочь.
Comments
No comments yet. Be the first to share a thought.
Leave a comment