Разметка данных обходится дорого. Исходные данные стоят дешево. Полуконтролируемое обучение объединяет небольшой набор размеченных данных с большим набором неразмеченных данных, используя структуру неразмеченных данных для улучшения обобщающей способности по сравнению с тем, чего можно достичь с помощью одних только разметок.
Подходы различаются. Самообучение с помощью модели присваивает метки немаркированным примерам, а затем переобучает модель на объединенном наборе данных. Регуляризация согласованности заставляет модель выдавать схожие результаты для измененных версий одних и тех же входных данных. Графовые методы распространяют метки через сети сходства.
Распространенные полуконтролируемые методы
- Самообучение и псевдомаркировка
- Регуляризация согласованности
- Минимизация энтропии
- Распространение меток на основе графов
- Контрастное предварительное обучение с последующей тонкой настройкой.
Результаты в значительной степени зависят от данных. Если немаркированные примеры поступают из другого распределения, чем маркированные, производительность может снизиться. Тщательная проверка и сопоставление с предметной областью имеют такое же важное значение, как и сам алгоритм.
Comments
No comments yet. Be the first to share a thought.
Leave a comment