Каждая модель — это сжатое отражение того, чему она была её «накормлена». Обучающие данные — это и есть «диета»: набор примеров, которые система машинного обучения изучает, прежде чем ей будет предложено выполнить что-либо полезное. Модель распознавания лиц может обучаться на миллионах размеченных портретов. Шахматный движок обучается на миллионах партий. Медицинский классификатор обучается на снимках, аннотированных рентгенологами.
Объём помогает, но композиция важнее. Если портреты преимущественно белые и мужские, модель не подойдёт для более тёмной кожи и женщин. Если игровые данные получены только от игроков-любителей, движок достигнет плато. Исследователи называют это сдвигом в распределении, и это одна из самых распространённых причин, по которой модель, которая отлично выглядит в лаборатории, терпит неудачу в реальных условиях.
Практические соображения
- Качество меток: зашумленные или предвзятые аннотации ухудшают работу модели.
- Согласие и лицензирование: сбор данных через веб-браузер может нести юридический риск.
- Конфиденциальность: персональные данные часто приходится удалять или анонимизировать.
- Представленность: редкие группы нуждаются в преднамеренном увеличении выборки.
Очистка и обработка данных обычно занимают от 60 до 80 процентов времени, затрачиваемого на проект машинного обучения. Самая привлекательная часть — это архитектура; решающая часть — это набор данных.
Comments
No comments yet. Be the first to share a thought.
Leave a comment