모든 모델은 입력된 정보를 압축적으로 반영한 결과물입니다. 훈련 데이터는 바로 그러한 '먹이'와 같습니다. 즉, 기계 학습 시스템이 유용한 작업을 수행하기 전에 학습하는 예제들의 모음입니다. 얼굴 인식 모델은 수백만 개의 레이블이 지정된 초상화에서 학습할 수 있습니다. 체스 엔진은 수백만 개의 게임을 통해 학습합니다. 의료 분류기는 방사선 전문의가 주석을 단 영상 자료를 통해 학습합니다.
볼륨도 중요하지만, 구도가 훨씬 더 중요합니다. 인물 사진이 백인 남성 위주로 구성되어 있다면, 모델은 어두운 피부색이나 여성을 제대로 표현하지 못할 것입니다. 게임 데이터가 아마추어 플레이어에게서만 가져온 것이라면, 엔진 성능은 정체될 수밖에 없습니다. 연구자들은 이를 '분포 변화'라고 부르는데, 실험실에서는 훌륭해 보이는 모델이 실제 환경에서는 제대로 작동하지 못하는 가장 흔한 이유 중 하나입니다.
실질적인 고려 사항
- 레이블 품질: 노이즈가 많거나 편향된 주석은 모델에 악영향을 미칩니다.
- 동의 및 라이선스: 웹 스크래핑을 통해 수집된 데이터는 법적 위험을 수반할 수 있습니다.
- 개인정보 보호: 개인 정보는 종종 삭제되거나 익명화되어야 합니다.
- 대표성: 희귀 집단은 의도적인 과표집이 필요하다
데이터 정제 및 선별 작업은 일반적으로 머신러닝 프로젝트 시간의 60~80%를 차지합니다. 화려한 부분은 아키텍처이고, 결정적인 부분은 데이터셋입니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment