EN - FR - DE - ES - IT - PT -

LexiconDream

📚 훈련 데이터

머신러닝 모델이 예측을 수행하도록 학습시키는 데 사용되는 데이터셋입니다.

훈련 데이터

모든 모델은 입력된 정보를 압축적으로 반영한 결과물입니다. 훈련 데이터는 바로 그러한 '먹이'와 같습니다. 즉, 기계 학습 시스템이 유용한 작업을 수행하기 전에 학습하는 예제들의 모음입니다. 얼굴 인식 모델은 수백만 개의 레이블이 지정된 초상화에서 학습할 수 있습니다. 체스 엔진은 수백만 개의 게임을 통해 학습합니다. 의료 분류기는 방사선 전문의가 주석을 단 영상 자료를 통해 학습합니다.

볼륨도 중요하지만, 구도가 훨씬 더 중요합니다. 인물 사진이 백인 남성 위주로 구성되어 있다면, 모델은 어두운 피부색이나 여성을 제대로 표현하지 못할 것입니다. 게임 데이터가 아마추어 플레이어에게서만 가져온 것이라면, 엔진 성능은 정체될 수밖에 없습니다. 연구자들은 이를 '분포 변화'라고 부르는데, 실험실에서는 훌륭해 보이는 모델이 실제 환경에서는 제대로 작동하지 못하는 가장 흔한 이유 중 하나입니다.

실질적인 고려 사항

데이터 정제 및 선별 작업은 일반적으로 머신러닝 프로젝트 시간의 60~80%를 차지합니다. 화려한 부분은 아키텍처이고, 결정적인 부분은 데이터셋입니다.

Comments

No comments yet. Be the first to share a thought.

Leave a comment