지도 학습에는 답이 필요합니다. 레이블은 훈련 예제에 붙는 목표 값, 즉 모델이 예측해야 할 값입니다. 예를 들어 고양이 이미지는 '고양이'로, 대출 신청서는 '채무 불이행' 또는 '상환 완료'로, 문장은 '긍정적' 또는 '부정적'으로 레이블이 지정될 수 있습니다.
레이블 품질은 모델 품질을 결정합니다. 노이즈가 많은 레이블은 모델이 오류를 재현하도록 학습시키고, 모호한 레이블은 결정 경계를 혼란스럽게 하며, 누락된 레이블은 데이터 커버리지에 공백을 남깁니다. 실무자들은 외부에서 예상하는 것보다 훨씬 더 많은 시간을 레이블링에 투자합니다.
일반적인 라벨링 접근 방식
- 숙련된 작업자의 수동 주석
- 품질 검증을 포함한 크라우드소싱
- 휴리스틱을 이용한 자동 라벨링
- 여러 출처로부터의 부실한 감독
- 불확실한 사례를 우선시하기 위한 능동적 학습
일부 작업에는 전문가 수준의 라벨링 작업이 필요합니다. 의료 영상, 법률 문서, 과학 데이터 등은 일반인이 제공할 수 없는 해당 분야의 전문 지식을 요구합니다. 전문가 라벨링 비용은 새로운 프로젝트 예산에서 상당한 비중을 차지하는 경우가 많습니다.
Comments
No comments yet. Be the first to share a thought.
Leave a comment