단위 3 / 11

모델 훈련 및 평가: 정확한 측정항목, 정직한 벤치마킹

이득:

  • 문제 유형 및 비즈니스 컨텍스트(불균형 데이터의 PR-AUC/리콜, 회귀의 MAE/RMSE)에 적합한 측정항목을 선택하고 학습 과잉/과소를 인식하는 능력
  • 기준선에 대해 각 지표를 해석하고 편차를 측정하며 교차 검증을 통해 진행 상황에서 노이즈를 분리하는 기능
  • 검증 세트로 하이퍼파라미터를 조정하고 마지막에만 테스트 세트를 사용하여 낙관적이지 않은 결과를 보고하는 기능

모델 훈련(훈련: 데이터에서 패턴을 학습하는 프로세스)은 ML 엔지니어링에서 가장 눈에 띄지만 가장 오해를 불러일으키는 단계입니다. "정확도 95%"라는 만족스러운 수치를 내기 때문에 나타나는 것이다. 그 숫자는 종종 잘못된 질문에 대한 정답이기 때문에 오해의 소지가 있습니다. 이 단원에서는 공학 분야의 교육과 평가에 대해 논의합니다. 우리는 실험 설계의 파트너로 인공 지능을 사용하고 측정에 따라 결정을 내립니다.

훈련주기의 논리

모델은 손실 함수(모델의 오류를 수치적으로 측정하는 함수)를 최소화하여 데이터의 패턴을 학습합니다. 최적화 알고리즘(예: 경사하강법)은 매개변수를 단계별로 조정하여 손실을 줄입니다. 목표는 훈련 데이터를 기억하는 것이 아니라, 전례 없는 데이터로 일반화하는 것입니다.

두 가지 주요 위험:

  • 과적합: 모델이 훈련 데이터를 기억하고 새 데이터에 실패합니다. 학습 성공률은 높지만 검증 성공률은 낮습니다.
  • 과소적합: 모델이 패턴을 포착할 수 없습니다. 학습 및 검증 성공률이 모두 낮습니다.

균형을 찾는 것이 교육의 예술입니다. 검증 세트는 이 균형을 모니터링하기 위해 존재합니다. 훈련 성공이 증가하는 동안 검증 성공이 감소하기 시작하면 과잉 학습이 시작된 것입니다.

팁: 각 단계에서 훈련 손실과 검증 손실을 함께 플롯합니다. 두 곡선이 갈라지기 시작하는 지점이 과잉 학습이 시작되는 지점이며 "조기 중단"에 적합한 순간입니다.

지표 선택: 가장 중요한 결정

잘못된 측정 기준은 좋은 모델을 나쁘게 보이게 만들고 나쁜 모델을 좋게 보이게 만듭니다. 문제에 따라 측정항목이 결정됩니다.

  • 불균형 분류(한 클래스는 매우 드뭅니다(예: 사기)): 정확성이 오해를 불러일으킵니다. "모든 것을 정상으로 간주"라고 말하는 모델은 99%의 정확도를 얻지만 단 한 건의 사기도 포착하지 못합니다. 대신 정밀도(내가 잡은 것이 실제로 긍정적인 정도), 재현율(내가 잡은 것 중 실제로 긍정적인 정도) 및 균형 F1 또는 PR-AUC가 사용됩니다.
  • 균형 잡힌 분류: 정확도와 ROC-AUC가 적절할 수 있습니다.
  • 회귀(수 추정): MAE(평균 절대 오류), RMSE(큰 오류에 페널티 부여), MAPE(백분율 오류).
  • 순위/추천: NDCG, MRR, Recall@K.

정밀도나 재현율이 중요한지 여부는 비즈니스 상황에 따라 다릅니다. 암 검진에서는 리콜(환자 누락 없음)이 최우선입니다. 스팸 필터의 정확성(중요한 이메일을 스팸으로 분류하지 않음)이 중요합니다. 이는 기술적인 결정이 아닌 비즈니스 결정이며 엔지니어와 소유자가 함께 내립니다.

약한 프롬프트 / 강한 프롬프트

약한 프롬프트: "내 모델의 성능을 평가합니다. 정확도는 0.97입니다."

강력한 프롬프트: "나는 사기 탐지 모델을 가지고 있습니다. 포지티브 클래스 비율은 1.5%입니다. 정확도는 0.97로 보고됩니다. 이 측정항목이 오해의 소지가 있는 이유를 설명하고, 어떤 측정항목(정밀도, 재현율, PR-AUC)을 선호해야 하는지, 그 이유를 알려주세요. 또한 '모든 것을 부정적으로 호출' 기준 모델이 이 데이터에서 얼마나 정확한지 계산하여 실제 부가 가치를 확인할 수 있습니다."

차이점: 강력한 프롬프트는 학급 비율과 비즈니스 맥락을 제공합니다. 또한 기준 모델 비교를 요청합니다. 이는 측정항목이 의미가 있는지 여부를 판단하는 가장 중요한 기준입니다.

기준: 비교 없는 측정항목은 의미가 없습니다.

지표는 그 자체로 좋거나 나쁘지 않습니다. 기본 모델에 따르면 좋기도 하고 나쁘기도 하다. 기본 모델은 "항상 다수 클래스에게 말하라", "지난주의 값을 반복하라", "평균을 추측하라"는 생각나는 가장 간단한 해결책이다. 모델이 이 간단한 솔루션을 명확하게 통과할 수 없다면 모든 복잡성은 헛된 것입니다.

주의: "내 모델은 85% 정확합니다."라는 문장 자체로는 아무 의미도 없습니다. 기본 모델이 이미 84%를 얻은 경우 모델은 거의 가치가 없습니다. 기본 모델이 50%를 얻으면 모델이 완벽합니다. 항상 기본 모델의 관점에서 이야기하십시오.

교차 검증 및 신뢰

단일 학습/테스트 분할은 우연에 의해 발생할 수 있습니다. 교차 검증: 데이터를 k개 부분으로 나누고 각 부분을 순차적으로 테스트하면 성능이 얼마나 안정적인지 확인할 수 있습니다. 5겹 교차 검증에서는 5가지 다른 점수를 얻습니다. 평균과 표준편차가 중요합니다. 평균이 80%이지만 편차가 ±12%인 경우 모델이 불안정합니다. 즉, 다음 데이터 배치에서는 매우 다르게 동작할 수 있습니다.

이는 "두 모델 비교"에도 중요합니다. 모델 A가 81%를 얻었고 모델 B가 82%를 얻었다면 B가 정말 더 나은가요? 편차가 ±3%이면 이 차이는 노이즈일 수 있습니다. 결정하기 전에 차이가 중요한지 고려하십시오.

초매개변수 조정: 테스트가 아닌 검증을 통해

하이퍼파라미터(학습 전에 수동으로 결정된 설정, 학습률, 트리 깊이 등)는 검증 세트를 통해 설정됩니다. 테스트 세트는 마지막에 한 번만 사용됩니다. 테스트 세트를 보고 하이퍼파라미터를 선택하면 테스트 세트가 오염되고 보고하는 성능은 실제로는 그렇지 않은 낙관적일 것입니다.

인공지능은 하이퍼파라미터 검색 공간을 설계하고 검색 코드(그리드 검색, 랜덤 검색, 베이지안 최적화)를 작성하는 데 좋은 도우미입니다. 하지만 "어떤 지표를 최적화할 것인가"는 여전히 귀하가 결정합니다.

세 개의 미니 케이스

사례 1 - 정확도 함정. 한 의료팀은 희귀 질병을 발견한 모델(98% 정확도)을 자랑스럽게 생각했습니다. 기본 모델 비교를 해보니, 질병 발생률이 2%이므로 "모두 건강하라"고 말한 모델도 98%를 받았다는 사실이 밝혀졌습니다. 모델의 재현율은 11%에 불과하여 대부분의 환자가 누락되었습니다. 측정항목을 PR-AUC로 변환한 후 실제 성능을 측정하고 모델을 재설계했습니다.

사례 2 - 소음을 진행 상황으로 착각합니다. 한 팀은 모델을 86.2%에서 86.9%로 개선하는 데 몇 달을 보냈습니다. 교차 검증 결과 편향이 ±1.4%인 것으로 나타났습니다. 따라서 0.7포인트 "개선"은 통계적 노이즈였습니다. 팀은 비현실적인 수입으로 3주를 낭비했습니다. 교훈: 개선이 편차보다 크다는 것을 확인하지 않고 승리를 선언하지 마십시오.

사례 3 - 테스트 세트의 오염. 엔지니어는 최상의 초매개변수를 선택하기 위해 테스트 세트를 반복적으로 살펴보았습니다. 보고된 91%는 생산량에서 83%로 떨어졌습니다. 이유: 그는 테스트 세트를 반복해서 살펴봄으로써 무의식적으로 모델을 선택했습니다(테스트 세트에 대한 과잉 학습). 별도의 검증 세트를 사용한 경우 보고된 성능과 실제 성능이 겹쳤습니다.

복사 가능한 템플릿

이 분류 문제에 적합한 측정항목을 선택하는 데 도움을 주세요. 문제: [예측되는 내용] 클래스 분포: [긍정 비율]

다음 두 모델의 비교를 평가합니다. 모델 A 교차 검증: [점수 목록]모델 B 교차 검증: [점수 목록]평균 및 표준 편차를 계산합니다. 차이가 통계적으로 유의미합니까, 아니면 편차 내의 잡음입니까? 어떤 것을 선택하라고 추천하시겠습니까? 그리고 그 이유는 무엇입니까?

다음 사항에 대해 이 학습 코드를 확인하세요.1) 테스트 세트 또는 검증 세트로 초매개변수가 선택되어 있습니까?2) 올바른 세트로 조기 중지가 모니터링됩니까?3) 과잉 학습 징후가 있습니까(훈련/검증 손실 차이)?코드: [코드]

이 회귀 문제에 대해 MAE, RMSE, MAPE 중 무엇을 보고해야 합니까?대상 변수의 규모: [범위]큰 오류는 불균형적으로 나쁩니까(RMSE), 아니면 모두 동일합니까(MAE)?0에 가까운 값이 있습니까(MAPE를 왜곡합니까)?간략한 근거와 함께 제안하십시오.

측정항목 선택 테이블

문제 유형

적절한 측정항목

피해야 할 것

왜?

불균형 분류

PR-AUC, F1, 리콜

정확도

다수 계층은 지표를 부풀린다

균형 잡힌 분류

정확도, ROC-AUC

균형 잡힌 데이터의 신뢰성

회귀(중요한 특이치)

RMSE

MAPE(0인 경우)

중대한 실수를 처벌합니다.

회귀(동일 가중치)

해석하기 쉬움

순위/추천

NDCG, 리콜@K

정확도

순서가 중요하다

일반적인 실수

  • 불균형 데이터에 정확도를 사용합니다. 가장 일반적인 측정항목 오류입니다.
  • 기본 모델 비교를 하지 않습니다. 이는 측정항목의 의미를 잃게 만듭니다.
  • 하이퍼파라미터에 대한 테스트 세트를 살펴봅니다. 낙관적이고 비현실적인 결과.
  • 단일 구획에 의존합니다. 교차 검증이 없으면 편향이 표시되지 않습니다.
  • 소음을 진행으로 착각합니다. 편차로 인한 작은 "개선"은 대부분 운입니다.
  • 비즈니스 맥락을 무시합니다. 정밀도/재현율 균형은 비즈니스 결정입니다.

요약하면

모델 학습의 실제 기술은 높은 숫자를 생성하는 것이 아니라 그 숫자가 무엇을 의미하는지 아는 것입니다. 문제와 비즈니스 상황에 따라 올바른 측정 기준이 결정됩니다. 기준 모델에 따라 각 지표를 해석합니다. 교차 검증을 통해 편향을 측정하고 노이즈를 진행 상황으로 착각하지 마세요. 테스트 세트는 마지막에 한 번만 사용하십시오. AI는 실험 설계의 파트너이지만 "충분하다"는 결정은 귀하와 귀하의 몫입니다.

응용과제

분류 모델의 경우: (1) 클래스 분포를 작성하고, (2) 적절한 기본 모델을 구축하고 해당 점수를 측정하고, (3) 5겹 교차 검증으로 모델을 평가하고 평균 및 표준 편차를 보고하고, (4) 정확도 대신 문제에 적합한 측정항목(예: PR-AUC)을 계산합니다. 귀하의 모델이 편향 없이 큰 차이로 기준 모델을 능가하는지 기록해 보세요.

체크리스트

  • [ ] 문제 유형과 비즈니스 맥락을 기반으로 측정항목을 선택했습니다.
  • [ ] 기본 모델을 구축하고 비교했습니다.
  • [ ] 교차 검증을 통해 평균과 편차를 보고했습니다.
  • [ ] 편차보다 개선폭이 더 큰 것을 확인했습니다.
  • [ ] 검증 세트를 사용하여 하이퍼파라미터를 선택했습니다.
  • [ ] 테스트 세트는 마지막에 한 번만 사용했습니다.