오늘 실습에서는 모델의 일반화 성능을 평가하는 교차 검증 기법과 분류의 기초가 되는 로지스틱 회귀를 적용하며 발생한 기술적 문제와 해결 과정을 정리합니다.
- 에러 메시지:
Unknown label type: continuous. Maybe you are trying to fit a classifier... - 원인: Boston 주택 가격 데이터(연속형 변수)에 분류 모델인
SVC를 적용함. - 해결: 회귀 모델인
SVR로 변경하고 평가 지표를R2,MAE로 수정하여 해결.
- 현상: SVR 모델 학습 후 R2 Score가 0.16으로 매우 낮게 나옴.
- 원인: SVR은 거리 기반 알고리즘임에도 피처 스케일링(Scaling)을 적용하지 않은 데이터를 입력함.
- 해결:
MinMaxScaler를 통해 데이터를 0~1 사이로 정규화한 후 재학습하여 R2 Score 0.76 이상으로 개선.
- 현상: 단일 Train/Test Split 결과(R2 0.91)가 K-Fold 평균 결과와 차이가 발생할 수 있음.
- 교훈: K-Fold를 통해 모델의 평균 성능뿐만 아니라 **표준편차(안정성)**를 확인해야 함. 특히 데이터가 적은 경우(Boston) 표준편차가 크고, 대규모 데이터(Mobile)는 표준편차가 매우 낮아 모델 신뢰도가 높음을 확인.
- 실습 내용: 분류 모델 평가 시
accuracy외에scoring파라미터를 변경하여 테스트. - 결론: 비즈니스 목표에 따라
recall(놓치지 말아야 할 때)이나precision(틀리지 말아야 할 때)을 기준으로 모델을 평가해야 함.
- 내용: SVR에서
C,gamma,epsilon조절을 통해 성능이 비약적으로 향상됨을 확인. - 주의: 과도한 튜닝은 학습 데이터에만 최적화되는 **과적합(Overfitting)**을 초래할 수 있으므로 항상 교차 검증 점수를 병행 확인해야 함.
- 앙상블(Ensemble) 모델로의 확장 및 성능 비교.
GridSearchCV를 활용한 전방위적 하이퍼파라미터 튜닝 실습.