Skip to content

Latest commit

 

History

History
39 lines (27 loc) · 2.46 KB

File metadata and controls

39 lines (27 loc) · 2.46 KB

Troubleshooting Report: Cross Validation & Logistic Regression (2026-04-29)

오늘 실습에서는 모델의 일반화 성능을 평가하는 교차 검증 기법과 분류의 기초가 되는 로지스틱 회귀를 적용하며 발생한 기술적 문제와 해결 과정을 정리합니다.


1. 주요 에러 및 해결 사례 (Issues & Fixes)

❌ Issue 1: SVC 사용 시 ValueError: Unknown label type: continuous

  • 에러 메시지: Unknown label type: continuous. Maybe you are trying to fit a classifier...
  • 원인: Boston 주택 가격 데이터(연속형 변수)에 분류 모델인 SVC를 적용함.
  • 해결: 회귀 모델인 SVR로 변경하고 평가 지표를 R2, MAE로 수정하여 해결.

❌ Issue 2: SVR 모델의 성능 저하 (R2 Score 0.16)

  • 현상: SVR 모델 학습 후 R2 Score가 0.16으로 매우 낮게 나옴.
  • 원인: SVR은 거리 기반 알고리즘임에도 피처 스케일링(Scaling)을 적용하지 않은 데이터를 입력함.
  • 해결: MinMaxScaler를 통해 데이터를 0~1 사이로 정규화한 후 재학습하여 R2 Score 0.76 이상으로 개선.

2. 모델링 및 성능 최적화 학습 (Insights)

💡 교차 검증(Cross Validation)의 필요성

  • 현상: 단일 Train/Test Split 결과(R2 0.91)가 K-Fold 평균 결과와 차이가 발생할 수 있음.
  • 교훈: K-Fold를 통해 모델의 평균 성능뿐만 아니라 **표준편차(안정성)**를 확인해야 함. 특히 데이터가 적은 경우(Boston) 표준편차가 크고, 대규모 데이터(Mobile)는 표준편차가 매우 낮아 모델 신뢰도가 높음을 확인.

💡 로지스틱 회귀와 확률 해석

  • 실습 내용: 분류 모델 평가 시 accuracy 외에 scoring 파라미터를 변경하여 테스트.
  • 결론: 비즈니스 목표에 따라 recall(놓치지 말아야 할 때)이나 precision(틀리지 말아야 할 때)을 기준으로 모델을 평가해야 함.

💡 하이퍼파라미터 튜닝의 영향

  • 내용: SVR에서 C, gamma, epsilon 조절을 통해 성능이 비약적으로 향상됨을 확인.
  • 주의: 과도한 튜닝은 학습 데이터에만 최적화되는 **과적합(Overfitting)**을 초래할 수 있으므로 항상 교차 검증 점수를 병행 확인해야 함.

3. 향후 과제

  • 앙상블(Ensemble) 모델로의 확장 및 성능 비교.
  • GridSearchCV를 활용한 전방위적 하이퍼파라미터 튜닝 실습.