Skip to content

Latest commit

 

History

History
21 lines (16 loc) · 1.45 KB

File metadata and controls

21 lines (16 loc) · 1.45 KB

Troubleshooting: 2026-04-24

1. 주요 이슈 및 해결 방안

1.1. 데이터 누수 (Data Leakage)

  • 상황: 테스트 데이터 정보가 학습 과정에 포함되어 평가 결과가 비정상적으로 높게 나옴.
  • 원인: train_test_split 전에 전체 데이터에 대해 스케일링을 적용하거나 결측치를 채움.
  • 해결: 반드시 데이터를 분할한 후, 학습용 데이터(train)를 기준으로 fit을 수행하고 테스트 데이터는 transform만 적용해야 함.

1.2. 가변수화 시 다중공선성 문제

  • 상황: get_dummies 결과 변수들 사이에 강한 상관관계가 발생함.
  • 해결: drop_first=True 옵션을 사용하여 기준이 되는 하나의 범주를 제거함으로써 다중공선성 리스크를 최소화함.

1.3. MAE(평균 절대 오차)의 비즈니스 해석

  • 상황: 모델 평가 결과 MAE 값이 19.36으로 산출됨.
  • 해석: 이 값은 "평균적으로 모델이 실제값보다 약 19.36 단위만큼 틀린다"는 의미임.
  • 주의: 이 수치가 좋은지 나쁜지는 타겟 변수의 전체 스케일(평균, 범위)과 비교하여 상대적으로 판단해야 함.

2. 오늘의 레슨 런

  • 머신러닝 모델의 성능은 알고리즘 자체보다 데이터 전처리의 품질에 의해 더 크게 좌우됨.
  • train_test_splitrandom_state 설정은 분석의 재현성 확보를 위한 필수적인 습관임.