- 상황: 테스트 데이터 정보가 학습 과정에 포함되어 평가 결과가 비정상적으로 높게 나옴.
- 원인:
train_test_split전에 전체 데이터에 대해 스케일링을 적용하거나 결측치를 채움. - 해결: 반드시 데이터를 분할한 후, 학습용 데이터(
train)를 기준으로fit을 수행하고 테스트 데이터는transform만 적용해야 함.
- 상황:
get_dummies결과 변수들 사이에 강한 상관관계가 발생함. - 해결:
drop_first=True옵션을 사용하여 기준이 되는 하나의 범주를 제거함으로써 다중공선성 리스크를 최소화함.
- 상황: 모델 평가 결과 MAE 값이 19.36으로 산출됨.
- 해석: 이 값은 "평균적으로 모델이 실제값보다 약 19.36 단위만큼 틀린다"는 의미임.
- 주의: 이 수치가 좋은지 나쁜지는 타겟 변수의 전체 스케일(평균, 범위)과 비교하여 상대적으로 판단해야 함.
- 머신러닝 모델의 성능은 알고리즘 자체보다 데이터 전처리의 품질에 의해 더 크게 좌우됨.
train_test_split의random_state설정은 분석의 재현성 확보를 위한 필수적인 습관임.