Skip to content

Latest commit

 

History

History
57 lines (46 loc) · 4.56 KB

File metadata and controls

57 lines (46 loc) · 4.56 KB

Troubleshooting Report: 2026-04-27 (Modeling & Evaluation)

1. 개요

  • 주제: 회귀 및 분류 모델링 실습 중 발생한 전처리/평가 이슈 해결 및 모델 개념 정리
  • 날짜: 2026-04-27

2. 발생 이슈 및 해결 과정

[Issue 1] groupby를 이용한 결측치 처리 시 인덱스 불일치

  • 현상: titanic['Age'].fillna(titanic.groupby('Title')['Age'].median()) 코드를 실행했으나 결측치가 채워지지 않음.
  • 원인: groupby().median()의 결과는 그룹명(Title)이 인덱스인 짧은 시리즈를 반환하므로, 숫자 인덱스인 원본 데이터와 매칭되지 않음.
  • 해결: transform('median')을 사용하여 결과의 크기를 원본 데이터의 행 개수와 일치시켜 인덱스 불일치 문제를 해결함.

[Issue 2] 가변수화(One-Hot Encoding) 시 다중공선성 발생 위험

  • 현상: 범주형 변수를 모두 가변수화할 경우 모델의 계수가 불안정해질 수 있음.
  • 원인: 성별(남/여)처럼 한 쪽이 정해지면 나머지를 100% 알 수 있는 경우, 변수 간 완벽한 선형 관계가 형성되는 '가변수의 함정(Dummy Variable Trap)' 발생.
  • 해결: pd.get_dummies() 사용 시 drop_first=True 옵션을 적용하여 다중공선성을 예방함.

[Issue 3] 이상치(Outlier) 유무에 따른 성능 지표 해석 오류

  • 현상: 모델의 MAE는 낮은데 RMSE 수치가 유독 높게 나타남.
  • 원인: RMSE는 오차를 제곱하여 계산하므로, 소수의 아주 큰 오차(이상치)에 매우 민감하게 반응함.
  • 해결: RMSE와 MAE의 간격이 크다면 데이터 정제 단계에서 이상치를 확인하거나, 이상치에 강건한(Robust) MAE 지표를 병행하여 판단함.

[Issue 4] 다중 회귀 모델 시각화 시의 차원 오류

  • 현상: 여러 독립 변수를 사용하는 다중 회귀 모델에서 단순 회귀용 직선 시각화 코드(y = ax + b) 적용 시 에러 발생 혹은 잘못된 그래프 출력.
  • 원인: 변수가 2개 이상인 경우 2차원 평면에 하나의 직선으로 관계를 표현할 수 없음(데이터 차원 불일치).
  • 해결: 개별 변수와의 관계를 그리는 대신, '실제값 vs 예측값' 산점도를 그려 모델의 전체적인 예측 경향성을 시각화함.

[Issue 5] 복잡한 문자열 처리 시의 코드 가독성 및 성능 저하

  • 현상: if-elif 문을 사용하여 이름에서 칭호(Title)를 추출하는 함수가 너무 길고 처리가 느림.
  • 원인: 파이썬 사용자 정의 함수를 .apply()로 반복 적용하는 방식은 대용량 데이터에서 성능이 저하될 수 있음.
  • 해결: 정규표현식(str.extract())을 사용하여 벡터화된 연산으로 리팩토링함으로써 가독성과 속도를 모두 향상시킴.

3. 주요 모델링 개념 정리

📈 단순 회귀(Simple) vs 다중 회귀(Multiple)

  1. 단순 선형 회귀 (Simple Linear Regression):
    • 특징: 독립 변수가 1개인 모델. ($y = ax + b$)
    • 시각화: 2차원 평면에 모델의 패턴(회귀선)을 직접 직선으로 표현 가능.
  2. 다중 선형 회귀 (Multiple Linear Regression):
    • 특징: 독립 변수가 2개 이상인 모델. ($y = w_1x_1 + w_2x_2 + ... + b$)
    • 시각화: 고차원 공간의 평면이므로 하나의 직선으로 표현 불가. 대신 '예측값 vs 실제값' 그래프로 성능을 간접 확인.

📊 회귀(Regression) vs 분류(Classification)

  1. 회귀 (Regression):
    • 목표: 연속적인 수치(Continuous value) 예측.
    • 평가 지표: MAE, MSE, RMSE, R-Squared ($R^2$).
  2. 분류 (Classification):
    • 목표: 정해진 범주(Category) 내에서 하나를 선택.
    • 평가 지표: Accuracy, Precision, Recall, F1-Score, Confusion Matrix.

4. 핵심 학습 포인트

  • 그룹별 데이터 변환: transform을 활용한 데이터 크기 유지 및 인덱스 매칭 원리 이해
  • 다중공선성(Multicollinearity): 변수 간 중복 정보가 모델에 미치는 부정적 영향 인지
  • 평가 지표의 특성: 데이터의 성격(이상치 등)에 따라 적절한 평가지표를 선택하는 안목 배양
  • 시각화의 한계: 다중 회귀 모델은 단순 직선이 아닌 다차원 공간의 평면으로 이해해야 하며, 예측값-실제값 비교 그래프가 효율적임을 인지
  • 효율적 전처리: 정규표현식을 활용한 고성능 피처 엔지니어링 기법 습득