머신러닝 평가지표 — 회귀와 분류, 무엇으로 성능을 잴 것인가

MAE·MSE·RMSE·R²부터 정확도·정밀도·재현율·F1·ROC-AUC까지 회귀·분류 모델의 평가지표를 정리하고 비즈니스 목표에 맞는 선택 기준을 살펴본다.

2026-08-14 · 최초 발행 2025-05-23

같은 모델이라도 어떤 지표로 평가하느냐에 따라 "좋은 모델"의 기준이 달라진다. 사기 탐지 시스템에서 정확도가 아무리 높게 나와도 실제 사기 거래를 대부분 놓친다면 그 모델은 쓸모가 없다. 평가지표는 모델의 목적과 데이터 특성에 맞춰 선택해야 하며, 크게 예측모델(회귀)용과 분류모델용으로 나뉜다. 단일 지표에만 의존하지 않고 여러 지표를 종합적으로 보는 것이 안전하다.

MAE부터 R²까지, 회귀모델 오차를 재는 법

MAE(Mean Absolute Error)는 실제값과 예측값 차이의 절대값 평균이다.

수식: MAE = (1/n) Σ |y_i - ŷ_i|

이상치에 상대적으로 덜 민감하고, 오차의 절대적 크기를 직관적으로 이해할 수 있으며, 원본 데이터와 같은 단위를 갖는다. 주택 가격 예측 모델에서 평균 예측 오차를 금액으로 직접 확인할 때 유용하다.

MSE(Mean Squared Error)는 실제값과 예측값 차이의 제곱 평균이다.

수식: MSE = (1/n) Σ (y_i - ŷ_i)²

오차를 제곱하기 때문에 큰 오차에 더 큰 가중치가 실리고, 이상치에 매우 민감하며, 단위는 원본 데이터의 제곱 형태로 표현된다. 금융 시계열 예측처럼 큰 예측 오차에 더 강한 페널티를 주고 싶을 때 효과적이다.

RMSE(Root Mean Squared Error)는 MSE의 제곱근으로, 원본 데이터와 동일한 단위로 되돌린 값이다.

수식: RMSE = √MSE = √[(1/n) Σ (y_i - ŷ_i)²]

MSE의 장점을 유지하면서도 해석이 직관적이고, 통계적으로 표준편차와 관련이 있어 이해하기 쉽다. 기상 예측 모델에서 온도·강수량의 예측 오차를 측정할 때 자주 쓰인다.

R²(결정계수)는 모델이 설명하는 분산의 비율을 나타낸다.

수식: R² = 1 - (SSE/SST) = 1 - [Σ(y_i - ŷ_i)² / Σ(y_i - ȳ)²]

0~1 사이 값을 가지며 1에 가까울수록 좋은 모델이고(음수 값도 가능하다), 단위가 없어 다른 모델과 비교하기 쉽다. 마케팅 효과 분석에서 캠페인이 매출 변동의 몇 퍼센트를 설명하는지 확인할 때 활용된다.

TP·FP·TN·FN에서 시작하는 분류모델 평가

분류 모델의 예측 결과는 네 범주로 나뉜다. 참 양성(TP)은 실제 양성을 양성으로 정확히 예측한 경우, 거짓 양성(FP)은 실제 음성을 양성으로 잘못 예측한 경우, 참 음성(TN)은 실제 음성을 음성으로 정확히 예측한 경우, 거짓 음성(FN)은 실제 양성을 음성으로 잘못 예측한 경우다.

혼동행렬예측\실제양성음성양성TP: 양성FP: 거짓 양성음성FN: 거짓 음성TN: 음성

정확도(Accuracy)는 전체 예측 중 올바르게 예측한 비율이다.

수식: Accuracy = (TP + TN) / (TP + TN + FP + FN)

가장 직관적인 지표이지만 불균형 클래스에는 취약하고, 모든 클래스의 중요도가 동일할 때 적합하다. 클래스 분포가 균형적인 스팸 메일 필터링에서 쓰인다.

정밀도(Precision)는 양성으로 예측한 것 중 실제 양성인 비율이다.

수식: Precision = TP / (TP + FP)

거짓 양성(False Positive)을 최소화하는 게 중요할 때 유용하며 양성 예측의 신뢰도를 나타낸다. 의료 진단에서 불필요한 치료나 추가 검사를 줄이기 위해 중요하다.

재현율/민감도(Recall/Sensitivity)는 실제 양성 중 양성으로 정확히 예측한 비율이다.

수식: Recall = TP / (TP + FN)

거짓 음성(False Negative)을 최소화하는 게 중요할 때 유용하며 양성 케이스를 얼마나 잘 잡아내는지 측정한다. 암 진단처럼 중대한 질병 탐지에서 위험 사례를 놓치지 않기 위해 중요하다.

F1-Score는 정밀도와 재현율의 조화 평균이다.

수식: F1 = 2 _ (Precision _ Recall) / (Precision + Recall)

정밀도와 재현율 사이의 균형을 잡아주며, 불균형 데이터셋에서 모델 성능을 단일 지표로 평가할 때 유용하다. 부정 거래 탐지 시스템에서 균형 잡힌 성능 측정에 활용된다.

ROC-AUC(Receiver Operating Characteristic - Area Under Curve)는 다양한 임계값에서의 참 양성률(TPR)과 거짓 양성률(FPR)을 플롯한 곡선 아래 면적이다.

TPR(참 양성률) = Recall = TP / (TP + FN) FPR(거짓 양성률) = FP / (FP + TN)

AUC 값은 0.5(무작위 예측)에서 1.0(완벽한 예측) 사이에 분포한다. 분류 임계값에 독립적으로 평가할 수 있고 클래스 불균형에 상대적으로 강건해, 모델의 분류 성능을 전체적으로 평가할 때 쓰인다. 신용 평가 모델에서 다양한 임계값에 따른 성능 변화를 종합적으로 평가하는 데 활용된다.

무엇을 기준으로 지표를 고를 것인가

비즈니스 문제의 특성과 목표에 맞는 지표를 골라야 한다. 사기 탐지 시스템에서는 재현율이, 스팸 필터에서는 정밀도가 더 중요할 수 있다.

데이터 특성도 고려 대상이다. 불균형 데이터셋이라면 정확도보다 F1-Score나 ROC-AUC가 적합하고, 이상치가 있다면 MSE보다 MAE가, 상대적 성능 비교가 필요하다면 R²가 적합하다.

여러 모델을 비교할 때는 동일한 지표를 일관되게 적용해야 하고, 단일 지표에만 의존하지 않고 여러 지표를 종합적으로 봐야 한다. 특정 지표에만 초점을 맞춘 튜닝은 다른 지표의 성능을 떨어뜨릴 수 있으므로, 트레이드오프를 이해하고 적절한 균형점을 찾는 것이 중요하다.

산업마다 조합이 다르다

금융 산업에서는 대출 상환 예측에 RMSE와 R²를, 부정 거래 탐지에는 재현율과 ROC-AUC를, 고객 이탈 예측에는 F1-Score와 정밀도를 균형 있게 쓴다.

의료 산업에서는 질병 진단에 재현율(민감도)과 특이도를 함께 보고, 환자 재입원 위험 예측에는 RMSE와 R²로 예측 정확도를 평가하며, 의료 영상 분류에는 ROC-AUC와 F1-Score를 쓴다.

마케팅 분야에서는 고객 세그먼트 예측에 정확도와 정밀도를, 클릭률(CTR) 예측에 MAE와 RMSE를, 캠페인 효과 분석에 R²를 활용한다.

평가지표는 모델 개발의 지침이자 비즈니스 가치와 연결되어야 의미가 있다. 실무에서는 통계적 지표와 함께 비즈니스 KPI를 나란히 놓고 판단하는 경우가 많다.

평가지표머신러닝회귀분석분류모델혼동행렬