
Population risk
Population risk는 실제 데이터 생성 분포 전체에서 모델이 평균적으로 얼마나 큰 loss를 발생시키는지를 가리킴.
- 입력 $X$와 정답 $Y$가 어떤 확률분포에서 발생하고,
- 모델 $f$의 예측 오류를 loss function $L(Y,f(X))$로 나타낸다면
- population risk는 다음과 같이 정의됨:
$$
R(f)=E[L(Y,f(X))]
$$
Population risk는 loss의 expectation으로 정의 되기 때문에 expected risk라고도 흔히 불림.
- 여기서 expectation은 관측된 sample에 대한 평균이 아니라,
- 실제 데이터가 생성되는 population distribution에 대한 평균 을 의미한다.
따라서 population risk는 특정 training set에 종속된 값이 아니라,
모델이 새로운 데이터에 적용될 때 평균적으로 발생시킬 loss를 나타내는 이론적 quantity이다.
이러한 점에서 empirical quantity와 대비되는 theoretical quantity로 볼 수 있다.
- expected risk
- population distribution에 대해 loss의 expectation을 계산한 값
- 가능한 (X,Y)에 대한 평균적인 loss를 의미
- theoretical quantity
- 실제 관측된 sample 자체가 아니라 population distribution을 기준으로 정의됨
- 모집단 분포를 알고 있다는 이론적 조건에서 정의되는 quantity
Population risk의 단점은 실제로 구하기가 너무 어렵다는 점임.
- 실제 데이터 생성 분포를 일반적으로 알 수 없음.
- 따라서 $R(f)$는 이론적으로 정의할 수 있지만, 실제 학습에서는 직접 계산하기 어렵다.
estimation과 prediction 에 대하여
Estimation은
데이터로부터 알 수 없는 parameter나 quantity를 추정하는 것이며,
estimated value는 그 추정된 값임.
Prediction은
학습된 model을 이용하여 새로운 observation의 outcome을 예측하는 것이며,
predicted value는 그 예측된 값임.
Empirical risk
Empirical risk는 population risk를 관측된 sample을 이용하여 추정한 값 임.
- 여기서 empirical은 theoretical과 대비되는 표현으로,
- 실제 관측된 데이터에 근거하여 계산한다는 의미이다.
Training sample이 다음과 같을 경우:
$$
(x_1,y_1),\ldots,(x_n,y_n)
$$
empirical risk는 다음과 같이 정의됨:
$$
\hat R(f) = \frac{1}{n}
\sum_{i=1}^{n}
L(y_i,f(x_i))
$$
즉,
- population risk
- population distribution 전체에서의 expected loss
- theoretical quantity
- 일반적으로 직접 관측 불가
- empirical risk
- 실제로 관측된 sample에서의 average loss
- empirical quantity
- training data로 직접 계산 가능
Empirical risk는 population risk 그 자체가 아니라, 유한한 sample을 이용한 estimate 라는 점이 중요하다.
- Sample이 달라지면 empirical risk도 달라질 수 있으며,
- empirical risk가 작다고 해서 population risk가 반드시 동일하게 작다고 생각해선 안 됨.
Empirical risk minimization
Empirical risk minimization, ERM은
관측된 training sample에서 empirical risk가 가장 작아지도록 모델을 선택하는 방식을 가리킴.
$$
\hat f = \arg\min_f \hat R(f)
$$
실제 목표는 population risk가 작은 모델을 얻는 것이지만,
population risk를 직접 계산할 수 없기 때문에 empirical risk를 대신 최소화한다.
즉, ERM의 기본 논리는 다음과 같다.
- 궁극적 관심: population risk의 최소화
- 현실적 제약: population distribution을 알 수 없음
- 사용 가능한 정보: finite training sample
- 실제 optimization target: empirical risk
따라서
- machine learning에서 training loss를 최소화한다는 것은
- 관측된 sample에서 계산한 empirical risk를 최소화함으로써,
- 알 수 없는 population risk도 작아질 것으로 기대하는 학습 원리로 이해할 수 있다.
사례: Class imbalance와 empirical risk
Class imbalance에서 중요한 것은
- 각 observation의 loss가 다르게 계산된다는 것이 아니라,
- class별 observation 수가 다르다 는 점이다.
예를 들어, 다음과 같은 class imbalance가 있다고 하자:
- majority class: 전체 sample의 90%
- minority class: 전체 sample의 10%
이 경우 empirical risk는 단순화하여 다음과 같음:
$$
\hat R(f) = 0.9\bar L_{\mathrm{major}} + 0.1\bar L_{\mathrm{minor}}
$$
각 observation은 동일한 weight로 loss에 포함되지만,
- majority class의 observation이 더 많기 때문에
- 해당 class에서 발생하는 loss가 전체 empirical risk에 더 많이 포함된다.
따라서,
- majority class의 오류 감소가 전체 empirical risk 감소에 더 크게 기여할 수 있음
- minority class의 오류는 전체 objective에서 상대적으로 작은 비중을 가질 수 있음
- ERM이 frequently observed class에 더 민감하게 반응할 가능성이 생김
이러한 구조가 class imbalance correction의 기본적인 출발점임:
- Re-sampling
- class별 training sample의 구성을 조정
- minority class를 oversampling하거나 majority class를 undersampling
- Loss weighting 또는 cost-sensitive learning
- class별 loss가 empirical risk에 기여하는 크기를 조정
- 소수 클래스에서 발생하는 오류에 더 큰 비용이나 가중치를 주는 방식
- Decision-rule adjustment
- 학습 이후 최종 prediction 단계에서 class frequency의 영향을 조정
- class probability에 보정을 적용하거나 decision threshold를 바꾸는 방식
개입(intervention) 단계는 서로 다르지만, 공통적으로 원래의 class frequency가 학습 또는 prediction에 미치는 영향을 수정함.
'Programming > ML' 카테고리의 다른 글
| Monte Carlo와 MCMC (0) | 2026.08.02 |
|---|---|
| DropPath 와 Stochastic Depth (0) | 2026.07.10 |
| Optimism-corrected Accuracy (0) | 2026.05.26 |
| Balanced Accuracy (균형 정확도) (0) | 2026.05.26 |
| [ML] BFGS, L-BFGS, L-BFGS-B : Quasi-Newton method (0) | 2026.04.27 |
