Empirical risk

2026. 8. 12. 09:37·Programming/ML
728x90
728x90

Population risk

Population risk는 실제 데이터 생성 분포 전체에서 모델이 평균적으로 얼마나 큰 loss를 발생시키는지를 가리킴.

  • 입력 $X$와 정답 $Y$가 어떤 확률분포에서 발생하고,
  • 모델 $f$의 예측 오류를 loss function $L(Y,f(X))$로 나타낸다면
  • population risk는 다음과 같이 정의됨:

$$
R(f)=E[L(Y,f(X))]
$$

Population risk는 loss의 expectation으로 정의 되기 때문에 expected risk라고도 흔히 불림.

  • 여기서 expectation은 관측된 sample에 대한 평균이 아니라,
  • 실제 데이터가 생성되는 population distribution에 대한 평균 을 의미한다.

따라서 population risk는 특정 training set에 종속된 값이 아니라,
모델이 새로운 데이터에 적용될 때 평균적으로 발생시킬 loss를 나타내는 이론적 quantity이다.

 

이러한 점에서 empirical quantity와 대비되는 theoretical quantity로 볼 수 있다.

  • expected risk
    • population distribution에 대해 loss의 expectation을 계산한 값
    • 가능한 (X,Y)에 대한 평균적인 loss를 의미
  • theoretical quantity
    • 실제 관측된 sample 자체가 아니라 population distribution을 기준으로 정의됨
    • 모집단 분포를 알고 있다는 이론적 조건에서 정의되는 quantity

Population risk의 단점은 실제로 구하기가 너무 어렵다는 점임.

  • 실제 데이터 생성 분포를 일반적으로 알 수 없음.
  • 따라서 $R(f)$는 이론적으로 정의할 수 있지만, 실제 학습에서는 직접 계산하기 어렵다.

 

estimation과 prediction 에 대하여

더보기

Estimation은

  데이터로부터 알 수 없는 parameter나 quantity를 추정하는 것이며,

  estimated value는 그 추정된 값임.

 

Prediction은

  학습된 model을 이용하여 새로운 observation의 outcome을 예측하는 것이며,

  predicted value는 그 예측된 값임.


Empirical risk

Empirical risk는 population risk를 관측된 sample을 이용하여 추정한 값 임.

  • 여기서 empirical은 theoretical과 대비되는 표현으로,
  • 실제 관측된 데이터에 근거하여 계산한다는 의미이다.

Training sample이 다음과 같을 경우:

$$
(x_1,y_1),\ldots,(x_n,y_n)
$$

empirical risk는 다음과 같이 정의됨:

$$
\hat R(f) = \frac{1}{n}
\sum_{i=1}^{n}
L(y_i,f(x_i))
$$

즉,

  • population risk
    • population distribution 전체에서의 expected loss
    • theoretical quantity
    • 일반적으로 직접 관측 불가
  • empirical risk
    • 실제로 관측된 sample에서의 average loss
    • empirical quantity
    • training data로 직접 계산 가능

Empirical risk는 population risk 그 자체가 아니라, 유한한 sample을 이용한 estimate 라는 점이 중요하다.

  • Sample이 달라지면 empirical risk도 달라질 수 있으며,
  • empirical risk가 작다고 해서 population risk가 반드시 동일하게 작다고 생각해선 안 됨.

Empirical risk minimization

Empirical risk minimization, ERM은
관측된 training sample에서 empirical risk가 가장 작아지도록 모델을 선택하는 방식을 가리킴.

$$
\hat f = \arg\min_f \hat R(f)
$$

실제 목표는 population risk가 작은 모델을 얻는 것이지만,
population risk를 직접 계산할 수 없기 때문에 empirical risk를 대신 최소화한다.

 

즉, ERM의 기본 논리는 다음과 같다.

  • 궁극적 관심: population risk의 최소화
  • 현실적 제약: population distribution을 알 수 없음
  • 사용 가능한 정보: finite training sample
  • 실제 optimization target: empirical risk

따라서

  • machine learning에서 training loss를 최소화한다는 것은
  • 관측된 sample에서 계산한 empirical risk를 최소화함으로써,
  • 알 수 없는 population risk도 작아질 것으로 기대하는 학습 원리로 이해할 수 있다.

사례: Class imbalance와 empirical risk

Class imbalance에서 중요한 것은

  • 각 observation의 loss가 다르게 계산된다는 것이 아니라,
  • class별 observation 수가 다르다 는 점이다.

예를 들어, 다음과 같은 class imbalance가 있다고 하자:

  • majority class: 전체 sample의 90%
  • minority class: 전체 sample의 10%

이 경우 empirical risk는 단순화하여 다음과 같음:

$$
\hat R(f) = 0.9\bar L_{\mathrm{major}} + 0.1\bar L_{\mathrm{minor}}
$$

각 observation은 동일한 weight로 loss에 포함되지만,

  • majority class의 observation이 더 많기 때문에
  • 해당 class에서 발생하는 loss가 전체 empirical risk에 더 많이 포함된다.

따라서,

  • majority class의 오류 감소가 전체 empirical risk 감소에 더 크게 기여할 수 있음
  • minority class의 오류는 전체 objective에서 상대적으로 작은 비중을 가질 수 있음
  • ERM이 frequently observed class에 더 민감하게 반응할 가능성이 생김

이러한 구조가 class imbalance correction의 기본적인 출발점임:

  • Re-sampling
    • class별 training sample의 구성을 조정
    • minority class를 oversampling하거나 majority class를 undersampling
  • Loss weighting 또는 cost-sensitive learning
    • class별 loss가 empirical risk에 기여하는 크기를 조정
    • 소수 클래스에서 발생하는 오류에 더 큰 비용이나 가중치를 주는 방식
  • Decision-rule adjustment
    • 학습 이후 최종 prediction 단계에서 class frequency의 영향을 조정
    • class probability에 보정을 적용하거나 decision threshold를 바꾸는 방식

개입(intervention) 단계는 서로 다르지만, 공통적으로 원래의 class frequency가 학습 또는 prediction에 미치는 영향을 수정함.

728x90

'Programming > ML' 카테고리의 다른 글

Monte Carlo와 MCMC  (0) 2026.08.02
DropPath 와 Stochastic Depth  (0) 2026.07.10
Optimism-corrected Accuracy  (0) 2026.05.26
Balanced Accuracy (균형 정확도)  (0) 2026.05.26
[ML] BFGS, L-BFGS, L-BFGS-B : Quasi-Newton method  (0) 2026.04.27
'Programming/ML' 카테고리의 다른 글
  • Monte Carlo와 MCMC
  • DropPath 와 Stochastic Depth
  • Optimism-corrected Accuracy
  • Balanced Accuracy (균형 정확도)
dsaint31x
dsaint31x
    반응형
    250x250
  • dsaint31x
    Dsaint31's blog
    dsaint31x
  • 전체
    오늘
    어제
    • 분류 전체보기 (802)
      • Private Life (16)
      • Programming (216)
        • DIP (116)
        • ML (45)
      • Computer (120)
        • CE (54)
        • ETC (31)
        • CUDA (3)
        • Blog, Markdown, Latex (4)
        • Linux (12)
      • ... (372)
        • Signals and Systems (115)
        • Math (179)
        • Linear Algebra (33)
        • Physics (44)
        • 인성세미나 (1)
      • 정리필요. (62)
        • 의료기기의 이해 (6)
        • PET, MRI and so on. (7)
        • PET Study 2009 (1)
        • 방사선 장해방호 (6)
        • 방사선 생물학 (3)
        • 방사선 계측 (9)
        • 기타 방사능관련 (3)
        • 고시 (9)
        • 정리 (18)
      • RI (0)
      • 원자력,방사능 관련법 (2)
  • 블로그 메뉴

    • Math
    • Programming
    • SS
    • DIP
  • 링크

    • Convex Optimization For All
    • kakao dev. tools.
  • 공지사항

    • Test
    • PET Study 2009
    • 기타 방사능관련.
  • 인기 글

  • 태그

    SS
    fourier transform
    opencv
    math
    Optimization
    linear algebra
    signal_and_system
    DIP
    Vector
    Programming
    signals_and_systems
    ML
    function
    인허가제도
    SIGNAL
    cv2
    Probability
    random
    Term
    Python
  • 최근 댓글

  • 최근 글

  • hELLO· Designed By정상우.v4.10.3
dsaint31x
Empirical risk
상단으로

티스토리툴바