강화학습 보상 함수, 기대값 계산부터 벨만 방정식까지
강화학습에서 상태-행동 쌍의 보상 기대값을 어떻게 정의하고 계산하는지, 감가율과 벨만 방정식으로 가치 함수까지 연결해 정리한다.
2026-08-13 · 최초 발행 2026-04-09
에이전트가 받는 피드백의 형태
강화학습(Reinforcement Learning)에서 에이전트는 환경과 상호작용하며 숫자로 표현되는 피드백, 즉 보상(reward)을 받는다. 이 피드백이 에이전트의 행동이 목표 달성에 얼마나 효과적이었는지를 알려주는 유일한 신호다.
보상은 시점에 따라 다르게 나타난다.
- 즉각적 보상(Immediate reward): 에이전트가 action을 취한 직후 받는 피드백
- 지연된 보상(Delayed reward): 여러 단계의 action 이후에 받는 피드백
- 누적 보상(Cumulative reward): 에피소드 전체에서 받은 모든 보상의 합
상태 s에서 행동 a를 취했을 때의 기대값
특정 상태 s에서 행동 a를 취했을 때 받는 보상의 기대값은 다음과 같이 표현한다.
R(s, a) = E[Rt+1 | St=s, At=a]
현재 상태 s에서 행동 a를 취했을 때, 다음 시간 단계에서 받을 보상의 기대값을 나타내는 식이다.
결정론적 환경과 확률적 환경에서 계산이 갈리는 지점
보상의 기대값은 확률적인 개념이다. 동일한 상태-행동 쌍이라도 환경의 무작위성에 따라 다른 보상을 받을 수 있다.
결정론적 환경(Deterministic Environment)에서는 동일한 상태-행동 쌍에 대해 항상 같은 보상을 받는다. R(s, a) = r, 여기서 r은 고정된 보상 값이다.
확률적 환경(Stochastic Environment)에서는 보상이 확률 분포를 따른다. R(s, a) = Σ r × P(r|s, a), 여기서 P(r|s, a)는 상태 s에서 행동 a를 취했을 때 보상 r을 받을 확률이다.
감가율이 미래 보상의 가치를 조정하는 방식
감가율(Discount factor, γ)은 미래 보상의 현재 가치를 조정하는 파라미터로, 일반적으로 0과 1 사이의 값(0 < γ ≤ 1)을 가진다.
- γ = 0: 현재 보상만 고려 (근시안적 접근)
- γ = 1: 미래 보상을 현재와 동일하게 가치 평가 (장기적 접근)
- 0 < γ < 1: 미래 보상을 현재보다 할인된 가치로 평가
감가율을 적용한 누적 보상(Return)은 다음과 같이 계산한다.
Gt = Rt+1 + γRt+2 + γ²Rt+3 + ... = Σ γᵏRt+k+1 (k=0부터 무한대까지)
가치 함수가 보상 기대값과 만나는 지점
보상의 기대값을 바탕으로 가치 함수를 정의한다.
상태 가치 함수(State Value Function, V(s))는 상태 s에서 시작하여 현재 정책을 따랐을 때 예상되는 누적 보상의 기대값이다. V(s) = E[Gt | St=s]
행동 가치 함수(Action Value Function, Q(s, a))는 상태 s에서 행동 a를 취하고 이후 현재 정책을 따랐을 때 예상되는 누적 보상의 기대값이다. Q(s, a) = E[Gt | St=s, At=a]
가치 함수와 보상 함수 R(s, a)의 관계는 다음과 같다.
Q(s, a) = R(s, a) + γ Σ P(s'|s, a) × V(s')
여기서 P(s'|s, a)는 상태 s에서 행동 a를 취했을 때 다음 상태가 s'가 될 확률이다.
벨만 방정식으로 가치를 재귀적으로 풀어내기
벨만 방정식은 현재 상태-행동의 가치와 다음 상태의 가치 간의 관계를 정의한다.
상태 가치 함수에 대한 벨만 방정식은 V(s) = Σ π(a|s) × [R(s, a) + γ Σ P(s'|s, a) × V(s')]이다.
행동 가치 함수에 대한 벨만 방정식은 Q(s, a) = R(s, a) + γ Σ P(s'|s, a) × Σ π(a'|s') × Q(s', a')이다.
여기서 π(a|s)는 상태 s에서 행동 a를 선택할 확률인 정책(policy)이다.
로봇 내비게이션, 주식 트레이딩, 게임 AI에서 보상을 설계하는 방식
로봇이 장애물을 피해 목적지에 도달하는 문제에서는 상태(s)가 로봇의 현재 위치와 방향, 행동(a)이 전진·좌회전·우회전 등이다. 보상(R(s, a))은 목적지 도달 시 +100, 장애물 충돌 시 -50, 각 스텝마다 -1(빠른 도달을 유도)로 설계한다. γ = 0.9를 적용하면 로봇은 단기적인 패널티보다 장기적인 목표 달성에 더 가중치를 둔다.
자동화된 트레이딩 시스템에서는 상태(s)가 현재 시장 상황과 포트폴리오 상태, 행동(a)이 매수·매도·홀딩이다. 보상(R(s, a))은 수익 발생 시 +수익률, 손실 발생 시 -손실률로 설계한다. γ = 0.95를 적용하면 시스템은 단기 수익과 장기 수익 사이의 균형을 찾는다.
체스 AI 시스템에서는 상태(s)가 현재 게임 보드 배치, 행동(a)이 가능한 모든 합법적 이동이다. 보상(R(s, a))은 승리 시 +1, 패배 시 -1, 무승부 시 0, 기타 이동 시 0으로 설계한다. γ = 0.99를 적용하면 AI는 장기적인 승리 가능성을 높이는 의사결정을 한다.
보상이 희소하거나 잘못 설계됐을 때
효과적인 강화학습을 위해서는 적절한 보상 함수를 설계하는 것이 중요하다.
보상 희소성 문제(Reward Sparsity)는 에이전트가 학습하기 어려운 희소한 보상 문제다. 보조 보상(Auxiliary Rewards)이나 내재적 동기 부여(Intrinsic Motivation)를 활용해 해결한다.
보상 형태(Reward Shaping)는 학습 과정을 가속화하기 위해 중간 단계 보상을 추가하는 방법이다. 다만 잘못된 보상 형태가 원치 않는 행동을 유도할 수 있다는 점은 주의해야 한다.
역 강화학습(Inverse Reinforcement Learning)은 전문가의 행동을 관찰해 암묵적인 보상 함수를 유추하는 방법이다. 명시적으로 보상 정의가 어려운 문제에 효과적이다.
측정하는 것이 최적화된다
"상태 s에서 행동 a를 취했을 때 받는 보상의 기대값"은 에이전트의 의사결정 과정의 핵심이다. 이 기대값을 정확히 계산하고 업데이트하는 것이 강화학습 알고리즘의 주요 목표이며, 감가율을 통해 단기적 보상과 장기적 보상 사이의 균형을 맞춘다.
효과적인 보상 함수 설계는 강화학습 에이전트의 성공에 직접적인 영향을 미치며, 이는 "당신이 측정하는 것이 최적화된다"는 원칙을 반영한다. 문제의 목표를 정확히 반영하는 보상 함수를 설계하는 것이 중요하다.