멀티에이전트 학습에서 협력·경쟁 전략과 균형 계산

협력 MARL, 비협력 게임 학습, Nash·Correlated 균형 계산을 CTDE·가치 분해·상대 모델링 관점에서 비교하고 배포 전 검증과 운영 제어 방법을 정리한다.

2026-08-14 · 최초 발행 2024-04-29

여러 정책이 함께 움직일 때의 학습 문제

멀티에이전트 시스템(MAS)은 여러 자율 에이전트가 상호작용하면서 목표를 수행하는 분산 지능 시스템이다. Multi-Agent Reinforcement Learning(MARL)에서는 팀 목표를 함께 최적화하는 경우도 있고, 각자 보상을 추구하며 경쟁하는 경우도 있다. 여기에 균형 계산을 더하면 정책이 얼마나 안정적인지, 배포 전 어떤 전략 위험을 점검해야 하는지도 다룰 수 있다.

협력 MARL은 목적 함수를 공유하거나 팀 보상을 크게 만드는 문제로 정식화한다. 일반적으로 Dec-POMDP(분산 부분관측 MDP) 가정을 사용하며, CTDE(Centralized Training, Decentralized Execution), VDN/QMIX/QTRAN/QPLEX 같은 가치 분해, COMA의 Counterfactual Credit Assignment, MAPPO, MADDPG 변형 등이 활용된다. 팀 보상을 받는 상황에서는 누가 성과에 기여했는지 구분하는 크레딧 할당, 통신과 조정, 부분관측 아래의 안정적 학습이 핵심 과제가 된다.

비협력 게임에서는 각 에이전트가 개별 보상을 최대화한다. 정상형의 정적 게임, 전개형의 순차 게임, Markov 게임의 동적 구성이 여기에 해당한다. Minimax-Q는 제로섬 문제에, Nash-Q와 Friend-or-Foe Q는 전략 학습에 쓰이며, Opponent Modeling에서는 BR 또는 belief update를 적용할 수 있다. 전개형 게임에는 CFR(Counterfactual Regret Minimization), 전략 변화에는 Fictitious Play와 Best Response Dynamics가 사용된다. 상대 정책이 계속 바뀌는 비정상성, 수렴성 보장, 여러 균형 중 무엇을 선택할지의 문제가 남는다.

균형 계산은 Nash, Correlated, Coarse Correlated 등의 균형 개념으로 전략 안정성을 평가한다. 제로섬 게임은 LP로 비용함수를 최적화해 정확 해를 구할 수 있고, 2인 정상형 게임에는 Lemke–Howson과 지지집합 열거를 적용한다. 전개형 게임에는 CFR과 Regret Matching을, 인구 기반 문제에는 α-Rank와 복제자 동역학을 근사 방식으로 활용한다. 이 과정은 수렴 검증, 익스플로이터빌리티(exploitability) 측정, 배포 전 안전성 평가를 위한 기준이 된다.

중앙에서 학습하고 현장에서 분산 실행하기

CTDE는 훈련 중에는 중앙집중 정보와 크리틱을 사용하고, 배포 뒤에는 각 에이전트가 로컬 정책을 실행하는 구조다. 통신 제약이 있는 환경에서 협력 정책을 운영하기 위한 실용적인 선택지다.

상호작용 구조는 파라미터 공유, 역할 기반 정책, 그래프 신경망(GNN)으로 표현할 수 있다. 메시지 패싱과 어텐션은 이런 구조를 확장하는 데 쓰인다. 팀 보상만으로는 개별 기여를 알기 어려우므로 Difference Reward와 Counterfactual Baseline(COMA)으로 변동성을 낮춘다. VDN, QMIX, QPLEX는 단조성 제약 아래에서 개별 가치 함수를 합성하는 Q 학습을 지원한다.

경쟁과 협력이 섞인 환경에서는 Opponent/Teammate Modeling으로 다른 정책을 추정하고, Best Response, Level-k, Belief Update를 적용한다. PBT(Population-Based Training)와 PSRO(Policy-Space Response Oracles)는 혼합전략을 근사하고 exploit–anti-exploit의 순환을 완화하는 데 사용된다.

분산 학습의 발산을 제어하려면 PPO clipping, 엔트로피 정규화, Target/Double Q, 우선순위 재생을 조합할 수 있다. 정책 버전을 고정하는 lock-step 업데이트, 러닝레이트 스케줄, 조기 종료와 체크포인트 롤백도 운영 제어 수단이다.

CTDE에서 정책이 배포되기까지

병렬 Rollout: N명의 에이전트Mini-batch∇θ타깃 네트워크 τ 업데이트아니오아니오동기화Agent i: 정책 π_θ환경 상호작용리플레이 버퍼중앙 크리틱/학습기정책 파라미터 θ 업데이트Target Nets발산 감지?(loss↑, KL↑, return↓)체크포인트 롤백/학습률 감소수렴 기준 충족?(exploitability↓, return정체)분산 실행 배포(Decentralized Execution)

학습기는 병렬 에피소드 또는 스텝, 팀·개별 보상, 관측·행동 로그를 입력으로 받는다. 중앙 크리틱 학습과 정책 업데이트, 타깃 네트워크 동기화를 수행한 뒤 발산을 감지하면 롤백한다. 결과물은 에이전트별 경량 정책, 성능·안정성 지표, 체크포인트다.

협력과 경쟁이 나타나는 운영 환경

창고 집배송 로보틱스는 Dec-POMDP로 표현할 수 있다. 충돌 패널티와 작업시간 보상을 설계하고, MAPPO 또는 QMIX+우선순위 재생과 파라미터 공유를 적용한다. 배포에서는 정책을 온디바이스로 경량화하고 거리·속도 제한 같은 안전 제약 안에 삽입한다.

도시 규모의 교통 신호 제어에서는 여러 교차로가 에이전트가 된다. 국소 관측과 이웃 통신을 바탕으로 가치 분해와 GNN 메시지 패싱, 커리큘럼 학습을 적용할 수 있다. 운영 단계에서는 피크·비피크 성능을 기준으로 드리프트를 모니터링하고, 온라인 파인튜닝에는 가드레일을 둔다.

무선 자원 경매와 스펙트럼 공유는 전송률과 간섭이 충돌하는 일반합 게임이다. Best-Response Dynamics와 NE 근사, α-Rank를 통해 안정 전략을 탐색하며, 익스플로이터빌리티로 균형을 검증한다. 규제와 공정성 제약도 정책 조건에 반영해야 한다.

학습 방식별 성능과 운영 특성

항목 협력 MARL(CTDE/VDN/QMIX/MAPPO) 비협력 학습(Minimax-Q/CFR 등) 균형 계산(LP/Lemke–Howson/α-Rank)
성능 팀 보상 극대화에 강함, 대규모 협업 우수 상대 최적 대응에 강함, 경쟁 환경 유리 정확/근사 해 제공, 벤치마크 기준 역할
확장성 통신/가치 분해로 수십~수백 에이전트 확장 가능 상대 수 증가 시 상태-전략 공간 폭발 플레이어 수 증가 시 계산량 급증, 근사 필요
일관성 CTDE로 비정상성 완화, 수렴성 경험적 보장 균형 수렴 불확실, 초기화/동역학 민감 균형 개념 일관성 높음, 해 존재성/다중해 이슈
안정성 타깃/클리핑/롤백으로 훈련 안정 순환적 동역학(락페이퍼시저) 발생 가능 수치 안정성 도전, 정밀도/조건수 이슈
운영 편의 분산 실행 용이, 경량화 쉬움 상대 변화에 재학습 필요, 모니터링 부담 오프라인 분석 중심, 온라인 적응성 낮음

배포 전에 고정해야 할 운영 기준

문제 정식화 단계에서는 상태, 관측, 행동, 보상, 동시성을 정의하고 시뮬레이터를 검증한다. 로그 스키마와 재현성을 위한 seed·버전, 리스크 시나리오도 함께 준비한다.

협력 또는 비협력 문제인지 판단한 뒤 CTDE, 가치 분해, 상대 모델링의 적용 여부를 정한다. 분산 롤아웃, 리플레이, 학습기 스케줄링과 정책 버전 관리도 이 선택에 맞춰 구성한다.

검증에서는 평균 리턴, 분산, 익스플로이터빌리티, KL을 수렴·안정 기준으로 모니터링한다. 배포는 섀도우와 캔리 방식으로 점진 진행하고, 안전 제약·롤백·오류 예산을 정의한다.

협업 작업에서는 처리량이 +1540% 향상되고 평균 대기시간 또는 충돌률이 3070% 감소할 수 있다(시뮬레이션 기준, 환경 의존). CTDE+가치 분해를 도입하면 수렴 에피소드 수는 3060% 감소하고 리워드 분산은 2035% 감소한다. 비협력 환경에서는 α-Rank/BR 기준 익스플로이터빌리티 지표가 2050% 개선되며, 균형 기반 정책의 예측 가능성이 높아진다. 파라미터 공유와 경량화는 추론 지연을 1030% 단축하고, 에이전트 수 증가 시 선형~준선형 스케일링을 달성한다.

협력 MARL은 팀 목표 최적화와 확장성에 강점이 있고, 비협력 학습은 전략적 상호작용 대응에 적합하다. 균형 계산은 정책 검증과 안정성 측정 기준을 제공한다. CTDE 기반 구조에 가치 분해·상대 모델링·익스플로이터빌리티와 α-Rank 검증을 결합하고, 분산 샘플링·정책 버전 고정·발산 롤백·점진 배포를 갖추는 방식이 안정적 운영의 기반이 된다.

멀티에이전트강화학습게임 이론CTDE균형 계산