RTS 게임으로 LLM을 겨루게 했더니: 1대1 벤치마크가 드러낸 순위
microRTS 기반 1대1 LLM 벤치마크의 평가 설계와 2026년 3월 기준 ELO 순위, 모델별 강점, 흥미로운 발견을 조건 그대로 정리한다.
2026-08-14 · 최초 발행 2026-03-24
1대1 실시간 전략(RTS) 게임을 LLM 평가 도구로 활용하는 새로운 벤치마크 연구가 기존 언어 모델 평가 방식의 한계를 돌파하는 접근으로 연구자들의 관심을 끌고 있다. MMLU, HumanEval 같은 정적 지식 테스트가 실제 에이전트 지능을 제대로 측정하지 못한다는 비판이 높아지는 가운데, 자원 관리, 전략 수립, 실시간 적응이 동시에 요구되는 RTS 게임이 LLM의 다차원적 지능을 측정하는 새로운 경기장으로 부상하고 있다. 게임이라는 경쟁 환경은 절대적 점수가 아닌 상대적 강함을 자연스럽게 드러내며, 훈련 데이터 암기가 아닌 실시간 추론 능력을 평가하는 특성을 갖는다.
체스·바둑 다음은 RTS다
인공지능 연구에서 게임은 오랫동안 중요한 평가 환경이었다. 체스 프로그램 딥블루, 바둑 AI 알파고, Atari 게임을 정복한 DQN에 이르기까지, 게임은 AI 시스템의 능력을 측정하고 비교하는 경기장 역할을 해왔다. LLM 시대에 게임 기반 평가가 다시 주목받는 이유는, 현재의 주류 벤치마크들이 LLM의 실제 에이전트 능력과 추론 깊이를 제대로 측정하지 못한다는 광범위한 불만이 쌓이고 있기 때문이다.
RTS(Real-Time Strategy) 게임을 선택한 연구팀의 논리는 명확하다. 체스나 바둑과 달리 RTS는 완전 정보 게임이 아니며, 자원 수집, 병력 생산, 기지 방어, 적 공격을 동시에 관리해야 하는 멀티태스킹 환경이다. 또한 게임 상태가 연속적으로 변화하므로 한 번의 올바른 판단이 아니라 지속적이고 일관된 전략적 사고가 요구된다.
MMLU가 놓치는 것: 정적 지식과 데이터 오염
MMLU(Massive Multitask Language Understanding)는 57개 학문 분야의 객관식 문제로 LLM의 지식 폭을 측정한다. GSM8K는 수학 문제 풀이 능력을, HumanEval은 코드 생성 능력을 평가한다. 이러한 벤치마크들은 특정 능력을 측정하는 데는 유용하지만, 복합적인 에이전트 상황에서의 판단력을 측정하기 어렵다. 현실 세계의 복잡한 태스크는 단일 도메인 지식이 아니라 여러 능력의 통합을 요구하는데, 전략 수립·자원 배분·상황 적응·장기 계획이 동시에 작동해야 하는 상황에서의 성능은 현재의 분리된 벤치마크들로 포착하기 어렵다.
LLM의 훈련 데이터에 벤치마크 문제의 답이 포함되는 "데이터 오염" 문제도 갈수록 심각해지고 있다. 새로운 벤치마크가 발표되면 수개월 내에 훈련 데이터로 흡수되어 평가 효용이 급감한다. RTS 게임 대전은 이 문제에서 자유롭다. 게임의 구체적인 진행 상황은 매 대전마다 달라지며, 적의 전략에 대한 응수는 암기가 아닌 실시간 추론으로 결정된다. 어떤 LLM도 특정 게임의 특정 시점 최적 병력 배치를 훈련 데이터에서 찾을 수 없다.
RTS가 측정하는 건 지식이 아니라 판단이다
자원 수집 효율을 극대화하면서 필요한 유닛과 건물에 자원을 배분하는 경제 최적화 의사결정은 복잡한 수치 최적화를 요구한다. 어떤 기술 트리를 선택하고 언제 공격으로 전환하며 어떤 유닛 조합을 구성할지는 수십 단계 앞을 내다보는 장기 전략 계획 능력을 필요로 한다. 안개 전쟁(fog of war) 환경에서 제한된 정보로 적의 전략을 추론하고 대비하는 불완전 정보 추론은 현실 세계의 의사결정과 유사한 인지 구조를 가지며, 적이 예상치 못한 전략을 구사할 때 즉각적으로 계획을 수정하는 실시간 적응은 단순한 지식 적용이 아닌 동적 추론을 측정한다.
단독 플레이(AI vs. 고정 룰 봇)가 아닌 LLM 간 1대1 대결 방식은 추가적인 장점을 제공한다. 절대적 성능 기준이 아닌 상대적 강함을 ELO 레이팅으로 자연스럽게 표현할 수 있고, 최신 모델들을 토너먼트 형식으로 대결시키면 순위가 자동으로 결정된다. 강한 상대를 만났을 때 어떻게 대처하는지, 약한 상대에게는 어느 정도 여유를 갖는지 같은 상대 적응 능력도 측정할 수 있다.
어떤 환경에서 어떻게 겨뤘나
연구팀은 오픈소스 RTS 게임 엔진을 기반으로 평가 환경을 구성했다. 상업용 게임(StarCraft II 등)은 API 제약과 라이선스 문제가 있어, OpenRTS와 microRTS를 평가 플랫폼으로 선택했다. 평가 환경의 복잡도는 의도적으로 조절되었다. 풀 스케일 RTS보다 단순화된 "마이크로 RTS" 환경을 기본으로 사용해 실행 시간을 단축하면서도 핵심 전략적 요소는 보존했다. 각 게임은 제한된 자원, 3-5종의 유닛 타입, 소규모 맵으로 구성된다. LLM은 텍스트 기반 인터페이스로 게임 상태를 받고 행동을 출력한다. 화면 이미지를 직접 처리하는 비전 모달보다 텍스트 직렬화된 게임 상태를 제공해, 시각 처리 능력이 아닌 순수한 추론과 전략 수립 능력을 측정하는 데 집중했다.
LLM에게 제공되는 게임 상태 텍스트는 현재 자원량과 수집 속도, 아군 유닛 목록(위치·체력·상태), 시야 내 적 유닛 정보, 아군 건물 현황, 진행 중인 생산 및 연구 목록, 최근 10턴의 행동 히스토리를 포함한다. LLM은 JSON 형식으로 행동을 출력하며, 행동 파서가 유효성을 검증한 후 게임 엔진에 전달한다. 잘못된 JSON이나 불가능한 행동을 출력하면 해당 턴을 건너뛰는 방식으로 처리한다.
무엇을 어떻게 채점했나
단순 승률 외에 다음의 세부 지표를 측정한다.
| 지표 | 설명 | 측정 방법 |
|---|---|---|
| 경제 효율 지수 | 자원 낭비 없이 최적 배분하는 능력 | 매 턴 유휴 자원량 평균 |
| 전략 일관성 | 초반 계획을 끝까지 유지하는 능력 | 빌드 오더 완성률 |
| 전술 대응 속도 | 위협 발생 후 대응까지 걸리는 턴 수 | 적 공격 감지~대응 행동 간격 |
| 탐색 효율 | 안개 속 정보 수집의 전략성 | 정찰 유닛 커버리지 / 시간 |
| 결정 지연 | 행동 출력까지 LLM 추론 시간 | API 응답 지연 측정 |
순위를 갈라놓은 숫자들
1,000게임 이상의 토너먼트를 통해 도출된 ELO 레이팅 기준 순위다 (2026년 3월 기준 공개 데이터).
| 순위 | 모델 | ELO | 승률 | 특징 |
|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | 1847 | 68.3% | 장기 전략 계획 최강 |
| 2 | GPT-4o | 1821 | 64.9% | 균형 잡힌 전반 능력 |
| 3 | Gemini 1.5 Pro | 1798 | 62.1% | 자원 관리 특화 |
| 4 | Claude 3 Haiku | 1712 | 55.7% | 빠른 결정, 중간 품질 |
| 5 | GPT-4o-mini | 1689 | 53.4% | 비용 효율적 중위권 |
| 6 | Gemini Flash | 1654 | 49.8% | 속도 우선, 전략 다소 부족 |
| 7 | Llama 3.1 70B | 1621 | 46.2% | 오픈소스 최강, 상업 모델 근접 |
| 8 | Mistral Large | 1598 | 43.8% | 전술 대응 취약 |
능력별로 쪼개보면 다른 그림이 나온다
Gemini 1.5 Pro가 자원 낭비 지표에서 1위를 기록했다. 초반 경제 구축 단계에서 자원을 가장 효율적으로 배분하는 패턴을 보인다. Claude 3.5 Sonnet은 40턴 이상 장기 게임에서 압도적 승률을 보였는데, 초반에 선택한 전략을 일관되게 유지하면서 상황에 맞게 조율하는 능력이 뛰어난 것으로 분석된다. GPT-4o는 적의 급습에 가장 빠르게 대응해, 위협 감지 후 평균 2.3턴 만에 방어 행동을 시작하며 3위인 Gemini(3.1턴)보다 유의미하게 빠른 반응을 보였다. Llama 3.1 70B가 상업 모델과의 격차를 크게 좁힌 것도 주목할 만한 결과로, 특히 경제 관리 지표에서 GPT-4o-mini를 근소하게 앞섰다.
예상 밖의 발견들
단순히 모델이 클수록 RTS 게임을 잘하는 것은 아니었다. Gemini Flash는 Gemini 1.5 Pro보다 훨씬 작지만, 빠른 결정 속도가 일부 상황에서 오히려 유리하게 작용했다. 특히 빠른 러시 전략에 대응하는 상황에서 Flash의 낮은 지연 시간이 유효한 이점이 되었다. 동일한 모델도 시스템 프롬프트 구성에 따라 승률이 최대 15%포인트 이상 차이났다 — "공격적으로 플레이하라"는 지시와 "경제를 먼저 키워라"는 지시 중 어느 것이 더 효과적인지가 모델마다 달랐다. MMLU 점수와 RTS 게임 승률의 상관관계는 예상보다 낮았는데, 이는 언어 이해 능력이 높다고 전략적 판단 능력이 높은 것은 아니며 두 능력이 어느 정도 독립적임을 시사한다. 동일한 상대와 연속 대전 시 일부 모델에서 적응 패턴도 관찰됐다. Claude 계열 모델이 특히 이전 대전에서의 패배 원인을 파악하고 전략을 수정하는 경향이 두드러졌다.
아직 못 채운 빈틈
복잡한 공간 정보를 텍스트로 변환하는 과정에서 정보가 손실된다. 지도 전체의 지형, 유닛 이동 경로의 세부사항 등은 텍스트로 완전히 표현하기 어렵다. RTS 게임 능력이 얼마나 일반적인 에이전트 지능을 반영하는지, 아니면 게임 특화 능력을 측정하는지에 대한 검증도 더 필요하다. 1,000게임 토너먼트는 상당한 API 비용을 요구해, 벤치마크의 지속적 운영을 위한 비용 효율화도 과제로 남아 있다. 연구팀은 다음 단계로 멀티플레이어 협력 게임(팀 기반 RTS)과 비대칭 정보 게임(외교 게임)으로 평가 환경을 확장하는 계획을 발표했다.
1대1 RTS 게임 기반 LLM 벤치마크는 기존 정적 지식 평가의 한계를 실시간 전략 대결로 보완하는 창의적 접근으로, 복합적 추론 능력과 장기 계획 수립 능력을 동시에 측정하는 새로운 가능성을 보여준다. 게임이라는 경쟁 환경은 암기가 아닌 추론으로만 이길 수 있어, AI 지능 측정의 신뢰성 위기를 극복하는 방향성으로서 더 많은 연구가 이어질 것으로 전망된다.