AlphaEvolve: 진화 알고리즘과 LLM이 만든 수학 발견 자동화 엔진
Google DeepMind의 Gemini 기반 코딩 에이전트 AlphaEvolve의 진화 루프 아키텍처와 수학 오픈 문제 성과, Borg 스케줄러 0.7% 자원 회수 사례를 정리한다
2026-08-14 · 최초 발행 2026-04-22
Google DeepMind가 2025년 5월 공개한 AlphaEvolve는 Gemini 기반 코딩 에이전트로, 진화 알고리즘과 대형 언어 모델을 결합하여 새로운 수학 구조를 발견하고 구글의 전 세계 컴퓨팅 자원을 자율적으로 최적화하는 시스템이다. 수십 년 동안 인간 수학자들이 풀지 못했던 오픈 문제들을 코드 탐색 방식으로 해결하는 동시에, 1년 이상 프로덕션 배포를 통해 구글 전 세계 자원의 0.7%를 지속적으로 회수하는 실질적 성과를 거뒀다.
코드 자체를 진화시키는 에이전트
AlphaEvolve는 단순한 코드 생성 AI가 아니다. 알고리즘 자체를 진화시키는 에이전트다. 핵심 아이디어는 간단하다. LLM이 코드를 제안하고, 자동화된 평가기(evaluator)가 그 코드를 실행하여 점수를 매기고, 진화 알고리즘이 좋은 코드를 선택하여 다음 세대의 제안을 위한 컨텍스트로 활용한다. 이 루프를 수천 세대에 걸쳐 반복하면, 인간이 설계하지 못했던 알고리즘이 자연스럽게 출현한다.
AlphaScientist, AlphaCode, AlphaProof 등 DeepMind의 이전 시스템들이 각각 단일 도메인에 집중했다면, AlphaEvolve는 임의의 코드를 진화 단위로 삼아 범용 알고리즘 발견 프레임워크를 지향한다. 수학 문제, 데이터센터 스케줄링, 하드웨어 회로 최적화, LLM 학습 속도 개선까지 단일 아키텍처로 처리한다는 점이 이 시스템의 가장 중요한 특징이다.
부모 프로그램을 골라 다음 세대를 만드는 방식
AlphaEvolve의 작동 방식은 세 가지 핵심 컴포넌트의 긴밀한 협력으로 이뤄진다.
프로그램 데이터베이스는 AlphaEvolve의 진화적 다양성을 유지하는 핵심 메커니즘이다. 단순히 점수 순으로 상위 프로그램만 유지하면 조기 수렴(premature convergence) 문제가 발생한다. AlphaEvolve는 MAP-Elites 스타일의 섬 모델(island model)을 채택하여 품질 지표와 행동 특성에 따라 후보 프로그램들을 분류하고, 다양한 특성 영역에서 최선의 프로그램을 동시에 유지한다. 데이터베이스에서 품질 가중치 기반으로 부모 프로그램을 샘플링하고, 이 부모들과 풍부한 컨텍스트 정보를 LLM에게 전달하면 LLM은 코드 diff 형태로 수정안을 제안한다. 수정된 프로그램은 실행되어 점수를 받고, 성공한 변이체는 데이터베이스에 추가되며, 이 과정이 수천 세대 반복된다.
AlphaEvolve는 단일 LLM이 아닌 두 Gemini 모델의 앙상블을 활용한다. Gemini Flash는 속도가 빠르고 효율적이어서 탐색의 폭(breadth)을 극대화한다. 빠른 사이클로 다양한 아이디어를 대량 생성하는 역할이다. Gemini Pro는 깊이 있는 통찰을 제공하는 강력한 모델로, 탐색의 깊이(depth)를 담당한다. 두 모델이 협력하여 탐색 공간을 넓고 깊게 커버한다.
50개 문제 중 75%는 재발견, 20%는 새 기록
AlphaEvolve가 50개 이상의 수학 오픈 문제에 적용되었을 때, 약 75%의 경우에서 현재 최고 수준의 해답을 재발견했고, 약 20%의 경우에서 기존 최선을 능가하는 새로운 해답을 발견했다. 이 성과는 수학의 여러 분야 — 수학적 분석, 기하학, 조합론, 수론 — 에 걸쳐 나타났다.
가장 주목받는 수학적 성과는 행렬 곱셈 알고리즘 개선이다. 1969년 Volker Strassen이 발표한 알고리즘은 4×4 복소 행렬 곱셈에 49회의 스칼라 곱셈을 사용했는데, 이는 수십 년 동안 최선이었다. AlphaEvolve는 이를 48회로 줄이는 새로운 알고리즘을 발견했다. 단 1회의 차이처럼 보이지만, 이는 대규모 선형대수 연산에서 누적 효과가 크며, 행렬 곱셈 알고리즘의 복잡도 하한을 다시 열어놓는 이론적 의의를 가진다. AlphaEvolve의 접근 방식은 최소한의 코드 스켈레톤을 제공받아 새로운 경사 기반 최적화 절차를 설계하는 것이었다. 인간 수학자가 직관과 경험으로 탐색하는 공간을, AlphaEvolve는 코드 진화로 자동 탐색했다.
키싱 넘버(kissing number) 문제는 주어진 차원에서 단위 구 주변에 배치할 수 있는 서로 겹치지 않는 같은 크기의 구의 최대 개수를 묻는, 300년 된 기하학의 미해결 문제다. AlphaEvolve는 11차원에서 593개의 외부 구 배치 구성을 발견해 새로운 하한을 수립했다. 이전 최선 기록을 경신한 것이다.
AlphaEvolve가 발견한 수학적 결과물은 형식 검증(formal verification) 파이프라인과 통합되어 검증된다. 유한체(finite field) Kakeya 문제의 경우, 다음과 같은 다단계 파이프라인이 작동했다.
AlphaEvolve가 후보 수학적 객체나 추측을 진화적 탐색으로 발견하면, Deep Think가 비형식 증명을 스케치하고, AlphaProof가 이를 Lean 증명 보조기에서 자동 형식화하여 모든 논리적 의존성을 검증한다. 이 파이프라인은 수학적 발견에서 형식 검증까지 전 과정을 자동화하는 새로운 연구 워크플로우를 보여준다.
구글 데이터센터에서 실제로 돌아가는 최적화
수학적 발견보다 더 즉각적인 산업적 임팩트는 Google 내부 컴퓨팅 인프라에 대한 적용이다. AlphaEvolve는 1년 이상 프로덕션 환경에 배포되어 지속적으로 인프라를 최적화하고 있다.
Google의 데이터센터는 Borg라는 태스크 오케스트레이션 시스템으로 관리된다. Borg는 수백만 개의 작업을 수만 대의 서버에 효율적으로 배치해야 하는 조합 최적화 문제를 지속적으로 풀고 있다. 비효율적인 배치는 "자원 단편화(stranded resources)" 문제를 야기한다. 한 서버가 메모리는 소진했지만 CPU는 남아있을 때, 그 서버는 더 이상 작업을 받지 못하고 남은 CPU가 낭비된다. AlphaEvolve는 이 벡터 빈 패킹(vector bin-packing) 문제에 대한 단순하지만 놀랍도록 효과적인 휴리스틱을 발견했다. 이 솔루션은 강화학습으로 발견된 이전 최선 솔루션보다 우수했으며, 평균적으로 구글 전 세계 컴퓨팅 자원의 0.7%를 지속적으로 회수하고 있다.
0.7%라는 수치가 작아 보일 수 있다. 하지만 구글의 규모에서 이는 수억 달러에 달하는 연간 절감 효과를 의미한다. 더 중요한 것은 이 솔루션이 해석 가능(interpretable)하고 단순하다는 점이다. 복잡한 딥러닝 모델 대신 명확한 규칙 기반 휴리스틱으로 표현되어 프로덕션 배포가 용이했다.
AlphaEvolve의 인프라 최적화는 Borg에 그치지 않는다. 구글의 컴퓨팅 스택 전반에 걸쳐 적용됐다. 하드웨어 가속기 회로 설계에서는 기능적으로 동등하지만 더 단순화된 회로 구성을 발견해 칩 설계 단계에서의 효율화로 이어졌다. LLM 학습 가속에서는 AlphaEvolve 자체의 기반이 되는 LLM의 학습 속도를 개선하는 커널을 발견해, AI가 AI 학습을 최적화하는 자기 강화 구조가 형성됐다. FlashAttention 커널 최적화에서는 트랜스포머 모델의 핵심 연산인 어텐션 메커니즘 구현을 최적화해 모델 추론 속도를 개선했다.
평가 함수 하나로 문제를 재정의하다
AlphaEvolve의 핵심 통찰은 알고리즘 발견을 코드 공간 탐색으로 재정의한 것이다. 전통적인 프로그램 합성(program synthesis)은 명세(specification)에서 프로그램을 유도한다. AlphaEvolve는 이와 달리, 평가 함수로 측정 가능한 목표가 있다면 어떤 문제든 진화적 코드 탐색으로 접근할 수 있다고 본다.
두 가지 작동 모드가 있다. 최적 구성을 찾는 휴리스틱 알고리즘을 진화시키는 탐색 모드(search mode), 유한한 사례들에서 패턴을 인식해 모든 입력에 유효한 공식을 발견하는 일반화 모드(generalizer mode)다. 수학적 발견에는 주로 두 번째 모드가 활용된다.
AlphaEvolve의 성능은 평가 함수(evaluator)의 품질에 크게 의존한다. 평가 함수가 목표를 정확하고 빠르게 측정할수록 진화가 올바른 방향으로 진행된다. 이것이 AlphaEvolve가 모든 문제에 즉시 적용 가능한 범용 솔루션이 아닌 이유다. 각 문제 도메인에 적합한 평가 함수를 설계하는 것이 실제 적용의 핵심 과제이며, 이는 도메인 전문 지식을 여전히 필요로 한다. 수학 문제의 경우 알고리즘의 정확성과 효율성이 평가 함수가 되고, 데이터센터 스케줄링의 경우 자원 활용률과 단편화 지표가 평가 함수다. 이처럼 명확하게 측정 가능한 목표가 있는 영역에서 AlphaEvolve는 가장 큰 효과를 발휘한다.
연구와 운영의 경계가 흐려지는 곳
AlphaEvolve는 AI 에이전트가 인프라 관리에 참여하는 새로운 패러다임을 제시한다. 지금까지 인프라 최적화는 인간 엔지니어가 병목 지점을 파악하고, 휴리스틱을 설계하고, 테스트하고, 배포하는 수동 과정이었다. AlphaEvolve는 이 과정을 자동화한다.
특히 주목할 점은 AlphaEvolve가 발견한 솔루션들이 강화학습으로 찾은 솔루션보다 우수하다는 것이다. 강화학습은 복잡한 신경망 정책을 학습하는 반면, AlphaEvolve는 해석 가능한 코드 기반 휴리스틱을 진화시킨다. 프로덕션 환경에서의 신뢰성과 디버깅 용이성 측면에서 이는 중요한 장점이다.
향후 AlphaEvolve의 확장 방향은 두 가지다. Google Cloud를 통한 외부 기업에 대한 서비스화가 그중 하나로, 2025년 말 AlphaEvolve가 Google Cloud 서비스로 진입했다는 보도가 있으며 다양한 산업의 최적화 문제에 적용될 수 있다. 다른 하나는 자기 강화 루프의 심화다. AlphaEvolve가 자신의 기반 LLM 학습을 최적화하는 루프는, AI 시스템이 자신의 성능을 스스로 개선하는 자율 진화 경로를 시사한다.
AlphaEvolve는 진화 알고리즘과 대형 언어 모델의 결합이 단순한 기술적 흥미를 넘어 실질적인 과학적 발견과 산업적 가치를 만들어낼 수 있음을 입증했다. 수십 년 된 수학 오픈 문제를 해결하는 동시에 구글 전 세계 데이터센터의 자원 효율을 높이는 두 가지 성과는, AI 에이전트가 연구와 운영의 경계를 허물고 있음을 보여준다. 평가 가능한 목표가 있는 곳이라면 어디든 AlphaEvolve 방식의 자동화가 적용될 수 있다는 설계 철학은, 알고리즘 발견 자동화의 미래 방향을 분명히 가리키고 있다.
Sources
- AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms — Google DeepMind
- AlphaEvolve: A coding agent for scientific and algorithmic discovery (arXiv)
- AlphaEvolve Paper PDF — Google DeepMind
- Meet AlphaEvolve, the Google AI that writes its own code — VentureBeat
- Google's AlphaEvolve: The AI agent that reclaimed 0.7% of Google's compute — VentureBeat
- DeepMind AlphaEvolve in Production: AI Agent Recovering 0.7% of Google's Global Compute — Tech Bytes
- AI as a research partner: Advancing theoretical computer science with AlphaEvolve — Google Research
- Google DeepMind's new AI agent cracks real-world problems — MIT Technology Review
- AlphaEvolve — Wikipedia
- AlphaEvolve on Google Cloud — Google Cloud Blog