AlphaEvolve: LLM이 변이 연산자가 되어 알고리즘을 발견하는 진화적 코드 최적화

Google DeepMind의 AlphaEvolve가 Gemini LLM과 진화적 알고리즘을 결합해 코드를 자동 최적화하는 아키텍처, 적합도 함수 설계 원칙, MAP-Elites 다양성 유지, 행렬 곱셈·데이터센터 실적을 정리한다

2026-08-14 · 최초 발행 2026-05-11

Google DeepMind가 2025년 공개한 AlphaEvolve는 Gemini 기반의 대형 언어 모델(LLM)과 진화적 알고리즘을 결합하여 알고리즘과 코드를 자동으로 발견하고 최적화하는 에이전트이다. 행렬 곱셈 알고리즘에서 56년 만의 기록을 경신하고, Google 데이터센터 효율을 개선하는 등 실질적 성과를 입증하면서 AI 기반 자동 프로그래밍 연구의 새로운 기준점으로 주목받고 있다.

LLM이 창의성을, 진화 알고리즘이 방향을 정한다

AlphaEvolve는 Google DeepMind가 개발한 코딩 에이전트로, LLM의 창의적 코드 생성 능력과 진화적 알고리즘의 반복적 탐색·선택 메커니즘을 결합한 시스템이다. 기존의 수동 알고리즘 설계나 단순 LLM 프롬프팅 방식과 달리, AlphaEvolve는 수천 개의 코드 후보를 병렬로 생성·평가·개선하는 자동화 파이프라인을 구성한다. 이 시스템의 핵심 철학은 "LLM이 창의성을 제공하고, 진화 알고리즘이 방향을 결정한다"는 분업 구조다. LLM은 기존 코드를 변형하거나 새로운 아이디어를 제안하는 변이 연산자(mutation operator)로 작동하며, 자동화된 평가기(evaluator)가 각 제안의 품질을 수치화하여 진화의 선택압(selection pressure)을 제공한다. Gemini Flash 모델은 넓은 탐색 공간을 빠르게 커버하는 브레드스-퍼스트 역할을 맡고, Gemini Pro 모델은 유망한 해법을 깊이 있게 개선하는 뎁스-퍼스트 역할을 담당한다. 두 모델의 앙상블 활용이 탐색(exploration)과 활용(exploitation) 사이의 균형을 자동으로 조율한다.

프롬프트 샘플러부터 시스템 컨트롤러까지, 맞물려 돌아가는 컴포넌트

AlphaEvolve의 아키텍처는 네 가지 핵심 컴포넌트로 구성된다. 프로그램 데이터베이스에서 고성능 부모 프로그램을 선택하고, 이를 컨텍스트로 포함한 풍부한 프롬프트를 LLM에 전달하는 프롬프트 샘플러는 단순히 최고 성능 프로그램만 선택하지 않고 다양한 성능 수준의 프로그램을 샘플링해 다양성을 유지한다. MAP-Elites 알고리즘과 섬 기반 개체군 모델(island-based population model)을 활용해 솔루션 다양성을 보존하는 프로그램 데이터베이스는 사용자 정의 다차원 특징 그리드(feature grid)에 가장 높은 적합도의 개체를 유지해 성능과 다양성을 동시에 확보한다. 각 제안된 프로그램을 실제로 실행하고 자동화된 평가 지표로 품질을 수치화하는 평가기는 정확성과 효율성을 모두 측정하며 스칼라 점수로 반환해 선택 알고리즘에 입력한다. 모든 컴포넌트 간의 상호작용을 비동기 파이프라인으로 조율해 처리량(throughput)을 최대화하는 시스템 컨트롤러는 주어진 컴퓨트 예산 내에서 가능한 많은 후보 솔루션을 평가할 수 있도록 설계되었다.

개선됨미개선사용자 제공 컨텍스트(문제 정의 + 초기 코드)프롬프트 샘플러프로그램 데이터베이스(MAP-Elites)부모 프로그램 선택(다양성 보존 샘플링)LLM 앙상블(Gemini Flash + Pro)코드 변이 제안(변이 + 교차 연산)평가기(실행 + 적합도 측정)개선 여부 판단폐기 또는다양성 보존 저장최적 프로그램 출력

전통적인 진화적 알고리즘에서 변이 연산자는 무작위 비트 플리핑이나 단순 치환을 사용한다. AlphaEvolve에서 LLM은 이 역할을 의미론적(semantic) 수준에서 수행한다. LLM은 특정 고성능 부모 프로그램을 기반으로 세밀한 개선을 탐색하는 깊이 활용 연산자(기존 구조를 유지하면서 알고리즘적 상수, 루프 순서, 데이터 구조 선택 등을 미세 조정), 서로 다른 두 고성능 프로그램의 의미론적 특성을 결합하는 영감 기반 교차 연산자(전통적 유전자 교차의 LLM 버전으로 이종 아이디어 간의 창의적 합성을 가능하게 함), 프롬프트 다양성을 동적으로 증폭시켜 해법 공간의 새로운 영역을 탐색하는 메타 프롬프팅 탐색 전략(진화가 지역 최적에 갇힐 때 탈출 경로를 제공)이라는 세 가지 유형의 변이를 수행한다.

적합도 함수는 어떻게 설계돼야 하는가

AlphaEvolve에서 적합도 함수(fitness function)는 진화의 방향을 결정하는 핵심 요소다. 잘못 설계된 적합도 함수는 에이전트를 엉뚱한 방향으로 이끌 수 있기 때문에, 설계 시 다음 원칙을 준수한다. 적합도는 반드시 스칼라 점수로 수치화되어야 한다는 정량화 가능성 원칙에 따라 AlphaEvolve는 각 프로그램을 실제 실행하고 출력값과 기대값 간의 차이를 수치로 측정하며, 테스트 케이스 실패 수·실행 시간·메모리 사용량 등 다중 지표를 가중합으로 결합하는 방식도 쓴다. 인간의 개입 없이 자동으로 측정할 수 있어야 한다는 자동화 가능성 원칙에 따라 수학 문제는 답의 정확성을 검증 프로그램이 확인하고 알고리즘 최적화는 실행 성능을 직접 측정한다. 더 나은 솔루션이 반드시 더 높은 적합도 점수를 받아야 한다는 단조성(Monotonicity) 원칙이 위반되면 진화 방향이 역전된다.

AlphaEvolve 벤치마크 도메인수학 (50+ 개방 문제)알고리즘 최적화인프라 효율화조합론 · 정수론기하학 · 분석학행렬 곱셈 알고리즘양자 회로 최적화데이터센터 관리AI 학습 커널

AlphaEvolve는 50개 이상의 개방된 수학 문제에 적용되었으며, 약 75%에서 최신 최고 성능 솔루션을 재발견하고, 20%에서 기존 최고 솔루션을 개선하는 결과를 달성했다. 대부분의 실험 설정이 수 시간 내에 완료될 수 있어 실용성도 입증되었다. 성능 지표 설계 시 고려할 핵심 요소는 다음과 같다.

지표 유형 측정 방법 적용 도메인
정확성 지표 테스트 케이스 통과율, 수학적 검증 알고리즘 발견
효율성 지표 연산 횟수, 실행 시간, 메모리 코드 최적화
다양성 지표 개체군 내 유전적 다양성 탐색 단계
안정성 지표 분산, 최악 케이스 성능 프로덕션 적용

LLM 기반 진화 시스템의 재현성 확보는 고유한 도전이다. LLM의 확률적 출력과 진화의 무작위성이 중첩되기 때문이다. AlphaEvolve는 각 세대의 부모 선택, LLM 프롬프트, 생성된 코드, 평가 점수를 모두 기록해 사후 분석을 가능하게 하는 비결정적 과정의 문서화, 동일한 랜덤 시드로 여러 독립 실행을 수행하고 결과의 분포를 보고하는 시드 고정과 독립 실행 반복(단일 최고 결과만이 아닌 통계적 요약이 재현성의 근거가 됨), 평가 함수가 LLM과 완전히 분리돼 동일한 프로그램은 항상 동일한 점수를 받도록 보장하는 평가기 독립성이라는 전략을 채택한다.

원시 코드를 직접 다루는 진화, 그리고 다양성 보존

AlphaEvolve에서 프로그램은 원시 소스 코드(raw source code) 형태로 표현된다. 이는 AST(Abstract Syntax Tree) 기반 표현이나 바이트코드 표현과 비교할 때, LLM이 직접 이해하고 조작할 수 있다는 장점을 제공한다. 개체군 구조는 두 가지 모델을 결합한다. 여러 독립적인 개체군(섬)이 병렬로 진화하다가 주기적으로 개체를 교환해 각 섬이 서로 다른 해법 공간을 탐색함으로써 전역적 다양성을 유지하는 섬 기반 모델(Island-based Model), 사용자 정의 특징 공간을 격자로 나누고 각 셀에서 최고 성능 개체를 유지하는 MAP-Elites 격자(MAP-Elites Grid, 예를 들어 행렬 곱셈 문제에서는 연산 수와 수치 안정성을 축으로 하는 2D 격자를 구성)다.

개선미개선초기 개체군 생성(LLM 기반 초기화)MAP-Elites 격자에 삽입 기반 병렬 진화LLM 변이 연산평가기 실행격자 개선 여부격자 업데이트폐기주기적 이주(migration)

MAP-Elites는 AlphaEvolve의 핵심 다양성 보존 메커니즘이다. 단순히 최고 성능 개체만 유지하는 엘리티즘(elitism)과 달리, 솔루션 공간의 다양한 영역에서 각각의 최고 개체를 보존한다. 이 접근법의 장점은 성능은 낮지만 특이한 구조를 가진 프로그램이 보존되어 미래 교차 연산의 재료가 되는 지역 최적 탈출, 특징 공간의 미탐색 영역을 식별하고 탐색을 유도하는 체계적 탐색, 여러 목표(속도, 정확성, 메모리)를 동시에 최적화하는 파레토 프론트(Pareto front)를 자연스럽게 구성하는 다목적 최적화다.

AlphaEvolve에서 목적 함수(objective function)는 최적화 대상 문제의 본질을 수치로 포착해야 한다. 복잡한 목표를 측정 가능한 하위 목표로 분해하는 분해 가능성(Decomposability, 예를 들어 "행렬 곱셈 알고리즘 최적화"는 "스칼라 곱셈 횟수 최소화"와 "수치적 정확성 보장"으로 분해), 경사 정보 없이도 동작해 불연속적이거나 계산 비용이 높은 평가 함수에도 적용 가능한 미분 불필요성(Gradient-free), 빠른 근사 평가로 1차 필터링하고 느리지만 정확한 평가로 최종 확인하는 계층적 평가 전략으로 컴퓨트 효율을 높이는 다중 수준 평가(Multi-level Evaluation)가 잘 설계된 목적 함수의 특성이다.

56년 만에 깨진 기록과 실제 인프라 개선

AlphaEvolve는 이론적 프레임워크에 그치지 않고 실질적인 성과를 입증하였다. 4×4 복소수 행렬 곱셈을 48번의 스칼라 곱셈으로 수행하는 알고리즘을 발견해, 1969년 Strassen 알고리즘이 세운 49회 기록을 56년 만에 경신한 행렬 곱셈 돌파구는 AlphaEvolve의 탐색 능력이 인간 전문가 수준의 수학적 창의성에 도달할 수 있음을 시사한다. Borg 데이터센터 관리 시스템을 개선해 Google 전 세계 컴퓨트 자원의 0.7%를 회복하고, Gemini 학습 아키텍처의 핵심 커널 속도를 23% 향상시켜 전체 학습 시간을 1% 단축한 Google 인프라 최적화도 있다. Google의 Willow 양자 프로세서에서 복잡한 분자 시뮬레이션이 가능하도록 양자 회로를 최적화하며, 기존 방식 대비 오류율을 10배 낮추는 데 성공한 양자 컴퓨팅 응용도 이뤄냈다. 이러한 성과는 AlphaEvolve의 일반성(generality)을 보여준다. 동일한 아키텍처가 수학적 발견, 시스템 최적화, 물리 시뮬레이션 등 완전히 다른 도메인에 적용 가능하다.

AlphaEvolve는 LLM의 창의적 코드 생성 능력과 진화적 알고리즘의 체계적 탐색·선택 메커니즘을 결합하여, 인간 전문가 수준의 알고리즘 발견을 자동화하는 새로운 패러다임을 제시한다. MAP-Elites 기반 다양성 유지, 비동기 병렬 평가 파이프라인, 다수준 목적 함수 설계 등의 아키텍처 패턴은 향후 자동 프로그램 합성 연구의 표준 참조점이 될 것으로 전망된다. AlphaEvolve가 공개 오픈소스 구현체(OpenEvolve 등)를 통해 학계와 산업계 전반으로 확산됨에 따라, LLM 기반 진화적 최적화는 소프트웨어 엔지니어링과 과학 연구의 핵심 도구로 자리잡을 가능성이 높다.

Sources

AlphaEvolve진화적알고리즘코드최적화에이전트MAP-Elites프로그램합성