paper2code — 논문 URL 하나로 PyTorch 리포지토리를 뽑아내다

arXiv 논문을 PyTorch 구현 코드로 자동 변환하는 멀티에이전트 프레임워크 PaperCoder의 계획-분석-생성 파이프라인과 에이전트 역할 분담, 인간 평가·실행 가능성 벤치마크를 정리한다.

2026-08-14 · 최초 발행 2026-04-11

머신러닝 연구의 빠른 성장에도 불구하고 논문에 대응하는 코드 구현은 종종 부재하거나 불완전하다. 연구자가 논문을 읽고 직접 코드를 재현하는 과정은 수일에서 수주가 소요되며, 재현 실패율도 높다. paper2code(PaperCoder)는 arXiv 논문 URL을 입력하면 멀티에이전트 LLM 파이프라인을 통해 PyTorch 구현 코드 리포지토리를 자동으로 생성하는 프레임워크다. 인간 평가에서 88%가 베이스라인 대비 최고 품질로 평가받았다.

논문과 코드 사이, 수 주가 걸리던 간극

머신러닝 분야에서 논문과 코드 사이의 격차는 오랜 문제다. 최신 연구를 재현하려면 논문의 수학적 기술을 코드로 변환하는 숙련된 엔지니어링 능력이 필요하다. 상당수의 ML 논문이 공식 구현 코드를 제공하지 않는 코드 부재, 논문의 기술만으로는 세부 구현 결정 사항을 파악하기 어려운 재현성 위기, 숙련된 연구자도 하나의 논문 재현에 수일~수주가 걸리는 시간 비용, 하이퍼파라미터·데이터 전처리 등 논문에 명시되지 않는 암묵적 지식이 겹쳐 있다.

이 문제를 해결하기 위해 다양한 자동화 시도가 있었으나, 단일 LLM에 논문 전체를 입력하고 코드를 생성하는 단순 접근은 복잡한 시스템의 구조적 일관성을 유지하기 어려웠다.

계획하고, 분석하고, 생성한다

PaperCoder는 계획(Planning), 분석(Analysis), 생성(Generation)의 파이프라인으로 구성된다. 각 단계에 특화된 에이전트들이 협업해 논문에서 동작 가능한 코드 리포지토리를 구축한다.

arXiv 논문 URL 입력(1) Planning 단계고수준 로드맵 구성시스템 아키텍처 다이어그램설계파일 의존성 식별설정 파일 생성(2) Analysis 단계구현 세부 사항 해석수학 공식 코드 매핑하이퍼파라미터 추출(3) Generation 단계모듈별 의존성 인식 코드 생성테스트 코드 생성README 문서 생성완성된 PyTorch 리포지토리
단계 주요 에이전트 산출물
Planning 아키텍트 에이전트, 의존성 분석 에이전트 시스템 설계도, 파일 구조, 설정 파일
Analysis 수학 해석 에이전트, 구현 분석 에이전트 구현 명세, 하이퍼파라미터, 코드 매핑
Generation 코드 생성 에이전트, 검증 에이전트 PyTorch 모듈, 학습 스크립트, 테스트 코드

역할을 나눠 이어받는 에이전트들

PaperCoder의 핵심 설계 원리는 단일 LLM이 아닌 복수의 특화 에이전트가 파이프라인 단계별로 협업하는 구조다. 각 에이전트는 명확한 역할과 입출력 인터페이스를 가지며, 이전 단계의 산출물을 입력으로 받아 다음 단계의 에이전트에게 전달한다. 논문의 전체 구조를 파악하고 시스템 아키텍처 다이어그램을 생성하는 아키텍트 에이전트, 파일 간 의존 관계를 식별해 생성 순서를 정하는 의존성 분석 에이전트, 논문의 수식을 PyTorch 연산으로 매핑하는 수학 해석 에이전트, 의존성 순서에 따라 모듈별 코드를 생성하는 코드 생성 에이전트, 생성된 코드의 구문 오류와 일관성을 검사하는 검증 에이전트가 각자의 역할을 맡는다.

이 멀티에이전트 구조 덕분에 PaperCoder는 o3-mini-high와 Claude 3.5 Sonnet 등 서로 다른 LLM 백본에서도 일관된 성능을 달성한다.

논문 저자가 직접 매긴 점수

PaperCoder는 NeurIPS, ICML, ICLR 등 최상위 ML 학회에 채택된 2024년 논문들을 대상으로 평가됐다. Paper2Code 벤치마크에서 베이스라인 대비 압도적인 성능을 보였다.

Paper2Code 벤치마크모델 기반 평가인간 평가(논문 저자)복제 점수 최고치 달성88% 최고 품질 평가92% 유용성 확인실행 가능성 평가0.81% 라인만 수정 필요

o3-mini-high와 Claude 3.5 Sonnet 두 LLM 모두에서 최고 복제 점수를 달성했고, 논문 저자가 직접 평가한 결과 88%가 베이스라인 대비 최고 품질로 선정됐으며 92%의 인간 평가자가 생성된 리포지토리가 실제로 유용하다고 응답했다. 생성된 코드의 99.19%가 수정 없이 실행 가능했고 0.81%만 사소한 수정이 필요했으며, 코드 생성 벤치마크인 PaperBench Code-Dev에서도 기존 베이스라인을 대폭 상회했다.

논문을 코드로 옮기는 실제 쓰임새

paper2code의 실제 활용 워크플로우는 간단하다. arXiv 논문 URL을 입력하면 자동으로 논문을 파싱하고, 파이프라인을 거쳐 완성된 PyTorch 리포지토리를 출력한다. 관심 논문의 구현 코드를 빠르게 확보해 실험을 재현하는 연구 재현, 새로운 연구의 비교 대상으로 기존 논문의 코드 구현을 활용하는 베이스라인 구축, 논문의 이론적 내용이 어떻게 코드로 변환되는지 배우는 학습 도구, 논문의 아이디어를 빠르게 코드로 전환해 타당성을 검증하는 프로토타이핑, 기존 구현과 자동 생성된 구현을 비교해 누락된 부분을 찾는 코드 리뷰가 활용 시나리오로 꼽힌다.

GitHub에서 여러 구현체가 공개돼 있으며, arXiv 논문 2504.17192로 학술적 세부 사항을 확인할 수 있다. 2026년 2월 v5까지 업데이트되며 지속적으로 개선되고 있다.

아직 손이 필요한 부분

paper2code는 강력한 성능에도 불구하고 몇 가지 한계를 갖는다. 분산 학습, 커스텀 CUDA 커널 등 고도로 전문화된 구현은 완전 자동화가 어려운 복잡한 시스템, 논문에서 사용한 데이터셋의 전처리 파이프라인까지 완전 재현은 제한적인 데이터 의존성, 논문에 기술되지 않은 엔지니어링 트릭은 생성 코드에 반영할 수 없는 암묵적 지식, 대형 논문의 경우 멀티에이전트 파이프라인 실행에 상당한 API 비용이 소요되는 LLM 비용이 남은 과제다.

paper2code(PaperCoder)는 arXiv 논문에서 PyTorch 구현 코드를 자동 생성하는 멀티에이전트 LLM 프레임워크다. 계획-분석-생성 파이프라인으로 구조적 일관성을 확보하며, 인간 평가에서 88%가 최고 품질로 선정되고 99.19%의 코드가 즉시 실행 가능하다. 논문과 코드 사이의 격차를 줄이는 실질적 도구로서 ML 연구의 재현성 향상에 기여하고 있다.

Sources

paper2codePaperCoder멀티에이전트arXiv코드 자동 생성