Hermes Agent는 실패를 스칼라 점수가 아니라 문장으로 읽는다
NousResearch Hermes Agent의 자가 진화 루프, GEPA 유전자-파레토 프롬프트 진화 알고리즘, 인간 레이블 없는 자기 지도 학습과 OpenAI RL 접근법 비교
2026-08-14 · 최초 발행 2026-05-17
NousResearch가 2026년 2월 공개한 Hermes Agent는 7주 만에 GitHub 스타 95,600개를 달성하며 2026년 가장 빠르게 성장한 에이전트 프레임워크로 기록되었다. 핵심 차별점은 인간 레이블링 없이 에이전트 자신의 실패 경험을 분석하여 스킬, 프롬프트, 도구 설명을 자동으로 개선하는 자가 진화(Self-Evolution) 메커니즘이다. ICLR 2026 Oral 논문으로 채택된 GEPA(Genetic-Pareto Prompt Evolution) 알고리즘이 이 자가 개선 루프의 핵심 엔진이다.
실패를 스칼라가 아니라 문장으로 읽는다
Hermes Agent Self-Evolution 프레임워크는 에이전트 실행 → 실패 감지 → 원인 분석 → 개선안 생성 → 검증 → 적용의 6단계 루프로 구성된다. 각 루프 반복은 에이전트의 스킬 파일, 시스템 프롬프트, 도구 설명을 점진적으로 개선한다.
실패 분석 루프(Failure Analysis Loop)가 기존 RL 접근법과 결정적으로 다른 점은 스칼라 보상 신호 대신 전체 실행 트레이스를 LLM이 자연어로 읽어 진단한다는 것이다. 에러 메시지, 스택 트레이스, 추론 중간 단계, 도구 호출 결과를 종합하여 "왜 실패했는가"에 대한 인과적 설명을 생성한다.
GEPA(Genetic-Pareto Prompt Evolution Algorithm)는 DSPy와 통합되어 프롬프트와 스킬을 진화시키는 메타옵티마이저다. ICLR 2026 Oral 채택으로 학술적 검증을 완료하였으며, 기존 RL 대비 6~20% 성능 우위를 35배 적은 롤아웃으로 달성한다.
GEPA의 핵심 혁신은 자연어 반성(Natural Language Reflection) 기반 진화다. 유전 알고리즘의 돌연변이 연산자를 LLM이 담당하여, 실패 트레이스를 읽고 어떤 방향으로 프롬프트를 수정해야 하는지 추론한다. 이를 통해 랜덤 돌연변이의 비효율을 제거하고 목표 지향적 개선을 실현한다. 파레토 프론트 선택은 정확도, 효율성, 비용의 다목적 최적화를 수행한다. 단일 목표 최적화가 아닌 복수 품질 축의 균형을 유지하면서 개선안을 선택하므로, 정확도를 높이면서 토큰 비용이 폭증하는 오버피팅을 방지한다.
성공적인 실행 트레이스는 경험 리플레이 버퍼에 저장된다. 후속 개선 시 과거 성공 패턴을 참조하여 퇴행(regression)을 방지한다. 정책 업데이트는 모델 가중치를 변경하지 않고 스킬 파일과 프롬프트 텍스트를 수정하는 방식으로 이루어진다. 이는 가중치 업데이트 없이도 강력한 성능 개선이 가능함을 보여주는 핵심 설계 원칙이다.
MATH 벤치마크 결과는 기본 ChainOfThought 67%에서 GEPA 최적화 후 93%로, 26포인트 향상됐다. 이 향상은 가중치 업데이트 없이 프롬프트 진화만으로 달성되었다.
인간 없이도 성공과 실패를 가르는 법
인간 레이블링이 불필요한 이유는 에이전트 자신이 실행 결과를 통해 성공/실패를 판별할 수 있기 때문이다. Hermes Agent는 세 가지 자기 지도 피드백 소스를 활용한다.
실행 결과 피드백은 코드 실행, 단위 테스트 통과 여부, API 응답 성공/실패로, 인간 개입 없이 명확한 이진 신호를 제공한다. 자가 평가 판별기(Self-Evaluation Discriminator)는 에이전트가 자신의 출력을 별도 판별기 프롬프트로 점수화하는 것으로, 원본 태스크 목표와 실제 결과를 비교하는 구조화된 평가 프롬프트를 사용해 부드러운 품질 신호를 생성한다. 품질 필터링은 자가 평가 점수가 낮거나 판별기가 불확실성을 표현한 트레이스를 GEPA 입력에서 제외하는 것으로, 저품질 피드백이 누적되면 개선 루프가 수렴하지 못하므로 시스템 안정성의 핵심이다.
Hermes Self-Evolution은 별도의 보상 모델을 학습하지 않고, 태스크별 실행 결과를 직접 보상 신호로 활용한다. 이는 범용 보상 모델의 해킹(reward hacking) 위험을 근본적으로 차단한다. 대신 태스크 스키마에 명시된 성공 기준(success criteria)을 프로그래매틱하게 검증하는 방식을 채택한다. 합성 선호 데이터는 동일 태스크에 대해 현재 정책과 개선된 후보 정책의 출력을 비교하는 쌍(pair) 형태로 구성된다. 이 선호 쌍은 향후 DPO(Direct Preference Optimization) 파인튜닝에 재활용할 수 있는 고품질 학습 데이터로서의 가치도 갖는다.
RL과는 다른 길: 35배 적은 롤아웃
2026년 에이전트 학습 패러다임은 크게 두 갈래로 분화됐다. OpenAI의 RL 기반 접근법과 NousResearch의 메타러닝 기반 접근법이다.
| 차원 | Hermes Self-Evolution (GEPA) | OpenAI RL 접근법 |
|---|---|---|
| 학습 신호 | 자연어 실행 트레이스 분석 | 스칼라 보상 함수 |
| 가중치 업데이트 | 없음 (프롬프트/스킬만 수정) | 모델 파인튜닝 필요 |
| 롤아웃 효율 | RL 대비 35배 적은 롤아웃 | 대규모 롤아웃 필요 |
| 성능 향상 | RL 대비 6~20% 우위 | 강력하나 비용 高 |
| 해석 가능성 | 자연어 진단 보고서 생성 | 블랙박스 정책 업데이트 |
| 오픈소스 | MIT 라이선스 | 비공개 |
GEPA의 핵심 장점은 롤아웃 효율이다. 전통적 RL이 수천 번의 환경 상호작용을 통해 정책을 수렴시키는 반면, GEPA는 수십~수백 번의 실행으로 유사한 개선을 달성한다. 실패 이유를 이해하고 목표 지향적 돌연변이를 생성하기 때문이다.
자가 개선 루프는 무제한 실행될 경우 드리프트(drift) 또는 오버피팅 위험이 있다. Hermes Self-Evolution은 몇 가지 안전 메커니즘을 내장한다. 개선 한계 임계값은 연속 N회 루프에서 성능 향상이 임계값 이하인 경우 자동으로 중단해, 수렴 조건을 명시적으로 정의하여 무한 루프를 방지한다. 회귀 방지 테스트는 새 정책을 적용하기 전 기존 벤치마크 태스크 셋에서 성능 저하가 없는지 자동 검증하며, 파레토 프론트 선택이 여기서도 작동해 새 태스크 성능 향상과 기존 태스크 유지를 동시에 요구한다. 변경 범위 제한은 단일 개선 루프에서 수정 가능한 스킬과 프롬프트의 범위에 상한을 두어, 급격한 전략 변화보다 점진적 개선을 강제하고 예측 가능성을 유지한다.
Hermes Self-Evolution이 효과적인 도메인은 검증 가능한 목표가 존재하는 태스크다. 코드 실행 및 테스트, 수학 문제 풀이, 구조화된 데이터 추출, API 오케스트레이션이 이에 해당한다. 반면 창의적 글쓰기, 주관적 판단, 오픈엔디드 추론처럼 성공 기준이 모호한 태스크에서는 자기 지도 피드백의 신뢰성이 낮아져 자가 진화의 효과가 제한된다. 현재 버전의 Hermes Self-Evolution은 이러한 오픈엔디드 영역을 명시적으로 적용 범위에서 제외하고 있다.
NousResearch의 Hermes Agent Self-Evolution은 인간 레이블링 없이 에이전트가 실패를 스스로 분석하고 개선하는 자가 진화 아키텍처의 첫 번째 생산 수준 구현이다. GEPA 알고리즘은 자연어 실행 트레이스 분석과 파레토 최적화를 결합하여 기존 RL 대비 35배 효율로 6~20% 우수한 성능을 달성한다. 가중치 업데이트 없이 프롬프트와 스킬만을 진화시키는 설계는 배포된 에이전트의 지속적 개선을 현실적으로 가능하게 하며, 에이전트 자율성의 새로운 기준을 제시한다.
Sources
- GitHub - NousResearch/hermes-agent-self-evolution
- Hermes Agent Documentation | Hermes Agent
- Hermes Agent — The Agent That Grows With You | Nous Research
- Hermes Agent: the first AI agent that keeps what it learns | Medium
- Hermes Agent 2026: First Production-Ready Self-Improving Open-Source AI Agent
- GitHub - gepa-ai/gepa: Optimize prompts, code, and more with AI-powered Reflective Text Evolution
- hermes-agent: Is Self-Improving AI a Real Category? - AgentConn Blog
- Hermes Agent Review: 95.6K Stars, Self-Improving AI Agent (April 2026) - DEV Community