같은 모델인데 순위가 30등에서 5등으로 — Addy Osmani가 말하는 하네스 엔지니어링

Addy Osmani가 제시한 하네스 엔지니어링 개념을 중심으로 시스템 프롬프트·툴 스펙·메모리·평가 루프·HITL 다섯 레이어와 프로덕션 오류 처리·비용 관리·장기 실행 에이전트 설계 원칙을 정리한다.

2026-08-14 · 최초 발행 2026-05-02

하네스 엔지니어링이란 무엇인가

AI 에이전트의 성능을 결정하는 것은 모델 자체가 아니라 에이전트가 실행되는 환경이다. Addy Osmani가 제시한 "에이전트 하네스 엔지니어링(Agent Harness Engineering)" 개념은 이 직관에 이름을 붙이고, 프로덕션 AI 시스템 설계의 새로운 규범으로 자리잡고 있다. 동일한 모델이라도 하네스 설계에 따라 성과가 극적으로 달라질 수 있으며, 실제로 한 팀은 Terminal Bench 2.0에서 모델은 그대로 두고 하네스만 교체해 순위를 Top 30에서 Top 5로 끌어올렸다.

하네스 엔지니어링(Harness Engineering)은 AI 에이전트를 프로덕션 환경에서 안정적으로 작동하게 만드는 시스템·제약·피드백 루프를 설계하는 규율이다. "하네스"라는 단어는 2026년 초에 주류 용어로 등장했으며, 에이전트가 접근할 수 있는 툴 집합, 실행 안전 경계, 자기수정 피드백 루프, 인간 관찰 가능성을 통틀어 지칭한다.

핵심 철학은 단순하다. 에이전트 실패를 모델 문제로 보지 않고 구성(configuration) 문제로 본다. 65%의 기업 AI 프로젝트 실패가 모델 추론 결함이 아니라 하네스 레벨 데이터 결함에서 비롯된다는 조사 결과는 이 관점을 뒷받침한다.

에이전트 하네스의 핵심 구성요소

하네스는 단일 컴포넌트가 아니라 여러 레이어의 조합이다.

시스템 프롬프트 레이어: 에이전트에게 역할, 목표, 행동 제약을 주입하는 최상위 지시 층이다. 잘 설계된 시스템 프롬프트는 에이전트가 스스로 범위를 이탈하지 않도록 명시적 경계를 설정한다.

툴 스펙 레이어: 에이전트가 호출할 수 있는 외부 도구의 명세와 권한 범위다. 툴 접근이 너무 넓으면 에이전트가 의도치 않은 시스템을 수정하고, 너무 좁으면 작업을 완료하지 못한다. 최소 권한 원칙을 툴 스펙에도 적용해야 한다.

메모리 레이어: 단기 작업 메모리(컨텍스트 창), 중기 세션 메모리(요약·핸드오프 파일), 장기 지식 저장소(벡터 DB·구조화 스토어)로 구분된다. 특히 장기 실행 에이전트는 "컨텍스트 부패(context rot)"를 방지하기 위해 작업 메모리 예산을 명시적으로 관리해야 한다.

평가 루프: 에이전트가 매 단계의 결과를 검증하는 내부 피드백 회로다. Plan-Execute-Verify 루프가 대표적이며, 각 단계 완료 후 성공 기준을 명시적으로 평가해야 다음 단계로 진행한다.

인간 개입 지점(HITL): 에이전트가 자율 실행을 일시 중단하고 인간의 승인을 기다리는 체크포인트다. 고위험 작업(파일 삭제, 외부 API 호출, 금융 거래)에 필수적이다.

성공실패자율 해결 가능인간 개입 필요시스템 프롬프트에이전트 실행 코어 스펙메모리 레이어평가 루프다음 단계 진행오류 복구HITL 체크포인트인간 승인 대기태스크 완료

프로덕션 운영 환경 설계

오류 처리와 재시도 정책

프로덕션 에이전트는 반드시 명시적 오류 분류 체계를 갖춰야 한다. 일시적 오류(네트워크 타임아웃, API 속도 제한)는 지수 백오프 재시도가 적합하고, 영구적 오류(잘못된 입력, 권한 부족)는 즉시 실패 처리와 함께 상세 오류 컨텍스트를 상위 레이어에 전달해야 한다.

Chaos Engineering 기법을 에이전트 하네스 테스트에 적용하면 효과적이다. 의도적으로 툴 응답 지연, 컨텍스트 오염, 잘못된 데이터를 주입해 하네스의 복원력을 검증한다.

비용 관리

토큰 비용은 프로덕션 에이전트의 핵심 운영 지표다. 효율적인 캐시 관리, 컨텍스트 압축, 불필요한 툴 호출 제거가 중요하다. 단기 에이전트는 전체 컨텍스트를 유지하지만, 장기 실행 에이전트는 하네스가 세션을 분해하고 핸드오프 파일에서 컨텍스트를 재구성하는 패턴이 비용 효율적이다.

안전 가드레일

좁은 툴 접근 범위, 명시적 페이즈 게이팅(Phase Gating), 단일 에이전트 우선 설계가 프로덕션 현장에서 검증된 원칙이다. 멀티에이전트 아키텍처는 매력적이지만, 가장 안정적인 접근은 명확한 HITL 체크포인트를 가진 단일 에이전트부터 시작하는 것이다.

컨텍스트 엔지니어링 실무

컨텍스트 엔지니어링은 하네스 엔지니어링의 하위 규율로, AI 출력 품질은 컨텍스트 품질과 직접 비례한다는 원칙을 실무에 적용하는 기술이다.

좋은 컨텍스트는 세 요소를 갖춘다. 첫째, 명확한 작업 정의와 성공 기준이다. 에이전트에게 "무엇을"과 함께 "왜"와 "어떻게 알 수 있는가"를 제공해야 한다. 둘째, 관련 이력 정보다. 이전 세션 요약, 실패한 접근법, 의존성 상태를 컨텍스트에 포함하면 에이전트가 이미 시도한 경로를 반복하지 않는다. 셋째, 부정적 예시다. "하지 말아야 할 것"을 명시하면 에이전트의 행동 공간을 효과적으로 좁힐 수 있다.

에이전트 성능 측정과 반복 개선

관찰 가능성

프로덕션 에이전트에는 세 가지 관찰 가능성 레이어가 필요하다. 토큰 사용·툴 호출 횟수·응답 지연 등 정량 지표, 에이전트 사고 흐름과 결정 근거를 추적하는 트레이스, 최종 출력 품질을 평가하는 자동화 평가기다.

LangSmith, Weave, Langfuse 같은 에이전트 관찰 플랫폼은 멀티스텝 에이전트 실행을 시각화하고, 어느 단계에서 비용이 폭증하거나 오류가 집중되는지 분석할 수 있게 한다.

에이전트 벤치마크와 반복 개선

도메인 특화 벤치마크 설계가 중요하다. 범용 벤치마크로 우수한 모델이 특정 도메인 하네스에서는 저조할 수 있다. 하네스별 실패 사례를 수집하고, 이를 기반으로 시스템 프롬프트, 툴 스펙, 평가 루프를 반복 개선하는 것이 하네스 엔지니어링의 핵심 사이클이다.

장기 실행 에이전트 설계

Anthropic의 장기 실행 에이전트 하네스는 풀 컨텍스트 리셋(Full Context Reset) 패턴을 사용한다. 세션이 길어지면 하네스가 세션을 종료하고, 압축된 핸드오프 파일에서 다음 세션을 재구성한다. 이 접근은 컨텍스트 창 한계를 극복하면서 에이전트가 여러 날에 걸쳐 목표를 향해 진행할 수 있게 한다.

Ralph Loop는 에이전트가 조기 종료를 시도할 때 하네스가 이를 가로채고 원래 의도를 깨끗한 컨텍스트 창에 재주입하는 복구 패턴이다. 장기 지속성(Long-Horizon Continuity)을 보장하는 핵심 메커니즘이다.

Sources

하네스엔지니어링AI에이전트프로덕션운영컨텍스트엔지니어링장기실행에이전트