AI 하네스가 모델 추론을 실행 시스템으로 만드는 방식
AI 하네스의 모델·실행 분리 구조와 권한 게이트, 지속성, 격리 실행, 관측성 기반 운영 거버넌스를 정리한다.
2026-08-30 · 최초 발행 2026-07-20
모델의 판단을 실제 작업으로 연결하는 하네스
2026년 7월 현재 주요 AI 랩은 모델 포트폴리오와 에이전트 하네스(AI Harness)를 함께 내놓는 방향으로 수렴했다. 모델이 추론과 판단을 수행한다면, 하네스는 도구, 권한, 병렬 워커, 지속성, 격리 실행 환경을 제공한다. 경쟁의 기준도 순수 모델 성능에서 하네스의 완성도까지 넓어졌다.
에이전트는 다음과 같이 볼 수 있다.
Agent = Model + Harness
여기서 모델은 지능을 담당하고, 하네스는 그 지능이 실제 작업을 수행하도록 제어하는 시스템이다. 하네스에는 모델을 제외한 코드, 설정, 실행 로직이 포함된다. 도구 호출의 검증, 격리된 워크스페이스에서의 실행, 구조화된 결과 피드백이 모두 이 계층의 책임이다.
2025년이 에이전트 개념 검증(PoC)의 해였다면 2026년은 하네스가 실제 인프라로 격상된 시점으로 볼 수 있다. AI 에이전트 프로젝트가 프로덕션까지 도달하지 못하는 원인을 모델보다 하네스의 부재에서 찾는 진단도 확산됐다. 프런티어 모델의 성능이 유사 수준으로 근접하면서, 차별화 지점은 모델 주변의 하네스, 워크플로, 승인 모델, 배포 채널로 이동했다.
추론 계층과 실행 계층이 만나는 지점
하네스는 모델을 감싸며 확률적인 추론을 결정론적인 실행으로 옮기는 운영체제(OS) 역할을 한다. 이 계층에는 다음 기능이 연결된다.
- 모델이 생성한 도구 호출을 수신하고 검증·실행한 뒤, 구조화된 결과를 모델에 되돌리는 도구 호출 계층. MCP(Model Context Protocol)는 도구와 데이터의 수직 연동에 사용된다.
- 도구별 권한 게이트가
deny/ask/allow규칙 파이프라인을 순서대로 평가하는 권한 모델. deny 우선 원칙에 따라 무음 진행, 사용자 확인, 차단으로 갈린다. - 독립적인 서브에이전트를 병렬로 실행하고, 지속적인 협업이 필요할 때 에이전트 팀을 구성하는 워커 스케줄링.
- 파일시스템 기반 외부 메모리로 컨텍스트 윈도를 넘어 상태를 보존하는 지속성 계층. 작업 진행 상태, 열린 파일, 태스크 상태를 중단 뒤에도 다시 이어갈 수 있다.
- 잘못된 도구 호출, 프롬프트 인젝션, 프로그래밍 오류가 비가역적 손상으로 번지는 일을 막기 위한 격리 실행 환경.
- 도구 호출이나 파일 쓰기 같은 생명주기 이벤트에 검증 로직을 붙이고, 태스크와 조직 정책에 따라 자율성 수준을 조절하는 승인 게이트.
Claude Code, Codex CLI, Antigravity의 설계 차이
2026년 기준 각 랩의 하네스는 도구, 권한, 지속성, 배포 표면에서 서로 다른 성격을 보인다. 모델 성능이 가까워진 상황에서는 하네스 설계 철학이 사용 경험을 좌우한다.
| 구분 | Claude Code | Codex CLI | Antigravity 2.0 |
|---|---|---|---|
| 대표 모델 | Opus 4.8 (SWE-bench Verified 88.6%) | GPT-5.5 (Terminal-Bench 2.0 82.7%) | Flash 계열 (속도·오케스트레이션) |
| 강점 | 최심층 추론 천장, 난도 높은 작업 | 토큰 효율(동일 작업 기준 Claude 대비 낮은 사용량) | 병렬 에이전트 디스패치, 다단계 도구 사용 |
| 배포 표면 | CLI 중심 | CLI 중심 | 5면 플랫폼(데스크톱·CLI·SDK·Managed Agents API·엔터프라이즈) |
| 권한·승인 | 훅 기반 승인 게이트, 세밀한 규칙 | 승인 게이트 지원 | 하네스 단일화, 표면 전반 동일 정책 |
| 지속성 | 파일시스템 외부 메모리 | 세션 메모리 | 장기 실행 태스크 상태 관리 |
| 토큰 비용 특성 | 상대적으로 높은 편 | 리en·저토큰 지향 | Flash 티어로 저비용 |
| 참고 가격대 | Claude Pro $20 | ChatGPT Plus $20 | 무료~$200 |
Claude Code는 추론 깊이에, Codex는 토큰 효율에, Antigravity는 배포 표면의 통일과 병렬성에 무게를 둔다. 다만 도구 호출, 권한 게이트, 격리 실행, 지속성은 세 하네스가 공통으로 채택한 골격이다.
직접 API 호출과 하네스 기반 실행의 경계
모델 API를 직접 호출하는 방식과 하네스를 결합하는 방식은 실행 책임을 어디에 둘 것인가에서 갈린다.
| 관점 | 모델 + 하네스 이원 구조 | 단일 모델 API 직접 호출 |
|---|---|---|
| 실행 책임 | 하네스가 도구·권한·격리 담당 | 애플리케이션이 직접 구현 |
| 장기 태스크 | 상태·메모리 내장 지속성 | 별도 상태 관리 필요 |
| 안전성 | 샌드박스·승인 게이트 기본 제공 | 자체 가드레일 구축 필요 |
| 관측성 | 트레이싱·감사 로그·비용 통제 내장 | 별도 계측 필요 |
| 벤더 종속 | 메모리·게이트웨이·스킬 카탈로그 종속 위험 | 모델 교체 자유도 높음 |
| 개발 속도 | 초기 통합 빠름 | 세밀 제어 가능하나 구축 부담 |
코딩 에이전트, 다단계 자동화, 장기 실행 워크플로처럼 실행 복잡도가 높은 영역에는 이원 구조가 적합하다. 반대로 단발성 생성, 요약, 분류처럼 실행 오케스트레이션이 필요 없는 경량 태스크라면 단일 모델 API 직접 호출이 맞을 수 있다.
운영 정책은 하네스의 일부가 된다
하네스 도입에서는 모델 선정보다 데이터 엔지니어링과 거버넌스의 비중이 더 크다. 판단 기준은 도구 연동의 MCP 지원 여부, 권한 모델의 세밀도, 상태·메모리를 포함한 지속성, OpenTelemetry 호환 관측성에 있다.
실행 권한은 deny/ask/allow 규칙을 기본 deny로 두고 필요한 도구만 화이트리스트로 열어야 한다. 파일 쓰기와 외부 호출처럼 고위험 액션에는 승인 게이트를 강제하고, 감사 로그로 추적성을 확보한다.
병렬 워커를 쓸 때는 동시 워커 수 상한과 토큰 예산 통제가 필요하다. 병렬 실행 비용이 급격히 늘어나는 상황을 막기 위해서다. 자율성 수준은 태스크와 정책별로 조절하고, 기존 개발 파이프라인의 CI/CD와 코드 리뷰 흐름에 승인 게이트를 삽입한다.
장기 태스크를 운영하려면 트레이싱, 감사 로그, 비용 통제를 갖춘 통제 평면(Control Plane)에서 상태와 메모리를 추적해야 한다. 모델은 교체할 수 있어도 메모리, 게이트웨이, 스킬 카탈로그는 벤더 고착으로 이어질 수 있다. MCP의 수직 연동과 A2A의 수평 연동은 다벤더 오케스트레이션과 이식성 확보를 위한 수단이다.
아키텍처 원칙과 거버넌스 요구의 접점
추론을 모델에, 실행을 하네스에 나누는 구조는 책임 분리(SoC) 원칙과 맞닿아 있다. 계층이 분명해지면 변경 영향 범위를 국소화할 수 있다.
권한 게이트의 deny 우선 원칙은 최소권한(Least Privilege)과 기본 거부(Default Deny) 보안 원칙에 부합한다. 감사 로그와 트레이싱을 내장하는 방식도 정보보호 관리체계의 로깅·모니터링 통제 요구와 연결된다.
하네스 벤더에 대한 고착은 IT 거버넌스에서 공급망과 종속성 리스크로 다뤄야 할 항목이다. MCP와 A2A 같은 이식성 표준을 채택하는 전략은 이 리스크를 완화하는 방법이 된다. 2026년의 경쟁은 순수 모델 성능만의 경쟁이 아니라 하네스 완성도의 경쟁으로 옮겨가고 있으며, 통제 평면, 관측성, 거버넌스가 실제 도입 성패를 가르는 요소가 됐다.
Sources
- The Anatomy of an Agent Harness — LangChain
- What Is Harness Engineering AI? The Definitive 2026 Guide — Atlan
- Claude Code vs. Cursor vs. Codex vs. Antigravity — six months in — The New Stack
- Best AI Coding Agents in 2026: Harness, Cost, and Accuracy Compared — Firecrawl
- AI Agent Harnesses Explained: Architecture, Ecosystem, and Multi-User Design — boringbot
- Agent Harness Engineering — The Rise of the AI Control Plane — Adnan Masood
- Enterprise Agentic AI Landscape 2026: Trust, Flexibility, and Vendor Lock-in — Kai Waehner
- Designing Secure Tool Harnesses for AI Coding Agents