프롬프트에서 하네스로, AI 개발 패러다임이 옮겨간 길

Prompt Engineering에서 Context Engineering을 거쳐 Harness Engineering으로 이어진 AI 에이전틱 개발 패러다임의 전환 과정과 하네스의 핵심 구성 요소, 앞으로의 방향을 정리한다

2026-08-14 · 최초 발행 2026-04-11

2022년부터 2026년까지 AI 개발 패러다임은 근본적 전환을 거듭했다. Prompt Engineering(2022)에서 Context Engineering(2024)으로, 다시 Harness Engineering(2026)으로의 진화는 단순한 용어 변화가 아니라 AI와 인간의 협업 방식 자체가 재정의되는 과정이었다. 각 세대는 이전 세대를 포함하며 확장하는 구조로, Harness는 Context를 포함하고 Context는 Prompt를 포함한다.

Prompt Engineering, 완벽한 한 줄을 쓰는 기술

2022년 ChatGPT 등장과 함께 본격화된 Prompt Engineering은 AI와의 상호작용에서 "완벽한 단일 지시문"을 작성하는 기술이었다. 하나의 프롬프트로 최상의 결과를 얻는 데 집중하는 단일 턴 최적화, 사용자가 질문하고 AI가 응답하는 일방향 구조의 수동적 패턴이 이 시기의 핵심이었고, few-shot prompting·chain-of-thought·role-playing 등 프롬프트 자체의 구조화가 주요 기법이었다. 컨텍스트 윈도우 제약으로 복잡한 작업에서 정보 누락이 빈발하고 세션 간 지식 전달이 불가능하다는 것이 한계였다. 이 시기의 AI 활용은 본질적으로 "똑똑한 검색 엔진"에 가까웠으며, 코드 스니펫 제안이나 텍스트 생성 등 단일 작업에 국한되었다.

Context Engineering, 모든 관련 정보를 설계하는 일

컨텍스트 윈도우의 확대(100K~1M 토큰)와 RAG(Retrieval-Augmented Generation) 기술의 성숙이 Context Engineering 시대를 열었다. 단일 프롬프트가 아니라 AI가 올바른 결정을 내리기 위한 "모든 관련 정보"를 설계하는 방식으로 전환됐다. 프롬프트뿐 아니라 시스템 프롬프트, 참조 문서, 코드베이스 컨텍스트를 구조적으로 제공하는 정보 설계, 외부 지식 기반에서 실시간으로 관련 정보를 검색해 컨텍스트에 주입하는 RAG 파이프라인, 이전 대화의 맥락을 유지하며 점진적으로 작업을 수행하는 멀티턴 대화가 핵심이었고, LangChain·LlamaIndex·Cursor 등 컨텍스트 관리 중심의 프레임워크가 이 시기의 주요 도구로 등장했다.

Prompt Engineering (2022)Context Engineering (2024)Harness Engineering (2026)단일 지시문 최적화정보 설계와 컨텍스트 관리환경, 제약, 피드백 루프 설계

Harness Engineering, 에이전트를 감싸는 인프라

2026년 현재 AI 에이전트가 코드를 계획, 작성, 테스트, 배포하는 자율적 워크플로우가 현실화되면서 Harness Engineering이라는 새로운 학문이 등장했다. OpenAI와 Anthropic이 공통으로 검증한 핵심 테제는 "에이전트가 어려운 게 아니라, 하네스가 어렵다"다.

하네스(Harness)란 에이전트의 전체 작동을 통제하는 인프라를 의미한다. 에이전트가 작업을 수행하는 순서와 단계를 설계하는 워크플로우 정의, 에이전트가 하지 말아야 할 행동을 명시적으로 규정하는 제약 조건(Constraints), 작성 → 테스트 → 수정 사이클을 자동화해 자기 교정(self-correction)을 구현하는 피드백 루프, 에이전트가 접근할 수 있는 도구와 권한을 정밀하게 관리하는 도구 체인(Toolchain), 에이전트의 행동을 모니터링하고 개입할 수 있는 관찰 가능성(Observability) 계층이 그 내용이다.

Stripe가 매주 약 1,300개의 AI 생성 풀 리퀘스트를 리뷰, 머지, 배포하는 사례는 하네스 엔지니어링의 실전 성과를 보여주는 대표적 사례다.

규칙 파일부터 관찰 계층까지

실전에서 하네스를 구축할 때 다루어야 할 요소들이 있다.

하네스 (Harness)규칙 파일도구 권한피드백 루프관찰 계층CLAUDE.mdAGENTS.md.cursorrules파일 읽기/쓰기 실행MCP 서버작성 테스트 수정린트 포맷 검증로그 수집비용 추적인간 개입 게이트

프로젝트 규약, 디렉토리 구조, 테스트 명령어, 아키텍처 제약을 기계 판독 가능한 형식으로 문서화하는 규칙 파일(CLAUDE.md, AGENTS.md)은 하네스가 매 턴마다 다시 읽어 일관성을 유지하는 데 쓰인다. Claude Code는 약 19개의 권한 게이트 도구를 노출하며, 파일 읽기/쓰기, 셸 실행, Git 연산, 웹 조회, MCP 호출 등 카테고리별 접근 제어를 적용하는 도구 권한 관리도 핵심이다. 최소한의 효과적 피드백 루프는 작성-테스트-수정(write-test-fix) 사이클이며, 에이전트가 변경 후 테스트를 실행하고 실패 시 자체 수정을 시도한다. 관찰 계층은 에이전트 행동의 투명성을 보장하며 비용 추적, 토큰 사용량 분석, 인간 개입 게이트 등을 포함한다.

멀티 에이전트 오케스트레이션이 향하는 곳

하네스 엔지니어링은 단일 에이전트를 넘어 멀티 에이전트 오케스트레이션으로 확장되고 있다. 코드 작성 에이전트, 리뷰 에이전트, 테스트 에이전트, 배포 에이전트가 파이프라인으로 연결되는 전문화된 에이전트 팀, MCP와 A2A(Agent-to-Agent) 프로토콜을 통한 표준화된 에이전트 간 통신 프로토콜, 에이전트가 자율적으로 작업하되 핵심 결정 지점에서 인간 승인을 요청하는 HITL(Human-in-the-Loop) 패턴의 정교화, 프로젝트 분석을 통해 최적의 하네스 구성을 자동 추천하는 메타 에이전트가 등장하는 하네스 자동 생성이 그 방향이다.

AI 개발 패러다임은 4년간 프롬프트 최적화에서 컨텍스트 설계로, 다시 하네스 설계로 진화했다. 각 단계는 이전 단계를 포함하며 확장하는 구조로, 2026년 현재 하네스 엔지니어링은 AI 에이전트를 프로덕션 환경에서 안정적으로 운영하기 위한 핵심 학문으로 자리잡았다. Stripe의 주당 약 1,300개 AI 풀 리퀘스트 사례가 보여주듯, 하네스의 품질이 곧 에이전트의 신뢰성을 결정하는 시대가 도래했다.

Sources

Harness EngineeringContext EngineeringPrompt Engineering에이전트 오케스트레이션CLAUDE.md