Codex Record & Replay와 Goal 모드로 설계하는 에이전트 자동화
OpenAI Codex의 Record & Replay, Goal 모드, GPT-5.5 통합과 팀 Skill 라이브러리 운영 방식을 정리한다.
2026-08-14 · 최초 발행 2026-08-02
시연한 작업을 호출 가능한 Skill로 바꾸는 방식
2026년 6월 OpenAI는 Codex 플랫폼에 Record & Replay를 추가했다. 사용자가 작업을 한 번 수행하면 Codex가 그 시퀀스를 재사용 가능한 Skill로 변환해 저장하는 구조다. 단발성 프롬프트 보조를 넘어, 반복적인 화면 작업을 “시연 후 재호출” 가능한 자동화 자산으로 다룬다는 점이 핵심이다.
Record & Replay는 macOS 전용 Codex 앱 플러그인으로 제공되며, Computer Use 활성화가 필요하다. 초기 출시 대상에서는 EU·영국·스위스가 제외됐다. 사용자는 플러그인을 시작한 뒤 화면 조작, 앱 전환, 데이터 입력 같은 작업을 평소 방식대로 수행한다. Codex는 동작 시퀀스를 캡처하고, 이를 분석해 실행 가능한 Skill 패키지로 바꾼다. 이후에는 해당 Skill을 호출해 같은 작업을 자동 실행할 수 있다.
YouTube 영상 업로드, PR 포맷팅, 캘린더 초대 생성, 경비 처리, 주차 예약 등이 자동화 사례로 제시됐다. 개인이 만든 Skill을 팀과 공유할 수 있어, 개인의 반복 작업이 부서 공용 자동화로 이어질 수 있다.
출시 당시 Slack, Gmail, Notion, Salesforce, HubSpot을 포함한 20개 이상의 서드파티 통합이 함께 제공됐다. Sales 번들, Snowflake·Databricks Genie·Hex·Tableau를 지원하는 Analytics 번들, Design 번드를 포함해 총 62개 앱, 110개 Skill이 번들로 제공됐다.
Skill은 캡처·정규화·패키징을 거쳐 재사용된다
Record & Replay를 에이전트 구조로 보면, 화면 이벤트를 단순 기록하는 데서 끝나지 않는다. 시연 내용을 일반화해 실행 단위로 만들고, 이후 요청에 맞춰 다시 호출하는 루프가 필요하다.
처음에는 화면 픽셀 상태, 클릭 좌표, 키보드 입력, 앱 컨텍스트 같은 원시 이벤트 스트림을 수집한다. 이어 AI가 이 이벤트를 의미 있는 액션으로 정규화한다. 예를 들어 특정 픽셀을 누르는 동작은 YouTube 업로드 버튼을 누르는 동작으로 추상화될 수 있다. 마지막으로 조건부 분기, 변수 바인딩, 오류 처리 로직을 추가해 범용적으로 실행할 수 있는 Skill로 패키징한다.
실행 단계에서는 요청에 맞는 Skill을 선택하고, 현재 환경의 변수를 파라미터에 연결하며, Computer Use API를 통해 화면을 조작한다. 결과는 성공 기준과 대조하고, 실패하면 재시도하거나 사용자 개입을 요청한다.
| 루프 단계 | 역할 | 구현 방식 |
|---|---|---|
| Skill Dispatch | 요청 파싱 → 적합 Skill 선택 | 벡터 유사도 검색 + 메타데이터 매칭 |
| Context Binding | 현재 환경 변수 → Skill 파라미터 바인딩 | 런타임 컨텍스트 주입 |
| Execution | Computer Use API로 실제 화면 조작 | macOS Accessibility API 활용 |
| Validation | 결과 상태 확인 → 성공 기준 대조 | 스크린샷 비교 + DOM 상태 확인 |
| Retry / Escalation | 실패 시 재시도 또는 사용자 개입 요청 | 지수 백오프 + 임계값 초과 시 알림 |
장기 목표를 세션 밖에서도 이어가는 Goal 모드
Goal 모드는 2026년 5월 정식 출시(GA)됐으며 Codex 앱, IDE 확장, CLI에서 제공된다. 사용자가 결과물인 Objective와 Success Criteria를 정의하면 Codex가 세션 경계를 넘어 몇 시간에서 며칠 단위로 목표를 자율 실행하는 모델이다.
기술 구현 상세는 v0.128.0 이상 Codex CLI에서 확인할 수 있다.
thread_goals 테이블은 목표 식별자, 사용자가 정의한 목표 텍스트, 성공 기준, 상태, 허용 토큰 상한, 시작·마지막 활동·예상 완료 시각의 타이밍 메트릭으로 구성된다. 상태값은 active, paused, budget_limited, complete다.
패키지 마이그레이션, 테스트 커버리지 개선, 대규모 리팩토링, 버그 재현 및 수정, TypeScript 현대화가 엔터프라이즈 활용 사례로 검증됐다. 여기서 Record & Replay는 반복 작업을 Skill로 캡슐화하고, Goal 모드는 복잡한 장기 목표를 추진하는 역할을 맡는다.
GPT-5.5가 맡는 에이전트 실행 엔진
GPT-5.5는 2026년 4월 23일 출시됐으며 에이전틱 코딩, 컴퓨터 사용, 지식 업무, 과학 연구에 특화된 모델로 포지셔닝됐다.
| 벤치마크 | GPT-5.5 점수 | 비고 |
|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 터미널 기반 에이전트 작업 |
| GDPval | 84.9% | 범용 개발자 생산성 |
| SWE-Bench Pro | 58.6% | Claude Opus 대비 5.7p 낮음 |
| SWE-Bench Verified | Claude Opus + 0.6p | 소폭 우위 |
가격은 표준 GPT-5.5가 백만 토큰당 입력 $5, 출력 $30이며, 장기 연구와 코드베이스 전체 리팩토링에 특화된 GPT-5.5 Pro는 입력 $30, 출력 $180이다.
GPT-5.5는 2026년 5월 ChatGPT의 기본 모델인 GPT-5.5 Instant로 승격됐고, Goal 모드의 멀티세션 실행 엔진으로도 통합됐다. 복잡한 목표 이해, 다단계 도구 사용, 작업 검증, 멀티파트 태스크 자율 완료 역량이 Plan → Act → Test → Audit 루프를 구동한다.
팀 자산으로 운영하는 Skill 라이브러리
팀 Skill 라이브러리는 개인 생성, 검증·공유, 역할별 번들화의 확장 모델로 구성할 수 있다. 팀원이 자신의 반복 작업을 Record & Replay로 캡처해 개인 라이브러리에 축적하고, 성공률·오류 처리 커버리지·재현성 기준을 통과한 Skill을 공유 풀에 등록한다. 이후 직무별로 자주 쓰는 Skill을 묶어 신규 팀원 온보딩에 활용한다.
OpenAI의 글로벌 관리 콘솔에 있는 Codex Analytics 대시보드는 활성 사용자, 크레딧/토큰 소비량, 스레드/턴 수, 유저 리더보드, 플러그인 사용량, 코드 수락 라인, 모델 사용량을 실시간으로 추적한다. 이 데이터를 통해 많이 호출되는 Skill과 생산적인 Skill을 만든 팀원을 파악할 수 있다.
개발 조직에서는 PR 생성 및 포맷팅, 코드 리뷰 체크리스트 실행, 릴리스 노트 작성, 테스트 환경 초기화, 의존성 업데이트 검토가 Skill화 대상이 될 수 있다.
| 반복 패턴 | Skill화 효과 | 예상 시간 절감 |
|---|---|---|
| PR 생성 및 포맷팅 | 템플릿 자동 적용 | 회당 5~10분 |
| 코드 리뷰 체크리스트 실행 | 일관된 검토 기준 적용 | 회당 15~30분 |
| 릴리스 노트 작성 | 커밋 로그 → 문서 자동 변환 | 회당 30~60분 |
| 테스트 환경 초기화 | 환경 설정 시퀀스 자동화 | 회당 10~20분 |
| 의존성 업데이트 검토 | 취약점 스캔 + PR 생성 | 회당 20~40분 |
대상 앱의 UI나 API가 바뀌면 Skill은 동작하지 않을 수 있다. MAJOR.MINOR.PATCH 형식의 Semantic Versioning으로 버전을 관리하고, 대상 앱의 대규모 UI 변경에는 MAJOR 버전을 올리는 방식이 제시됐다. 주기적인 dry-run으로 성공 여부를 확인하고, 3개월 이상 업데이트 없이 실패율이 10%를 초과한 Skill은 Deprecated 표시와 대체 Skill 안내를 병행한다. 업데이트마다 변경 사유, 변경 범위, 테스트 결과를 메타데이터에 남기는 것도 관리 범위에 포함된다.
시연 기반 자동화와 다른 에이전트 접근의 차이
| 비교 항목 | OpenAI Codex Record & Replay | Claude Code 서브에이전트 | Google Antigravity 20 플러그인 |
|---|---|---|---|
| 자동화 진입점 | 사용자 시연 기반 Skill 생성 | 코드/프롬프트 기반 서브태스크 위임 | 워크플로우 구성 UI + 플러그인 |
| 에디터 의존성 | 에디터 외부 독립 실행 (macOS 앱) | 터미널/에디터 통합 | IDE 확장 형태 |
| 장기 목표 처리 | Goal 모드 (Plan→Act→Test→Audit) | 서브에이전트 체인 | 워크플로우 시퀀스 |
| 팀 공유 메커니즘 | 팀 Skill 라이브러리 (62앱, 110 Skill) | AGENTS.md 기반 지시 공유 | 워크플로우 템플릿 공유 |
| 모델 기반 | GPT-5.5 | Claude Opus 4 | Gemini 2.0 AX |
| SWE-Bench 성능 | 58.6% (Pro 기준) | 64.3% (Opus 4) | 미공개 |
| 코드 특화 언어 | Python, JavaScript 중점 | 범용 (언어 무관) | Python, Go 중점 |
| 엔터프라이즈 관리 | Codex Analytics 대시보드 | Anthropic Console | Google Workspace 연동 |
| Computer Use | 지원 (macOS 전용) | 지원 (OS 무관) | 지원 (Chrome 중점) |
| 가격 모델 | 토큰 기반 구독 | API 사용량 기반 | Google Workspace 요금제 연동 |
GitHub Copilot은 GitHub 이슈 → PR 워크플로우 자동화에 강점이 있고 6개 에디터를 지원하며 언어 커버리지가 가장 넓다. 다만 2026년 Q2 기준 에이전틱 기능의 극심한 컴퓨팅 수요로 신규 개인 가입이 일시 중단된 상태다. Codex는 2026년 3월 기준 주간 활성 사용자 200만 명 이상을 기록하며 에이전틱 코딩 에이전트 영역에서 점유율을 확대하고 있다.
Skill 재사용을 소프트웨어 공학으로 해석하면
Codex Skill의 구조는 정보관리기술사에서 다루는 SW 재사용 아키텍처와 닮아 있다.
컴포넌트 기반 개발(CBD, Component-Based Development) 관점에서 각 Skill은 특정 워크플로우를 독립적으로 캡슐화하고, 여러 팀원과 맥락에서 재사용된다. 여러 Skill은 순차 또는 조건부로 조합해 복합 워크플로우를 만들 수 있으며, 동일 인터페이스를 가진 Skill은 내부 구현을 바꾸지 않고 교체할 수 있다.
소프트웨어 제품 라인(SPL, Software Product Line)에서는 Sales, Analytics, Design 같은 역할별 번들이 도메인 특화 제품 라인의 자산 리포지토리와 같은 역할을 한다. 서비스 지향 아키텍처(SOA)로 보면 Skill은 표준화된 인터페이스로 호출하는 서비스에 해당하고, Codex Analytics 대시보드는 서비스 레지스트리와 모니터링 레이어에 대응한다.
향후 전개에서 볼 지점
2026년 하반기에는 IDE 통합형 도구인 Cursor·GitHub Copilot과 자율 에이전트형 도구인 Claude Code·OpenAI Codex의 포지셔닝 차별화가 더 뚜렷해질 전망이다.
Codex의 Skill 라이브러리 모델이 성공할 경우 Claude Code의 AGENTS.md 기반 접근 방식이나 다른 도구도 유사한 Skill 공유 메커니즘을 채택할 가능성이 높다. 현재 macOS 전용인 Record & Replay는 Windows와 Linux로 확대될 가능성이 있으며, EU·영국·스위스 지역 출시는 2026년 하반기 중 이뤄질 것으로 예상된다.
Codex 내부 로그에는 GPT-5.6 참조가 등장했으나 공식 출시 일정은 미정이다. Goal 모드의 장기 실행 효율성과 Skill 변환 정확도 향상에 초점을 맞출 것으로 전망된다. 엔터프라이즈 Codex Analytics 대시보드도 Skill 사용량, ROI, 오류율 등 더 정밀한 메트릭을 제공하는 방향으로 발전할 것이다.
Record & Replay, Goal 모드 GA, GPT-5.5 통합은 반복 작업과 장기 목표를 함께 다루는 자동화 모델을 제시한다. 한 번의 시연을 Skill로 저장해 팀과 공유하고, 며칠 단위 목표는 Goal 모드로 추진하는 구성이 그 중심이다. 이 구조는 CBD, SOA, SPL의 재사용 원칙을 AI 에이전트 운영에 적용한 사례로 볼 수 있다.
Sources
- https://developers.openai.com/codex/record-and-replay
- https://cryptobriefing.com/openai-record-replay-codex-automation/
- https://www.startuphub.ai/ai-news/artificial-intelligence/2026/openai-codex-learns-youtube-uploads-with-record-replay
- https://openai.com/index/codex-for-every-role-tool-workflow/
- https://thegputrade.com/news/openai-tweaks-gpt-55-instant-codex-goal-mode-goes-ga-mvv1moh7/
- https://codersera.com/blog/openai-may-2026-updates-roundup/
- https://kingy.ai/ai/openai-codex-goal-the-new-long-horizon-mode-for-agentic-coding/
- https://codex.danielvaughan.com/2026/04/16/codex-cli-goal-mode-persistent-objectives-token-budgets/
- https://deepwiki.com/openai/codex/1.3-architecture-overview
- https://openai.com/index/introducing-gpt-5-5/
- https://www.vellum.ai/blog/everything-you-need-to-know-about-gpt-5-5
- https://ralphable.com/blog/copilot-coding-agent-vs-codex-vs-cursor-background-agents-2026
- https://developers.openai.com/codex/plugins
- https://developers.openai.com/codex/changelog
- https://tech-insider.org/gpt-5-5-launch-openai-april-23-terminal-bench-2026/