Google I/O 2026 에이전트 플랫폼과 멀티모달 통합 전략

Gemini Omni와 Gemini 3.5 Flash, Antigravity 2.0이 멀티모달 생성·고속 추론·서브에이전트 실행을 결합하는 구조를 분석한다.

2026-08-14 · 최초 발행 2026-08-02

모델 발표보다 중요한 것은 실행 계층의 통합이다

Google I/O 2026에서 함께 공개된 Gemini Omni, Gemini 3.5 Flash, Antigravity 2.0은 서로 떨어진 제품 발표가 아니다. 멀티모달 입력과 출력을 처리하는 모델, 반복 작업에 맞춘 고속 추론 모델, 작업을 분해하고 실행하는 개발 플랫폼이 하나의 에이전트 하네스 안에서 연결된다.

이 구조에서 Gemini Omni는 비디오·오디오·텍스트를 다루는 인식·생성 계층을 맡는다. Gemini 3.5 Flash는 속도가 필요한 에이전틱 추론을 담당하고, Antigravity 2.0은 모델 호출과 도구 사용, 서브에이전트 실행을 조율한다. 계층으로 보면 3층 구조다.

(1) 복잡·장기 작업(2) 속도 우선 에이전틱 작업(3) 온디바이스 경량 작업사용자 입력(텍스트/이미지/오디오/비디오)Gemini Omni멀티모달 인식·생성 레이어작업 복잡도분류Gemini 3.1 Pro / Ultra고성능 추론Gemini 3.5 Flash4배 고속 추론 레이어Gemini Spark엣지 추론Antigravity 2.0에이전트 하네스서브에이전트 오케스트레이터서브에이전트 A파일시스템 조작서브에이전트 B 검색·크롤링서브에이전트 C코드 실행·테스트결과 통합 diff 반환사용자 최종 출력(코드·문서·영상·음성)

Antigravity 2.0은 작업 성격에 맞춰 Gemini 모델 계층을 선택하고, 복잡한 멀티스텝 작업은 비동기 서브에이전트로 나눈다. 파일시스템 조작, 웹 검색, 코드 실행처럼 독립적으로 처리할 수 있는 일을 병렬화한 뒤 결과를 통합하는 방식이다.

여기서 눈여겨볼 설계는 하네스 단일화다. Antigravity CLI(agy), 데스크톱 앱, SDK, Managed Agents API가 같은 에이전트 하네스 코드베이스를 공유한다. 하네스에 들어간 기능과 버그 수정이 여러 접근 경로에 함께 반영되는 구조다. Google이 Claude Code와 Codex CLI에 대응하면서 개별 도구보다 플랫폼 전체를 전면에 세운 이유도 여기에 있다.

Gemini Omni가 생성 파이프라인을 한 호출로 묶는 방식

기존 Gemini 계열이 멀티모달 이해에 무게를 두었다면, Gemini Omni는 비디오 생성과 편집, 오디오 합성까지 단일 추론 패스에서 처리하는 네이티브 멀티모달 생성 모델로 제시됐다.

모델에는 텍스트 디코더 헤드와 함께 비디오 프레임 디코더 헤드, 오디오 스펙트로그램 디코더 헤드가 통합된다. 이 구성은 영상 처리와 음원 처리, 자막 생성을 별도 모델 파이프라인으로 이어 붙이지 않고 하나의 복합 지시로 다루기 위한 것이다. 가령 영상의 배경 음악을 바꾸면서 자막을 추가하는 요청을 단일 호출로 처리할 수 있다.

에이전트 플랫폼과 결합하면 출력 형식도 작업 흐름에 포함된다. Antigravity 에이전트가 코드 리뷰를 마친 뒤 음성 요약과 짧은 설명 영상을 만들거나, 화이트보드를 촬영한 영상에서 내용을 읽어 코드와 문서를 생성하는 워크플로가 가능해진다.

Gemini Omni에 제시된 기술 범위는 다음과 같다.

  • 비디오·오디오·텍스트를 함께 출력하는 단일 추론 패스 멀티모달 생성
  • 자연어 명령을 해석하는 비디오 타임라인 편집
  • 생성된 비디오와 오디오 사이의 시간 동기화를 위한 크로스 모달 일관성
  • Gemini API 제공과 Antigravity 하네스를 통한 접근

Gemini 3.5 Flash가 맡는 고속 에이전틱 추론

Gemini 3.5 Flash는 동급 경쟁 모델보다 4배 빠른 출력 토큰 생성 속도를 제시한 경량 플래그십 모델이다. 단순 응답 속도만 높인 모델이 아니라, 코딩 에이전트가 계획·수정·검증을 반복하는 과정에 맞춰 추론 구조를 조정했다.

속도 개선에는 Speculative Decoding이 쓰인다. Gemini Spark를 드래프트 모델로 두어 여러 토큰을 먼저 추측하고, Gemini 3.5 Flash가 이를 검증하면서 유효 처리량을 높이는 구조다.

KV Cache도 다시 설계했다. Grouped Query Attention(GQA)과 Multi-Query Attention(MQA)을 혼합한 하이브리드 어텐션으로 메모리 풋프린트를 줄이고, 1M 토큰의 긴 컨텍스트를 처리할 때 레이턴시를 낮춘다. 장기 멀티스텝 작업에서 불필요한 재확인 루프를 줄이도록 RLHF 보상 모델을 설계한 에이전틱 추론 특화 파인튜닝도 포함됐다.

발표된 벤치마크 결과는 Terminal-Bench 2.1에서 76.2%, MCP Atlas에서 83.6%다. SWE-bench Verified에서는 경량 모델 최고 수준을 기록했다.

Antigravity 안에서 Gemini 3.5 Flash는 속도와 비용을 우선하는 서브에이전트의 기본 추론 모델로 배치된다. 파일 분석에서 수정 계획, 코드 생성, 테스트 실행으로 이어지는 각 단계를 처리하며, 장기 세션의 반복 작업을 Pro/Ultra 모델보다 대폭 낮은 비용으로 수행한다. Gemini CLI가 Antigravity CLI로 전환된 뒤에는 기본 모델 백엔드로 설정된다.

Antigravity 2.0은 코딩 도구에서 개발 플랫폼으로 이동했다

Antigravity는 2025년 독립형 에이전트 코딩 도구인 1.x로 출발했다. 2.0에서는 Gemini CLI를 흡수하고 전문 서브에이전트 오케스트레이션을 탑재하면서 에이전트 퍼스트 개발 환경 플랫폼으로 위치를 바꿨다.

사용자가 접하는 표면은 목적에 따라 나뉜다.

표면 역할 주요 사용자
Antigravity 데스크톱 앱 내장 Chromium 브라우저를 갖춘 에이전트 오케스트레이션 허브 개인 개발자·파워 유저
Antigravity CLI (agy) Go 기반의 경량 터미널 인터페이스이자 Gemini CLI 후계 스크립팅·자동화 워크플로
Antigravity SDK 커스텀 에이전트를 정의하는 Python·Go·Node 라이브러리 에이전트 개발자
Managed Agents API Gemini API 안에서 제공하는 서비스형 에이전트 실행 계층 엔터프라이즈 API 소비자
Gemini Enterprise Agent Platform Google Cloud 기반의 거버넌스·보안 강화 계층 대기업 IT 조직

Async Subagent Mode에서는 오케스트레이터가 작업을 분해한 뒤 독립된 컨텍스트 윈도우를 가진 서브에이전트를 병렬로 스폰한다. 각 에이전트가 반환한 결과는 diff 형식으로 모이고, 오케스트레이터가 충돌을 해결한 다음 최종 결과를 사용자에게 보여준다. 대규모 코드베이스의 분석과 리팩토링, 테스트 자동화처럼 작업 간 분리가 가능한 경우에 맞는 구조다.

플랫폼 확장은 Skills, Hooks, Subagents를 중심으로 이뤄진다.

  • Skills는 .agents/skills/에 Markdown으로 정의하는 선언적 플러그인이다. TUI의 슬래시 커맨드로 변환할 수 있어 팀 워크플로를 공통 규칙으로 배포할 수 있다.
  • Hooks는 JSON으로 정의하는 생명주기 이벤트 처리 기능이다. before_tool_call, after_model_call, on_loop_stop, on_error 훅 포인트를 지원한다.
  • Subagents는 별도의 컨텍스트를 가진 에이전트를 비동기 병렬 실행하고 결과를 조율한다.

Gemini CLI 통합은 기능을 옮겨 담는 수준이 아니다. 기존 gemini 바이너리는 agy(antigravity)로 대체되고, ~/.gemini/ 구성 디렉터리는 ~/.antigravity/로 마이그레이션된다. 자동 전환에는 antigravity migrate --from-gemini 명령을 사용한다.

구독과 개발자 생태계를 함께 묶는 Google AI Ultra

Google AI Ultra는 고급 모델과 에이전트 실행 환경, Workspace 연동을 한 구독에 포함한다. Gemini 3.1 Pro/Ultra와 Gemini Omni 접근권, Antigravity 2.0 전체 기능, Google Workspace AI 에이전트 통합이 대상이다. 상품 구조는 개인용 월정액과 기업용 Seat 기반 Enterprise 플랜으로 나뉜다.

개발자 생태계에서는 MCP, Skills 마켓플레이스, 하이브리드 오픈소스 전략이 맞물린다.

Antigravity 2.0은 Model Context Protocol(MCP)을 런타임 수준에서 지원한다. GitHub, Jira, Confluence, BigQuery 같은 외부 MCP 서버를 플러그인 방식으로 연결할 수 있으며, Google은 공식 MCP 서버 50종 이상을 Google Cloud Managed MCP Servers로 제공한다.

Skills 마켓플레이스는 팀과 커뮤니티가 만든 Antigravity Skills의 유통 경로다. GitHub 저장소에 Skills를 포함하고 팀 전체가 같은 작업 절차를 재사용하는 흐름도 이 생태계 안에 들어간다.

오픈소스 범위에는 경계가 있다. Antigravity CLI 클라이언트 코드는 공개해 커뮤니티 기여를 받지만, 에이전트 하네스 코어와 Gemini 모델 API는 클로즈드 소스로 유지한다. Codex CLI의 완전 오픈소스 전략과 구분되는 부분이다.

Google·Anthropic·OpenAI가 선택한 서로 다른 경계

Google, Anthropic, OpenAI의 에이전트 플랫폼은 모델과 실행 계층을 묶는 방식, 서브에이전트 지원, 안전성 통제, 오픈소스 범위에서 차이를 보인다.

구분 Google Antigravity 2.0 Anthropic Claude Code OpenAI Codex CLI
코어 모델 Gemini 3.5 Flash / Omni Claude Opus 4.x / Sonnet GPT-5.5 / GPT-5.6
에이전트 아키텍처 공유 에이전트 하네스 기반 멀티표면 계층을 분리한 Claude Agent SDK 오픈소스 Codex Agent Framework
서브에이전트 내장 비동기 병렬 스폰 중첩 서브에이전트(Nested) 제한적 파트너 통합
멀티모달 생성 Gemini Omni의 비디오·오디오·텍스트 생성 텍스트·이미지 중심 GPT-Image와 Sora 분리
컨텍스트 윈도우 Flash 1M 토큰, Ultra 2M 토큰 200K 토큰 128K~256K 토큰
CLI Antigravity CLI(agy) Claude Code CLI Codex CLI
안전성 통제 도구 권한 화이트리스트 인간 검토를 내장한 Human Gate 사용자 확인 프롬프트
오픈소스 범위 클라이언트 부분 공개 Agent SDK 공개 CLI 완전 오픈소스
구독 모델 Google AI Ultra 번들 Claude for Enterprise ChatGPT Enterprise
MCP 네이티브 지원, Managed MCP 50+ MCP 표준 지원 MCP 지원

Google이 내세우는 첫 번째 축은 멀티모달 깊이다. Gemini Omni의 비디오 생성이 코딩 작업뿐 아니라 창작과 미디어 제작 워크플로까지 에이전트의 실행 범위에 포함한다.

두 번째 축은 플랫폼 번들이다. Gmail, Docs, Sheets를 포함한 Google Workspace와 Android, Google Cloud를 함께 연결해 기업의 도입 경로를 넓힌다. Flash의 1M 토큰과 Ultra의 2M 토큰 컨텍스트는 대규모 모노레포를 단일 세션에서 처리하는 용도로 제시된다.

Anthropic Claude Code는 위험 단계에서 인간 검토를 요구하는 Human Gate를 중심에 둔다. 기업 보안과 컴플라이언스 환경에서 안전성 통제를 강조하며, 공개 Agent SDK는 산업별 커스텀 에이전트를 구성할 수 있는 자유도를 제공한다.

OpenAI Codex CLI는 완전 오픈소스를 기반으로 포크와 커스터마이징을 허용한다. 개인 개발자와 스타트업이 도구를 변형하기 쉬우며, 3억 명 이상 사용자 기반의 ChatGPT와 연결되는 접점을 갖는다.

플랫폼 설계 관점에서 읽어야 할 지점

Antigravity 2.0의 오케스트레이터-서브에이전트 구조는 멀티에이전트 시스템의 작업 분해와 병렬 실행을 실제 개발 환경에 옮긴 사례다. 독립 컨텍스트 윈도우와 diff 기반 결과 통합은 분산 작업의 병렬화, 충돌 처리, 멱등성 문제와 연결된다.

Gemini 3.5 Flash의 Speculative Decoding은 소형 드래프트 모델이 후보 토큰을 만들고 대형 검증 모델이 이를 확인하는 추론 최적화 기법이다. GQA와 KV Cache 최적화 역시 긴 컨텍스트를 처리하는 대형 언어 모델의 메모리와 레이턴시 설계에 직접 닿는다.

하나의 하네스를 데스크톱 앱과 CLI, SDK, API에 공유하는 방식은 파사드 패턴과 단일 진실 공급원 원칙의 응용으로 볼 수 있다. MCP를 통한 외부 도구 연결은 플러그인 아키텍처와 API 게이트웨이 패턴을 결합한 형태다.

비용 체계도 모델 토큰만으로 설명되지 않는다. 에이전트 실행 단위인 Agent Task Unit(ATU)을 기준으로 할당량을 구성하면 토큰 기반 과금에서 작업 단위 과금으로 중심이 이동한다. 병렬 서브에이전트의 동시 실행 비용을 산정하는 문제는 리소스 스케줄링과 공정 분담(Fair Share Scheduling)에 해당한다.

Google의 선택은 모델 하나의 성능 경쟁보다 넓다. Gemini Omni의 멀티모달 생성, Gemini 3.5 Flash의 4배 속도 최적화, Antigravity 2.0의 공통 하네스를 구독과 도구 생태계까지 연결했다. 향후 채택은 Skills 마켓플레이스의 성숙도와 MCP 서버 생태계의 품질, Gemini Omni의 비디오 생성 기능이 실제 에이전트 워크플로에 얼마나 녹아드는지에 달려 있을 것으로 전망된다.

Sources

Google I/OGeminiAntigravityAI 에이전트멀티모달