Google I/O 2026 Gemini 3.5 Flash·Spark·Omni 아키텍처와 모델 전략
Google I/O 2026에서 공개된 Gemini 3.5 Flash·Spark·Omni의 멀티모달 구조와 에이전틱 추론 최적화, 모델별 운영 전략을 분석한다.
2026-08-14 · 최초 발행 2026-05-20
하나의 기반에서 갈라지는 Gemini 모델 패밀리
Google I/O 2026에서 Google은 Gemini 3.5 Flash, Gemini Spark, Gemini Omni를 함께 공개했다. Flash는 비용과 속도가 중요한 에이전틱 작업을, Spark는 24시간 365일 백그라운드에서 움직이는 개인 에이전트를, Omni는 텍스트·이미지·오디오·비디오를 아우르는 멀티모달 생성을 맡는다. 하나의 모델로 모든 수요를 포괄하기보다 디바이스·비용·성능의 트레이드오프에 따라 역할을 나눈 구성이다.
이 구조에서 먼저 결정해야 할 것은 모델 사이에 공유할 부분과 분리할 부분이다. Google의 접근은 대규모 사전학습 단계에서 공통 기반 가중치(base weights)를 만든 뒤 서비스 목적에 맞는 파인튜닝(fine-tuning)을 적용하는 계층적 증류 구조다. Flash에는 속도와 에이전틱 추론에 맞춘 학습을 적용하고, Spark에는 경량화와 백그라운드 실행을 위한 구조를 결합한다.
세 모델은 텍스트, 이미지, 오디오, 비디오를 공통 임베딩 공간에 매핑하는 통합 멀티모달 인코더를 공유한다. 서로 다른 입력을 동일한 트랜스포머 디코더 블록에서 처리하므로 모달리티 간 크로스 어텐션 없이도 일관된 멀티모달 이해가 가능하다. Omni에는 여기에 비디오 생성을 위한 디코더 헤드가 추가된다.
추론 비용도 모델마다 다른 방식으로 설계됐다. Gemini 3.5 Flash는 유사 프론티어 모델 대비 절반 이하의 비용으로 장기 에이전틱 작업을 처리하도록 최적화됐다. 고품질 비디오 생성에 추가 연산이 필요한 Gemini Omni는 프리미엄 티어에 놓인다. Spark는 클라우드 API 호출 없이 디바이스 안에서 경량 추론을 수행할 수 있어 클라우드 모델과 비용 구조 자체가 다르다.
Flash가 장기 에이전트 작업을 빠르게 처리하는 방식
Gemini 3.5 Flash는 프론티어 모델 대비 4배 빠른 출력 토큰 생성 속도를 달성하면서 주요 에이전틱·코딩 벤치마크에서 Gemini 3.1 Pro를 능가했다. Terminal-Bench 2.1에서는 76.2%, GDPval-AA에서는 1656 Elo, MCP Atlas에서는 83.6%를 기록했다. 멀티모달 이해 지표인 CharXiv 성능은 84.2%였다.
생성 속도를 끌어올리는 기반에는 스펙큘레이티브 디코딩(speculative decoding)과 배치 처리 최적화가 있다. 소형 드래프트 모델이 다음 토큰 시퀀스를 먼저 예측하고 대형 검증 모델이 이를 병렬 검증한다. 이 방식은 출력 품질을 유지하면서 실제 생성 속도를 2~4배 높인다.
에이전트 실행 과정도 별도로 다듬었다. 도구 호출(tool call)을 파싱하기 쉬운 구조화 출력과 장기 컨텍스트가 누적될 때의 KV 캐시 재사용률을 최적화했다.
MCP(Model Context Protocol) Atlas에서의 성능은 Flash가 MCP 기반 멀티에이전트 오케스트레이션에 맞춰졌음을 시사한다. 도구 선택 정확도와 멀티스텝 계획 수립, 오류 복구 능력의 개선은 프로덕션 에이전트 배포와 직접 연결되는 부분이다.
Spark가 디바이스와 클라우드를 오가는 이유
Gemini Spark의 역할은 소형 모델에 머물지 않는다. 사용자 대신 복잡하고 반복적인 작업을 처리하는 개인 에이전트로 설계됐으며, 24시간 365일 백그라운드 실행을 지향한다. 디바이스가 꺼진 상황에서도 클라우드 인프라에서 동작하고 Gmail·Sheets 같은 Google Workspace 앱, 커스텀 커넥터, 오픈 웹에 접근한다.
온디바이스 추론을 위한 경량화에는 지식 증류(knowledge distillation), 가중치 양자화(weight quantization), 레이어 프루닝(layer pruning)을 함께 사용한다. 지식 증류 과정에서는 대형 교사 모델인 Gemini Ultra의 소프트 레이블을 이용한다. 학생 모델은 정답만 복제하는 대신 교사 모델의 확률 분포를 학습한다.
INT4 또는 INT8 양자화는 32비트 부동소수점 가중치를 48비트 정수로 변환한다. 이를 통해 메모리 점유율을 48배 줄이면서 성능 손실을 최소화한다.
배터리 효율은 NPU(Neural Processing Unit) 가속에 달려 있다. 스마트폰 칩셋의 NPU는 행렬 연산에 특화된 병렬 처리 구조를 사용하며, 같은 추론 작업을 CPU보다 10배 이상 에너지 효율적으로 수행할 수 있다. Spark의 온디바이스 실행은 Google Tensor 칩셋과 Qualcomm Snapdragon을 비롯한 주요 모바일 프로세서의 NPU API에 맞춘 커널 최적화로 뒷받침된다.
Omni가 입력 모달리티와 비디오 편집을 잇는 법
Gemini Omni는 Veo 3의 후계 위치에 있지만 설계 방향은 다르다. Veo 3가 텍스트-투-비디오에 집중했다면 Omni는 텍스트, 이미지, 오디오, 기존 비디오의 어떤 조합도 입력으로 받아 고품질 비디오를 생성하는 anymodal-to-video 모델이다. 한 번 생성하고 끝나는 방식이 아니라, 결과 영상을 자연어 대화로 다시 편집하는 반복적 워크플로우도 지원한다.
실세계 지식에 기반한(grounded) 비디오 생성은 물리 시뮬레이션을 직접 수행한다는 의미가 아니다. 대규모 세계 모델 학습을 통해 영상의 물리적 일관성을 유지하는 접근이다. 모든 생성 비디오에는 SynthID 디지털 워터마크가 자동으로 적용된다. AI 생성 콘텐츠의 진본 확인(authenticity verification), 딥페이크 대응, 콘텐츠 출처 추적을 고려한 설계다.
비용·실행 환경·생성 작업으로 나뉜 경쟁 구도
Gemini 3.5 Flash는 OpenAI GPT-4o mini와 Anthropic Claude Haiku가 자리한 비용 효율 고성능 티어를 겨냥한다. 다만 속도와 비용만 낮추기보다 에이전틱 추론 성능을 차별점으로 삼는다.
| 모델 | 주요 포지셔닝 | 경쟁 대상 | 핵심 차별점 |
|---|---|---|---|
| Gemini 3.5 Flash | 비용 효율 에이전트 | GPT-4o mini, Claude Haiku | 4x 속도, MCP 최적화 |
| Gemini Spark | 24/7 개인 에이전트 | Copilot, Siri Advanced | 백그라운드 자율 실행 |
| Gemini Omni | 멀티모달 비디오 생성 | Veo 3, Sora, Runway Gen-4 | anymodal 입력, 대화형 편집 |
Spark는 Apple Intelligence와 Microsoft Copilot+ PC의 온디바이스 AI 전략과 경쟁하면서도 디바이스에만 묶이지 않는다. 클라우드 인프라에서 24시간 움직이는 하이브리드 에이전트 구조를 취하며, Google Workspace와의 깊은 통합을 기업 사용자에게 제공한다.
이번 발표에서 드러난 변화는 단일 모델 중심의 경쟁에서 계층화된 에코시스템 경쟁으로의 이동이다. Flash의 속도와 비용 효율, Spark의 24시간 자율 실행, Omni의 멀티모달 생성은 서로 다른 사용자 요구와 시장 영역을 나눠 담당한다. 공통 사전학습 기반 위에 목적별 파인튜닝을 적용하는 모델 패밀리 아키텍처는 개발 효율과 성능 특화를 함께 추구하는 구조다.
Sources
- Google launches Gemini 3.5 Flash, Spark, Omni - Yahoo Tech
- Google unveils Gemini 3.5 Flash, Omni, and Spark - NewsBytesApp
- Google I/O 2026: Gemini 3.5 Flash, Omni, Spark - Latent Space
- Google introduces Gemini Omni, Gemini 3.5 Flash at I/O 2026 - The Tech Portal
- Google unveils AI model Gemini 3.5 and Gemini Spark - CNBC
- Google claims Gemini 3.5 Flash runs 4x faster - Interesting Engineering
- Google targets AI agents with Gemini 3.5 Flash and Omni - SiliconANGLE
- Innovations from Google I/O 26 on Google Cloud