Gemini 3.5 Flash 에이전틱 코딩 아키텍처와 MCP 통합
Gemini 3.5 Flash의 추론 최적화, MCP 도구 체인, 멀티모달 코드 파이프라인과 배치 배포 전략을 정리한다.
2026-08-14 · 최초 발행 2026-08-02
2026년 5월 19일 Google I/O 2026에서 공개된 Gemini 3.5 Flash는 에이전틱 코딩을 겨냥한 경량 모델이다. 이전 세대보다 4배 빠른 289 tok/s 추론 속도, Terminal-Bench 2.1 76.2%, MCP Atlas 83.6%를 제시했으며, 가격은 million 토큰당 $1.50/$9.00이다. Gemini 3.1 Pro보다 25% 저렴하다는 가격 조건과 코딩·멀티모달·도구 호출 성능을 함께 내세운다.
추론 속도보다 에이전트 루프 전체를 봐야 한다
Gemini 3.5 Flash의 4배 속도 향상은 하드웨어 확장만의 결과가 아니라 추론 파이프라인을 다시 설계한 결과로 설명된다. Go 재작성 기반의 Google Antigravity 분산 런타임에서 동작하며, 디코딩 단계 처리량은 289 tok/s다. 다만 도구 호출의 왕복 지연이 병목이 되므로 실제 에이전트 루프에서의 개선폭은 2~3배 수준으로 제시된다.
속도에 관여하는 요소는 스펙큘레이티브 디코딩, 연속 배치, KV 캐시 압축이다. 소형 드래프트 모델이 토큰 후보를 미리 만들고 Flash 본 모델이 병렬 검증하며, 병렬 서브태스크는 단일 추론 서버에서 동적으로 스케줄링된다. 계층적 캐싱은 1M 토큰 컨텍스트 윈도우를 관리하면서 장기 세션의 레이턴시 일관성을 유지하는 데 쓰인다.
이 구조는 플래너·실행자·검증자를 하나의 모델이 맡는 단일 모델 에이전트 루프를 전제로 한다. MCP Atlas 83.6%는 멀티스텝 도구 체인을 오류 없이 끝내는 신뢰성 지표로 제시되며, 잘못된 호출 순서나 형식 오류로 실패하던 문제를 겨냥한다.
이미지와 코드가 같은 작업 문맥에 들어올 때
코딩 에이전트에 시각적 문맥을 직접 전달하는 흐름도 이 모델의 적용 범위에 포함된다.
| 입력 유형 | 처리 방식 | 활용 사례 |
|---|---|---|
| 스크린샷 / UI 이미지 | media_resolution=high 파라미터 제어 |
UI 버그 자동 감지 및 코드 수정 |
| 다이어그램 / 아키텍처 도면 | CharXiv Reasoning 84.2% 성능 기반 | 다이어그램 → 코드 자동 생성 |
| PDF 문서 | 멀티모달 함수 응답 지원 | API 문서 파싱 → 코드 스캐폴딩 |
| 비디오 프레임 | 1M 토큰 컨텍스트 내 처리 | 영상 분석 기반 자동화 스크립트 생성 |
media_resolution의 low/medium/high/ultra high 설정은 비전 정밀도와 토큰 사용량을 조절한다. 비용에 민감한 배치 작업과 높은 품질이 필요한 대화형 워크플로우를 같은 모델에서 다루는 방식이다.
MCP 도구 체인과 CLI 실행 환경
Gemini 3.5 Flash는 MCP(Model Context Protocol)를 네이티브로 지원한다. MCP Atlas에서 기록한 83.6%는 복잡한 도구 체인 실행 능력을 공식적으로 검증받은 수치로 제시된다.
런타임에서 사용 가능한 도구를 찾아 선택하는 도구 발견, JSON Schema 인터페이스를 활용하는 스키마 기반 호출, 의존성이 없는 요청을 병렬 처리하는 비동기 도구 체인이 통합의 핵심이다. 후자는 에이전트 루프 전체 시간을 줄이는 데 사용된다.
Google I/O 2026에서 함께 발표된 오픈소스 Gemini CLI는 터미널에서 Gemini 3.5 Flash를 호출하는 도구다. gemini run, gemini agent, gemini batch 서브커맨드로 로컬 에이전틱 워크플로우를 구동할 수 있으며, Atlas 로컬 통합 모드에서는 로컬 파일시스템·터미널·브라우저를 도구로 등록해 Computer Use 패턴을 구현한다.
API에서 실행과 관찰을 분리하는 방식
다음 예시는 Python SDK에서 도구를 정의하고, 낮은 temperature와 스트리밍 응답으로 에이전트 루프를 실행하는 구성이다.
# Gemini 3.5 Flash 에이전틱 워크플로우 예시 (Python SDK)
import google.generativeai as genai
from google.generativeai.types import Tool, FunctionDeclaration
# 도구 정의
code_executor = Tool(function_declarations=[
FunctionDeclaration(
name="execute_code",
description="Python 코드를 안전한 샌드박스에서 실행",
parameters={
"type": "object",
"properties": {
"code": {"type": "string", "description": "실행할 Python 코드"},
"timeout": {"type": "integer", "description": "제한 시간(초)"}
}
}
)
])
model = genai.GenerativeModel(
model_name="gemini-3.5-flash",
tools=[code_executor],
generation_config={"temperature": 0.1} # 에이전틱 태스크는 낮은 temperature
)
# 에이전트 루프 실행
response = model.generate_content(
"주어진 CSV 데이터를 분석하고 이상치를 탐지하는 코드를 작성 후 실행하세요",
stream=True # 스트리밍으로 실시간 진행 상황 확인
)
배치 처리와 엔터프라이즈 배포의 비용 경로
Google Cloud의 Gemini Enterprise Agent Platform(구 Vertex AI Agent Builder)에서는 배치 처리와 실시간 추론을 함께 지원한다. 수천 개 에이전틱 태스크를 큐에 넣고 완료 결과를 수집하는 비동기 배치 API는 실시간 처리 대비 최대 50% 비용 절감을 목표로 한다.
공통 시스템 프롬프트와 코드베이스는 컨텍스트 캐싱 대상으로 두어 반복 처리의 입력 토큰 비용을 줄일 수 있다. 요청 라우팅에서는 복잡도가 낮은 작업을 Flash-Lite로, 고복잡도 에이전틱 작업을 Flash 3.5로 배분하는 계층형 구성을 사용한다.
Shopify는 I/O 2026에서 상점별 성장 예측 데이터 분석 서브에이전트를 병렬 실행한 사례를 발표했다. 기존에 수일 걸리던 분석 작업을 수 시간으로 단축했다는 내용이다.
| 플랫폼 | 통합 방식 | 주요 기능 |
|---|---|---|
| Google AI Studio | 직접 API 호출 | 프롬프트 엔지니어링·에이전트 프로토타이핑 |
| Android Studio | IDE 플러그인 | 코드 자동완성·리팩터링·테스트 생성 |
| GitHub Copilot | 외부 모델 통합 | PR 리뷰·코드 설명·버그 수정 |
| Vercel AI Gateway | 통합 엔드포인트 | 멀티모델 라우팅·비용 모니터링 |
| Google Antigravity | 분산 런타임 | 엔터프라이즈 스케일 배포·SLA 보장 |
경량 모델을 고를 때 비교할 조건
Gemini 3.5 Flash, GPT-5.5 Instant, Claude Haiku 4.5는 같은 경량 에이전틱 시장에서 서로 다른 운영 조건을 겨냥한다.
| 항목 | Gemini 3.5 Flash | GPT-5.5 Instant | Claude Haiku 4.5 |
|---|---|---|---|
| 출력 속도 | 289 tok/s (최고) | 약 200 tok/s | 가장 낮은 초기 레이턴시 |
| 컨텍스트 윈도우 | 1M 토큰 | 미공개(추정 200K) | 200K 토큰 |
| 입력 가격 | $1.50/1M | 미공개 | $1.00/1M |
| 출력 가격 | $9.00/1M | 미공개 | $5.00/1M |
| SWE-bench 코딩 | 76.2% (Terminal-Bench) | 88.7% 수준 | 73.3% |
| MCP/도구 호출 | MCP Atlas 83.6% | 우수 | 우수 |
| 멀티모달 | CharXiv 84.2% | 제한적 | 제한적 |
| 최적 사용 사례 | 장기 에이전틱·비전 통합 | 고난이도 코딩 | 대화형·낮은 레이턴시 |
대형 코드베이스 전체를 1M 토큰 이상 문맥으로 분석하거나, 스크린샷·다이어그램과 코드 생성을 결합하거나, 배치 워크플로우의 처리량이 우선이라면 Gemini 3.5 Flash가 맞는 조건으로 제시된다. Google Cloud와 Vertex 기반 인프라를 이미 사용 중인 경우도 해당한다.
낮은 TTFT가 중요한 실시간 챗 인터페이스, 출력 토큰 비용이 지배적인 짧은 응답 생성, Anthropic 기반 멀티에이전트 오케스트레이션 내부 작업은 Claude Haiku 4.5가 유리한 상황으로 분류된다. OpenAI 생태계의 Codex 및 고급 Function Calling 통합이 우선이거나 88.7% SWE-bench 수준의 고난도 코딩 작업이 필요하다면 GPT-5.5 Instant가 적합한 선택지다.
경량 에이전트 스택이 향하는 방향
Flash 3.5가 Gemini 3.1 Pro를 코딩·에이전틱 벤치마크에서 능가한 사례는 모델 크기와 성능이 비례한다는 전제가 약해지고 있음을 보여준다. 코딩, 에이전틱 태스크, 실시간 추론처럼 특정 도메인에서는 경량 모델이 대형 모델을 대체하는 흐름이 가속될 것으로 보인다.
MCP Atlas와 83.6%라는 결과는 도구 호출 표준화가 벤치마크를 넘어 프로덕션 에이전트의 신뢰성 지표가 되고 있음을 시사한다. 2026년 하반기에는 MCP 기반 에이전트 마켓플레이스와 도구 거버넌스 프레임워크가 주요 클라우드 벤더에서 출시될 것으로 전망된다.
비전과 코드의 결합도 IDE 플러그인과 CI/CD 파이프라인 수준에서 표준 기능으로 자리잡을 것으로 예상된다. CharXiv 84.2%는 기술 도식 이해가 인간 전문가에 근접했음을 보여주며, 아키텍처 다이어그램에서 인프라 코드로 이어지는 자동화 파이프라인의 실용화를 예고한다. 동급 경쟁 대비 25% 저렴한 $1.50/$9.00 구조는 대규모 에이전틱 워크플로우의 경제적 장벽을 낮추고, 중소 스타트업의 엔터프라이즈급 AI 에이전트 운영을 넓힐 것으로 예측된다.
Sources
- Gemini 3.5: frontier intelligence with action - Google Blog
- Gemini 3.5 Flash Launches at I/O 2026: Agentic Coding Benchmarks
- Gemini 3.5 Flash: Google's Fastest Agentic Model - DataCamp
- Gemini 3.5 Flash — Google DeepMind
- What's new in Gemini 3.5 Flash - Google AI for Developers
- Google Gemini 3.5 Flash: The Agentic Coding Model That's 4x Faster - Medium
- Innovations from Google I/O 26 on Google Cloud
- Google launches Gemini 3.5 Flash for enterprise workflows - InfoWorld
- Gemini 3.5 Flash vs Claude Haiku 4.5: Pricing & Production Fit (2026)
- Gemini Flash-Lite vs Haiku vs GPT-5.5 vs DeepSeek V4 - FindSkill.ai
- Google Introduces Gemini 3.5 Flash at I/O 2026 - MarkTechPost
- 100 things we announced at Google I/O 2026