Gemini 3.5 Flash 에이전틱 코딩 성능과 도입 판단

Gemini 3.5 Flash의 에이전틱 코딩 성능, MCP 도구 활용, 멀티모달 처리, 비용 구조와 Vertex AI 배포 판단 기준을 실무 관점에서 다룬다.

2026-08-14 · 최초 발행 2026-08-02

속도와 에이전트 성능을 함께 끌어올린 Flash

Google은 2026년 5월 19일 Google I/O 2026에서 Gemini 3.5 Flash를 GA(Generally Available)로 공개했다. 정식 모델 ID는 gemini-3.5-flash이며, 프리뷰 단계의 gemini-3-flash-preview를 대체한다.

이 모델은 Flash 시리즈의 속도·비용 지향성을 유지하면서 코딩과 에이전틱 작업에서는 플래그십급 성능을 내도록 설계됐다. 입력 컨텍스트는 1,048,576 토큰, 최대 출력은 65,536 토큰이다. 텍스트뿐 아니라 이미지·오디오·비디오를 단일 요청으로 처리한다.

가격은 입력 $1.50/1M 토큰, 출력 $9.00/1M 토큰이다. 캐시 입력에는 $0.15/1M 토큰이 적용된다.

벤치마크 결과를 이전 Gemini 모델과 나란히 놓으면 변화의 폭이 드러난다.

벤치마크 Gemini 3.5 Flash Gemini 3.1 Pro Gemini 3 Flash
Terminal-Bench 2.1 76.2% 74.8% 61.3%
MCP Atlas (도구 활용) 83.6% 79.1% 68.4%
CharXiv Reasoning 84.2% 82.7% 71.9%
GDPval-AA (Elo) 1656 1314 1204
출력 속도 289 tok/s 68 tok/s 171 tok/s

GDPval-AA Elo는 1656이다. Gemini 3 Flash의 1204보다 452포인트, Gemini 3.1 Pro의 1314보다 342포인트 높다. 속도를 앞세운 경량 모델이 실세계 에이전틱 태스크에서도 이전 Pro 모델을 넘어섰다는 점이 핵심이다.

추론 경로에서 줄인 지연과 반복 계산

이전 세대보다 4배 빠른 출력은 한 가지 최적화만으로 설명되지 않는다. Gemini 3.5 Flash는 추론 경로의 여러 병목을 함께 줄인다.

스펙큘레이티브 디코딩에서는 경량 드래프트 모델이 초안 토큰을 생성하고 메인 모델이 이를 병렬로 검증한다. 멀티턴 에이전틱 세션에서는 공통 접두사의 KV 캐시를 공유해 같은 계산을 되풀이하지 않는다.

Flash Attention 3 기반 커널은 타일링으로 HBM과 SRAM 사이의 데이터 이동을 줄인다. 4090급 GPU 기준 I/O 병목 절감 폭은 60%다. 토큰 효율도 Gemini 3 Flash 대비 68% 향상돼 같은 정보량을 더 짧은 시퀀스로 표현한다.

단일 멀티모달 입력캐시 히트캐시 미스289 tok/s 출력결과 반환사용자 요청(텍스트/이미지/오디오/비디오)입력 인코더(1M 컨텍스트 윈도우)KV 캐시 조회(캐시 히트 $0.15/1M)스펙큘레이티브 드래프트(경량 보조 모델)전체 프리필 처리(Flash Attention 3)병렬 검증·수락(메인 모델)에이전트 호출(MCP/Function Calling)최종 응답 생성

계획부터 검증까지 이어지는 코딩 루프

에이전틱 코딩은 코드 이해, 계획, 실행, 검증의 4단계 사이클로 진행된다. bash 명령의 실행 결과를 다시 컨텍스트에 넣어 수정 작업을 반복할 수 있고, 변경분은 unified diff 형태로 출력해 CI/CD 파이프라인에 연결할 수 있다.

Google이 공개한 Managed Agents API는 상태를 보존하는 에이전트 환경이다. 장시간 작업의 컨텍스트를 유지하면서 격리된 Linux 샌드박스에서 자율 에이전트를 실행하는 데 쓰인다.

"외부 도구/MCP""Linux 샌드박스""Gemini 3.5 Flash Agent""개발자""외부 도구/MCP""Linux 샌드박스""Gemini 3.5 Flash Agent""개발자"코딩 태스크 요청계획 수립 (Plan)코드 실행실행 결과·오류MCP 도구 호출 (파일시스템/Git/검색)도구 응답결과 검증·재계획최종 코드·diff 반환

코드와 시각·음성 입력을 한 요청에서 다루는 방식

멀티모달 입력은 코드 생성 파이프라인의 앞단을 넓힌다. 스크린샷으로 전달한 UI를 코드로 옮기거나, 다이어그램을 구현으로 변환하고, PDF 사양서에서 코드를 생성하는 작업을 하나의 API 요청으로 처리할 수 있다.

차트·그래프·수식 이미지를 대상으로 한 CharXiv Reasoning 점수는 84.2%다. 영상으로 녹화한 버그 재현 과정을 입력하면 원인을 분석하고 수정 코드를 제시할 수 있으며, 음성 요구사항을 코드로 바꾸는 보이스-투-코드(Voice-to-Code) 워크플로우도 지원한다.

MCP 중심의 도구 오케스트레이션

MCP Atlas 점수는 83.6%로, 2위와의 차이는 4.5포인트다. Google이 도구 오케스트레이션을 모델의 핵심 학습 목표로 삼았음을 보여주는 결과다.

Google CLI에는 MCP 서버 지원이 기본 탑재돼 별도 라이브러리 없이 MCP 프로토콜을 사용할 수 있다. 공식 Antigravity SDK는 병렬 실행 프리미티브와 자동 캐싱 설정, MCP 서버 통합을 Gemini 3.5 Flash에 추가한다.

에이전트는 한 응답에서 여러 MCP 도구를 병렬로 호출할 수 있다. I/O 대기 시간을 줄이는 동시에, 같은 도구 호출 결과를 세션 안에서 재사용해 토큰 비용도 낮추는 구조다.

에이전틱 코딩 파이프라인 설계

Gemini 3.5 Flash를 오케스트레이터로 두고 파일시스템·Git·검색 MCP를 실행 계층에 연결하면 다음과 같은 흐름을 구성할 수 있다.

MCP 도구 호출MCP 도구 호출MCP 도구 호출품질 기준 미달품질 기준 충족태스크 입력(코드/이슈/요구사항)Orchestrator(Gemini 3.5 Flash)파일시스템 MCPGit MCP검색 MCP결과 통합·검증(Gemini 3.5 Flash)PR 생성·CI 트리거

계획과 실행을 같은 모델에 모두 맡길 필요는 없다. 계획(Planning)은 Gemini 3.5 Flash가 담당하고, 단순 실행(Execution)은 더 저렴한 Gemini Flash Lite로 보내는 계층형 구성이 가능하다.

장시간 실행되는 작업에는 Managed Agents API의 상태 보존 세션을 적용한다. 컨텍스트는 1M까지 사용할 수 있지만 출력 가격이 $9/1M이므로, 코드베이스와 작업 단위를 나누는 청킹 전략이 필요하다. 파일 조회나 검색처럼 I/O에 묶인 MCP 호출은 병렬로 보내 에이전트 루프의 지연을 줄인다.

비용을 통제하는 모델 계층화와 배치 처리

반복해서 쓰는 시스템 프롬프트와 코드베이스 문서는 캐시에 두는 편이 낫다. 캐시 입력 가격은 $0.15/1M이며, 이를 최대한 활용하면 토큰 비용을 90% 절감할 수 있다.

작업 난도에 따른 모델 배치 기준은 다음과 같다.

  • 복잡한 설계와 디버깅은 Gemini 3.5 Flash에 맡긴다.
  • 단순 코드 완성과 포맷팅은 Gemini Flash Lite로 보낸다.
  • 플래그십 추론이 필요한 작업에는 별도 모델인 Gemini 3.5 Pro를 사용한다.

테스트 생성이나 문서화처럼 즉시 결과를 받을 필요가 없는 태스크는 배치 API로 제출해 비용을 50% 절감할 수 있다. Gemini 3 Flash 대비 토큰 효율이 68% 개선됐다는 점도 반복 처리량과 비용을 계산할 때 반영해야 한다.

Google Cloud 안에서의 배포 경로

Vertex AI와 Gemini Enterprise Agent Platform은 IAM, VPC-SC, 감사 로그, 파인튜닝 워크플로우, Agent Builder 파이프라인을 함께 제공한다.

개발과 프로토타이핑에는 AI Studio의 Gemini API를 사용할 수 있다. 엔터프라이즈 보안과 컴플라이언스가 필요한 환경은 Vertex AI가 대상이며, 모바일·웹 앱에 직접 연결할 때는 Firebase AI Logic을 선택할 수 있다.

보안 통제는 VPC Service Controls, CMEK, DLP API와 Vertex AI 엔드포인트 격리를 조합한다. 도메인별 코딩 스타일과 컨벤션을 학습시켜야 한다면 Supervised Fine-Tuning(SFT)을 적용할 수 있다.

Gemini 3.1에서 옮길 때 확인할 차이

API 호환성이 유지되므로 Gemini 3.1에서 Gemini 3.5 Flash로 전환할 때는 대부분 모델 ID 변경으로 대응할 수 있다. 다만 성능과 가격, 지원 기능은 별도로 확인해야 한다.

항목 Gemini 3.1 (이전) Gemini 3.5 Flash (현재)
모델 ID gemini-3-flash-preview gemini-3.5-flash
컨텍스트 1M 토큰 1M 토큰 (동일)
출력 속도 ~70 tok/s ~289 tok/s
가격 (입력) $0.35/1M $1.50/1M
가격 (출력) $1.40/1M $9.00/1M
Computer Use 지원 미지원 (preview 유지)

Computer Use API는 gemini-3.5-flash로 마이그레이션할 수 없다. 이 기능을 사용한다면 gemini-3-flash-preview를 유지해야 한다. 가격도 약 3~6배 인상됐으므로 실제 사용량을 기준으로 비용을 먼저 계산해야 한다. 멀티모달 입력 API 시그니처는 같아 관련 코드 변경은 필요하지 않다.

경쟁 모델과 나란히 본 선택 기준

Gemini 3.5 Flash, GPT-5.5 Instant, Claude Haiku 4.5는 속도와 코딩 성능, 컨텍스트, 가격에서 서로 다른 강점을 보인다.

항목 Gemini 3.5 Flash GPT-5.5 Instant Claude Haiku 4.5
출력 속도 289 tok/s ~95 tok/s ~210 tok/s
컨텍스트 1M 토큰 200K 토큰 200K 토큰
MCP Atlas 83.6% 75.3% 68.1%
Terminal-Bench 2.1 76.2% 82.4% 73.3%
SWE-bench 68.1% 74.2% 73.3%
가격 (입력/1M) $1.50 $4.90 $1.00
가격 (출력/1M) $9.00 $14.70 $5.00
멀티모달 텍스트·이미지·오디오·비디오 텍스트·이미지 텍스트·이미지
종합 지수 86 79 56

MCP 오케스트레이션과 비디오·오디오를 포함한 멀티모달 에이전트에는 MCP Atlas 1위, 1M 컨텍스트를 갖춘 Gemini 3.5 Flash가 유리하다. 터미널 코딩과 DevOps 자동화에서는 Terminal-Bench 82.4%인 GPT-5.5 Instant가 앞선다.

코딩 품질과 SWE-bench를 기준으로 보면 Claude Haiku 4.5가 73.3%와 낮은 가격으로 강점을 갖는다. 처리량이 우선인 고볼륨 배치에서는 289 tok/s로 3배 이상 고속인 Gemini 3.5 Flash가 선택지가 된다.

멀티모달 입력 필요(비디오·오디오 포함)MCP 다중 도구오케스트레이션터미널 명령 실행컴퓨터 제어코드 리뷰·PR 생성단일 파일 변경고볼륨 배치비용 최우선에이전트 워크플로우요구사항 분석Gemini 3.5 FlashGPT-5.5 InstantClaude Haiku 4.5Google CloudVertex AI 배포Azure OpenAI배포AWS Bedrock배포

플랫폼 선택은 벤치마크만으로 끝나지 않는다

모델을 고를 때는 코딩·추론·멀티모달 벤치마크가 실제 워크로드와 맞는지 먼저 확인해야 한다. 비용은 토큰당 가격에 예상 사용량과 캐싱 효과를 함께 반영한다.

운영 측면에서는 기존 GCP·AWS·Azure 거버넌스 정책과의 결합이 중요하다. 동시 에이전트 수, 평균 컨텍스트 길이, 피크 처리량으로 확장성을 모델링하고 데이터 거주 요건, CMEK 기반 암호화 키 관리, 감사 로그도 검토 대상에 넣는다.

Gemini 3.5 Flash는 VPC-SC, IAM, 감사 로그를 포함한 GCP 거버넌스와 통합된다. 1M 토큰 컨텍스트는 대형 코드베이스 처리에 유리하고, MCP 네이티브 지원은 도구 연결 방식을 표준화한다. 이런 조건이 필요한 GCP 기반 엔터프라이즈 에이전트 플랫폼에서는 우선 검토할 후보가 된다.

이어질 변화와 현재의 제약

Flash 시리즈가 Pro를 추격하는 흐름은 이어질 전망이다. Gemini 3.5 Flash가 Gemini 3.1 Pro를 넘어선 것처럼 차기 Flash 모델도 코딩·에이전틱 영역에서 현재 Pro 모델을 다시 능가할 가능성이 있다.

현재 gemini-3.5-flash에서 빠진 Computer Use API는 향후 버전에 통합될 가능성이 있으며, 이는 데스크톱 자동화 에이전트의 주류화와 연결된다. Google, Anthropic, OpenAI가 모두 MCP를 핵심 에이전트 인터페이스로 채택하면서 벤더에 종속되지 않는 에이전트 스택을 구성할 가능성도 커지고 있다.

Flash 시리즈의 경량화가 엣지 배포까지 확장되면 온디바이스와 클라우드를 결합한 오프라인 에이전틱 코딩 지원이 등장할 수 있다. 가격 측면에서는 Claude Haiku 4.5의 $1.00/$5.00와 격차를 줄이기 위한 Gemini 3.5 Flash의 가격 인하 압력이 이어질 전망이다.

Gemini 3.5 Flash는 4배 속도, 1M 컨텍스트, MCP 네이티브 통합을 한 모델에 묶었다. 에이전틱 코딩과 멀티모달 오케스트레이션에서는 분명한 선택 근거가 있지만, Computer Use 미지원과 3~6배 인상된 가격은 도입 전에 비용과 작업 적합성을 따져야 할 제약이다.

Sources

Gemini 3.5 Flash에이전틱 코딩MCP멀티모달 AIVertex AI