Gemini 3.5 Flash 에이전트 코딩 성능과 추론 최적화
Gemini 3.5 Flash의 에이전트 코딩 성능을 바탕으로 도구 호출, 자기 수정, 캐시·양자화·디코딩 최적화와 비용 경쟁력을 분석한다.
2026-08-14 · 최초 발행 2026-05-24
터미널과 외부 도구를 오가는 모델
Google I/O 2026에서 공개된 Gemini 3.5 Flash는 Terminal-Bench 76.2%, MCP Atlas 83.6%를 기록하며 두 에이전트 코딩 벤치마크에서 이전 세대 Pro 모델을 앞섰다. 입력 $1.50·출력 $9.00(1M 토큰 기준)으로, 경쟁 모델 대비 절반에서 3분의 1 수준인 가격도 함께 제시됐다.
에이전트 코딩은 한 번의 프롬프트로 답을 생성하는 작업과 다르다. 명령을 실행하고 환경을 관찰한 뒤, 결과에 따라 계획을 고치는 과정이 반복된다. Gemini 3.5 Flash의 성능은 단순 추론 능력보다 이 반복 구조에 맞춘 최적화에서 나온다.
Terminal-Bench는 Bash 환경에서 파일 조작, 패키지 설치, 빌드 파이프라인 구성, 테스트 실행을 연속으로 처리하는 능력을 평가한다. 기존 모델은 긴 stdout과 stderr 스트림을 컨텍스트에 그대로 쌓으면서 토큰을 낭비하고 주의가 분산되는 문제가 있었다. Gemini 3.5 Flash는 스트림 압축 어텐션(Stream-Compressed Attention) 으로 반복되는 출력 패턴을 요약 임베딩으로 바꾼다.
MCP(Model Context Protocol) Atlas는 20개 이상의 외부 도구를 적절히 라우팅하고, 각 응답을 다음 계획에 반영하는 능력을 측정한다. 이 모델은 모든 도구 스키마를 컨텍스트에 정적으로 넣는 대신 런타임에 필요한 메타데이터를 조회하는 지연 도구 바인딩(Lazy Tool Binding) 을 사용한다. 수백 개 도구를 다루면서도 불필요한 스키마가 컨텍스트를 차지하지 않도록 한 구조다.
실패를 다음 계획으로 되돌리는 자기 수정
실행 실패를 감지해 전략을 바꾸는 자기 수정 루프(Self-Correction Loop) 는 벤치마크 성능을 좌우한 요소다. Gemini 3.5 Flash는 별도의 계획 토큰(Plan Token) 예산을 두고, 실행 과정에서 관찰한 오류 신호를 계획 레이어로 즉시 역전파한다.
강화학습 미세조정(RLHF)에서는 에이전트 트레이스 리플레이(Agent Trace Replay) 데이터셋으로 이 메커니즘을 훈련했다. 과거 실행에서 나타난 실패 패턴을 반영해 같은 오류를 반복하지 않도록 만드는 방식이다.
디버깅 훈련에는 GitHub의 실제 버그 수정 커밋 쌍(Before/After Diff)이 대규모로 포함됐다. 스택 트레이스와 린터 경고, 단위 테스트 실패 메시지를 구조화된 오류 신호로 해석하고 최소 변경 원칙(Minimal Diff Principle) 에 따라 패치를 생성하도록 최적화했다. 코드 전체를 다시 만드는 대신 오류 맥락을 유지하면서 필요한 라인을 정밀하게 수정하는 데 초점을 맞춘 접근이다.
Flash 가격을 가능하게 한 추론 경로
Pro 수준의 에이전트 성능을 Flash 가격으로 제공하려면 모델의 출력 품질만큼 추론 과정의 자원 사용을 줄여야 한다. Gemini 3.5 Flash는 캐시, 배치 처리, 양자화와 디코딩을 서로 분리된 기법으로 두지 않고 하나의 추론 경로에 결합했다.
KV 캐시 공유(Shared KV Cache) 는 여러 에이전트 세션이 공통 시스템 프롬프트와 도구 스키마를 재사용하게 한다. 에이전트 작업에서는 이 두 항목이 전체 컨텍스트의 30~50%를 차지하므로, 캐시 재사용으로 실제 연산 토큰을 크게 줄일 수 있다.
도구가 실행되는 동안에는 GPU가 쉬는 구간이 자주 생긴다. 동적 배치 처리(Dynamic Batching) 는 짧은 도구 응답 처리 요청을 마이크로배치로 묶고, 그 사이에 다른 세션의 요청을 배치해 처리량을 유지한다.
양자화는 모든 레이어에 동일한 정밀도를 강제하지 않는다. INT8/FP8 혼합 양자화(Quantization) 를 바탕으로 어텐션 헤드의 민감도에 따라 레이어별 정밀도를 달리한다. 도구 스키마 파싱처럼 정밀도 요구가 낮은 레이어는 INT4까지 낮추고, 자기 수정처럼 추론 정확도가 필요한 레이어는 FP16을 유지한다. 품질 손실 없이 메모리 대역폭을 줄이기 위한 설계다.
예측 가능한 도구 호출을 먼저 생성한다
스펙큘레이티브 디코딩(Speculative Decoding) 에서는 작은 드래프트 모델이 여러 토큰을 먼저 예측하고 메인 모델이 이를 병렬로 검증한다. 에이전트 루프에서 반복되는 JSON 도구 호출 형식은 일반 텍스트보다 패턴을 예측하기 쉽다. Gemini 3.5 Flash는 이 특성을 이용해 높은 드래프트 수락률과 빠른 디코딩을 얻는다.
호출자는 토큰 예산 관리(Token Budget API) 로 최대 출력 토큰, 계획 토큰 비율, 도구 호출 최대 횟수를 미리 설정할 수 있다. 모델은 정해진 예산 안에서 전략을 선택하고, 운영자는 API 비용을 예측 가능한 범위에서 관리한다.
에이전트 작업에서는 각 단계가 연속되기 때문에 한 번의 응답 지연이 전체 실행 시간으로 누적된다. 스트리밍 도구 호출(Streaming Tool Call) 은 JSON 파라미터가 완성되기 전부터 오케스트레이터가 파싱을 시작하게 한다. 모델 생성과 도구 실행 대기 시간을 일부 겹쳐 전체 루프를 단축하며, 대규모 에이전트 파이프라인에서는 단계당 평균 200~400ms를 줄이는 것으로 보고된다.
이전 Pro 모델과 벌어진 차이
Gemini 3.1 Pro의 기록은 Terminal-Bench 71.4%, MCP Atlas 79.2%였다. Gemini 3.5 Flash는 각각 4.8%p와 4.4%p 높다. 모델 규모를 키운 결과라기보다 에이전트 작업에 맞춘 파인튜닝의 영향으로 해석된다. 멀티스텝 계획 수립 부문에서 3.1 Pro와 7%p 이상의 격차가 난 점도 Agent Trace Replay 훈련 데이터의 효과를 반영한다.
컨텍스트 창은 1M 토큰을 유지한다. 긴 코드베이스를 한 번에 적재하는 작업에서도 KV 캐시 공유로 실제 연산 토큰을 줄여 Pro 모델보다 실질적인 비용 우위를 확보하는 전략이다.
경쟁 모델 사이의 비용과 성능
2026년 5월 기준 주요 에이전트 모델의 Terminal-Bench 성능과 입력 가격을 함께 놓으면 Gemini 3.5 Flash의 위치가 선명해진다.
Claude Sonnet 4.6의 입력 가격은 $3.00/1M이다. Gemini 3.5 Flash는 그 절반인 $1.50에 Terminal-Bench에서 2%p 높은 성능을 기록했다. GPT-5.5 Instant의 입력 가격 $2.50/1M과 비교하면 40% 저렴하면서 성능은 4.4%p 높다.
모든 평가에서 앞선 것은 아니다. Claude Sonnet 4.6은 코드 품질 평가인 HumanEval+와 자연어 추론 평가인 MMLU Pro에서 여전히 우위를 유지한다. Gemini 3.5 Flash의 강점은 범용 추론 전반보다 에이전트 루프의 효율에 집중돼 있다.
모델 크기보다 실행 루프가 경쟁력이 된다
경량 에이전트 모델의 경쟁은 범용 벤치마크 순위만으로 설명하기 어려워졌다. Terminal-Bench, SWE-Bench, MCP Atlas처럼 실제 에이전트 작업을 겨냥한 지표가 모델 간 차이를 드러내기 시작했다.
가격 경쟁도 추론 인프라와 직접 연결된다. 양자화와 캐싱, 스펙큘레이티브 디코딩으로 낮춘 원가가 API 가격에 반영되고, 그 가격이 다시 채택의 기준이 된다. 여기에 MCP 표준 지원, Vertex AI Agent Builder 통합, Google Workspace 연동처럼 생태계 접근성을 넓히는 작업이 더해진다.
Gemini 3.5 Flash는 에이전트 코딩에 맞춘 구조와 여러 층의 추론 최적화를 결합해 경량 모델이 Pro 성능을 넘어설 수 있음을 보여줬다. Terminal-Bench와 MCP Atlas의 결과가 가리키는 방향도 같다. 앞으로의 경쟁은 모델의 파라미터 수뿐 아니라 개발자 워크플로우에 얼마나 깊이 연결되는지, 그리고 반복 실행을 얼마나 효율적으로 처리하는지에 따라 달라질 전망이다.
Sources
- Google I/O 2026 - Gemini 3.5 Flash 공식 발표
- Google DeepMind - Gemini 3.5 Technical Report
- Terminal-Bench: Evaluating LLMs in Terminal Environments
- Model Context Protocol (MCP) Atlas Benchmark
- Gemini API Pricing - Google AI Studio
- SWE-bench: Can Language Models Resolve Real-world Github Issues?
- Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation
- Anthropic - Claude Sonnet 4.6 Model Card