Gemini 3.5 Flash가 바꾼 코딩 에이전트 모델 선택
Gemini 3.5 Flash의 희소 MoE와 온폴리시 증류, 코딩·에이전트 성능 및 비용 구조를 실무 관점에서 분석한다.
2026-08-14 · 최초 발행 2026-08-02
경량 모델이 플래그십을 앞선 지점
2026년 5월 Google I/O에서 공개된 Gemini 3.5 Flash는 코딩과 에이전트 작업에서 기존 모델 라인업의 위계를 뒤집었다. Terminal-Bench 2.1 점수는 76.2%로, 이전 세대 플래그십인 Gemini 3.1 Pro의 70.3%보다 5.9%p 높다. 토큰 생성 속도는 4배 빠르다.
Flash 계열은 그동안 빠른 응답을 얻는 대신 성능을 일부 포기하는 모델로 받아들여졌다. 이번 결과는 적어도 코딩과 에이전트 영역에서는 모델 규모만으로 우열을 판단하기 어렵다는 점을 보여준다.
비슷한 변화는 오픈소스 진영에서도 나타났다. 2026년 2월 Qwen3.5가 MMMU에서 GPT-5를 추월했다. 다만 Gemini 3.5 Flash는 서로 다른 공급자의 모델을 비교한 사례가 아니라, 같은 공급자 안에서 경량 라인이 플래그십을 추월한 첫 사례라는 점에서 의미가 다르다.
계산량을 줄이고 필요한 능력에 집중한 설계
Gemini 3.5 Flash는 Gemini 3 Pro의 트랜스포머 기반 희소 혼합 전문가(Sparse Mixture-of-Experts, MoE) 설계를 이어받았다. 입력 토큰이 들어오면 라우터가 이를 전문화된 하위 네트워크인 Expert에 동적으로 배분한다. 추론 과정에서는 전체 파라미터가 아니라 선택된 일부만 활성화되므로 모델의 총용량과 실제 계산 비용을 분리할 수 있다.
Flash는 Pro보다 활성화하는 Expert 수와 레이어 깊이를 줄이는 대신, 코딩과 에이전트 작업에서 자주 접하는 패턴을 담당하는 Expert에 가중치를 집중한다. 모든 종류의 추론 능력을 같은 수준으로 유지하려는 설계가 아니라, 목표 작업에서 처리 효율을 높이는 선택이다.
여기에 온폴리시 증류(on-policy distillation)가 결합된다. 대형 교사 모델인 Gemini 3.5 Pro의 출력을 이용해 학생 모델을 학습하되, 학생 모델이 실제로 생성하는 분포를 교정 대상으로 삼는다. 단순 지식 증류보다 일반화 성능을 높이고 특정 태스크 분포의 품질을 보존하는 데 유리한 방식이다.
학습 데이터도 코딩과 에이전트 작업에 맞춰 구성됐다. 터미널 명령 실행, 여러 단계의 도구 호출, 코드 저장소 디버깅처럼 실제 에이전트 루프에서 반복되는 시나리오를 강화 학습으로 미세 조정했다.
벤치마크가 보여주는 강점과 경계
공개된 결과를 함께 놓으면 Flash가 어느 작업에 초점을 맞췄는지 분명해진다.
| 벤치마크 | 측정 대상 | Gemini 3.5 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| Terminal-Bench 2.1 | 코딩 성능 | 76.2% | 70.3% |
| GDPval-AA | 실세계 에이전트 성능 | 1656 Elo | — |
| MCP Atlas | 스케일 도구 사용 신뢰성 | 83.6% | — |
| CharXiv Reasoning | 멀티모달 이해력 | 84.2% | — |
Terminal-Bench 2.1의 5.9%p 격차는 코딩 작업에서 Flash가 플래그십을 대체할 수 있는 수준에 도달했다는 근거다. GDPval-AA Elo 1656은 실세계 에이전트 루프의 작업 완료율과 정확도를 종합한 지표로, 자동화 파이프라인에 적용할 모델을 판단할 때 참고할 수 있다.
MCP Atlas에서는 83.6%를 기록했다. 복잡한 MCP 기반 파이프라인에서 도구 호출을 수행하는 능력을 보여주는 결과다. 코드 저장소 디버깅, 데이터시트 분석, 여러 도구를 잇는 작업에서 플래그십 없이도 필요한 품질을 확보할 수 있다는 의미가 있다. CharXiv Reasoning 점수는 84.2%로, 경량화하면서도 멀티모달 이해력을 유지했다.
다만 이 결과를 모든 워크로드의 플래그십 대체로 해석해서는 안 된다. 심층 추론이나 초장문 컨텍스트 회상이 필요한 고복잡도 작업에서는 출시 예정인 Gemini 3.5 Pro가 여전히 우위를 보일 것으로 예상된다. Flash의 역전 범위는 코딩과 에이전트 작업이다.
에이전트 루프에서는 지연이 비용이 된다
에이전트는 한 번의 응답으로 작업을 끝내지 않는다. 모델 추론과 도구 호출을 여러 차례 반복하므로 각 단계의 대기 시간이 전체 완료 시간에 누적된다. 단계가 늘어날수록 전체 태스크 완료 시간은 선형 이상으로 증가한다.
Gemini 3.5 Flash의 토큰 생성 속도가 4배 빨라지면, 도구 호출 100회가 필요한 태스크에서 LLM 대기 시간은 실질적으로 75% 줄어든다. 실제 벽시계 시간의 개선 폭은 이보다 작다. 도구 왕복 지연도 큰 비중을 차지하기 때문에 순수 토큰 속도의 4배 차이가 전체 작업에서는 2~3배 수준으로 나타난다. 그래도 대규모 서빙 환경에서는 운영 비용을 수십 퍼센트 낮출 수 있는 차이다.
따라서 에이전트 모델을 고를 때는 단일 응답의 품질만 비교해서는 부족하다. 여러 단계의 도구 호출을 끝까지 수행하는 신뢰성, 반복 추론의 지연, 전체 작업 단위의 비용을 함께 봐야 한다.
가격과 처리량이 만드는 선택 기준
Gemini 3.5 Flash의 API 가격은 Gemini 3.1 Pro보다 40% 저렴하며, 공식 API의 입력 토큰과 출력 토큰 모두에 이 차이가 적용된다. 토큰 사용량이 많은 코딩과 에이전트 워크로드에서는 같은 예산으로 처리할 수 있는 작업량이 늘어난다.
동일 예산의 처리량을 Gemini 3.1 Pro 기준 1x로 놓으면 Gemini 3.5 Flash는 약 2.3x다. 여기에 배치 API(Batch API)를 사용하면 추가 50% 할인이 적용되고, 컨텍스트 캐싱은 반복 프롬프트 비용을 최대 90%까지 줄일 수 있다. 실시간 응답이 필요하지 않은 오프라인 분석 파이프라인이라면 Flash와 배치 API의 조합을 검토할 만하다.
플래그십을 기본 모델로 지정해 온 환경에서는 비용 구조를 다시 계산할 필요가 있다. Flash로 전환하는 것만으로 성능을 유지하거나 개선하면서 운영 비용을 30~60% 절감할 수 있다.
다른 경량 모델과 구분되는 위치
2026년의 경량 고효율 모델 경쟁은 Google만의 흐름이 아니다. OpenAI의 GPT-4.1 mini는 빠른 응답과 낮은 비용을 내세우지만, 에이전트 도구 호출 신뢰성에서는 Gemini 3.5 Flash의 도전을 받고 있다.
Anthropic의 Claude Sonnet 계열은 코딩 품질에 강점이 있고 Haiku가 경량 라인에 해당한다. 다만 Flash 수준의 속도 우위는 아직 확인되지 않았다. Alibaba의 Qwen3.5는 MMMU에서 GPT-5를 추월하며 오픈소스 경량 모델의 가능성을 넓혔다. Meta의 Llama 계열은 오픈소스 경량 모델의 베이스라인이자 엣지 AI 배포 선택지로 남아 있다.
Gemini 3.5 Flash의 차별점은 경쟁사의 플래그십을 앞섰다는 데 있지 않다. Google 내부의 상위 라인인 Gemini 3.1 Pro를 특정 작업에서 공식적으로 추월했다는 데 있다.
모델 등급보다 워크로드를 먼저 본다
코드 생성, 자동화 파이프라인, 에이전트 루프에서는 플래그십을 무조건 기본값으로 둘 이유가 줄었다. 저지연이 필요한 실시간 고객 서비스, 코드 자동 완성, 자율 데이터 분석에서도 Flash 계열이 더 적합할 수 있으며, 이런 지연 민감 작업에서 사실상 표준이 될 전망이다.
그렇다고 모델 라인업의 위계가 완전히 사라진 것은 아니다. 범용 추론과 고복잡도 작업은 Pro가 맡고, 반복 호출과 도구 사용이 많은 작업은 Flash가 맡는 식으로 역할이 나뉠 가능성이 크다. 모델 이름에 붙은 등급보다 실제 태스크 분포를 기준으로 선택해야 한다.
Gemini 3.5 Flash가 사용한 양자화, 증류, MoE 설계와 비용·성능 트레이드오프는 AI 모델 최적화를 이해하는 실무 사례이기도 하다. 희소 MoE, 온폴리시 증류, 태스크 특화 학습의 조합은 4배 빠른 속도와 40% 비용 절감을 만들었고, 코딩과 에이전트 영역에서 이전 플래그십을 넘어섰다.
Sources
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5/
- https://www.datacamp.com/blog/gemini-3-5-flash
- https://www.marktechpost.com/2026/05/20/google-introduces-gemini-3-5-flash-at-i-o-2026-a-faster-and-cheaper-model-for-ai-agents-and-coding/
- https://www.engadget.com/2176592/google-says-gemini-3-5-flash-rivals-large-flagship-models-for-coding-and-agentic-tasks/
- https://www.mindstudio.ai/blog/gemini-3-5-flash-vs-gemini-3-1-pro-comparison
- https://www.nxcode.io/resources/news/gemini-3-5-flash-complete-guide-benchmarks-pricing-api-2026
- https://openrouter.ai/google/gemini-3.5-flash
- https://www.androidauthority.com/google-gemini-3-5-flash-3668559/
- https://dev.to/thousand_miles_ai/gemini-35-flash-beat-31-pro-on-coding-and-agents-1chk
- https://ofox.ai/blog/gemini-3-5-flash-coding-agents-guide-2026/
- https://medium.com/@302.AI/outperforming-3-1-d9ed9d1b6626
- https://www.mindstudio.ai/blog/what-is-gemini-3-5-flash-2
- https://bdtechtalks.substack.com/p/what-i-think-makes-gemini-3-flash
- https://ai.google.dev/gemini-api/docs/pricing
- https://www.visionhong.com/blog/vision-llm-landscape-2026