Qwen 3.5: 16일 만에 9개 모델을 낸 오픈소스 에이전틱 AI 롤아웃

알리바바가 16일 만에 9개 출시한 Qwen 3.5 오픈소스 에이전틱 AI 시리즈의 Qwen3-Next 하이브리드 아키텍처, 모델 라인업, 벤치마크, 오픈소스 전략을 정리한다.

2026-08-14 · 최초 발행 2026-03-15

알리바바 클라우드의 Qwen 팀이 2026년 2월, 에이전틱 AI 시대를 위해 설계된 Qwen 3.5 시리즈를 전격 공개했다. 16일 만에 9개의 모델을 출시하는 전례 없는 속도의 오픈소스 AI 롤아웃이었다. 397억 파라미터 규모의 플래그십 모델부터 노트북에서 실행 가능한 소형 모델까지, Qwen 3.5는 멀티스텝 자율 에이전트 워크플로 수행에 최적화된 아키텍처로 ChatGPT, Claude 등 유료 프론티어 모델을 여러 벤치마크에서 앞서는 성과를 보이며 AI 오픈소스 생태계의 새로운 기준점을 세웠다.

채팅 완성이 아니라 에이전트 워크플로를 위한 설계

Qwen 3.5의 핵심 차별점은 "에이전틱 AI 시대를 위한 설계"라는 명확한 방향성에 있다. 기존 LLM이 단발성 질의응답(채팅 완성)에 최적화되어 있었다면, Qwen 3.5는 계획 수립, 웹 검색, 도구 사용, 코드 실행 등 여러 단계를 자율적으로 수행하는 에이전트 워크플로를 네이티브로 지원한다.

이를 뒷받침하는 구체적 지표가 있다. Qwen 3.5-397B는 32K 컨텍스트에서 Qwen3-Max 대비 8.6배 빠른 디코딩 속도를 달성했으며, 256K 컨텍스트에서는 무려 19배 빠르다. 에이전트가 긴 작업 이력을 컨텍스트로 유지하며 다단계 추론을 수행할 때, 이 속도 차이는 실용적 배포 가능성에 직결된다.

프레임워크 호환성도 폭넓다. OpenClaw, Claude Code, LangChain, AutoGen을 포함한 주요 에이전틱 프레임워크와 호환되며, 오픈소스 Apache 2.0 라이선스 하에 제공되어 상업적 활용에도 제약이 없다.

Qwen3-Next: 선형 어텐션과 MoE의 융합

Qwen 3.5의 아키텍처적 혁신은 "Qwen3-Next"라 불리는 하이브리드 설계에 있다. 이 아키텍처는 통상 별개로 사용되던 두 가지 기법을 결합한다.

첫째, Gated Delta Networks를 통한 선형 어텐션(Linear Attention)이다. 기존 트랜스포머의 표준 어텐션 메커니즘은 시퀀스 길이에 따라 계산 비용이 제곱으로 증가하는 한계가 있다. 선형 어텐션은 이를 선형으로 낮추어 긴 컨텍스트 처리에서 효율성을 크게 개선한다.

둘째, 희소 Mixture-of-Experts(MoE) 시스템이다. 397억 총 파라미터 중 실제 추론 시 활성화되는 파라미터는 170억에 불과하다. 이 희소 활성화 구조는 대형 모델의 지식 용량을 유지하면서도 실제 계산 부담을 소형 모델 수준으로 낮춘다.

두 기법의 결합 결과는 인상적이다. 전 세대 플래그십인 Qwen3-235B-A22B 대비 표준 컨텍스트에서 3.5배 빠르고, 더 적은 자원으로 더 나은 성능을 낸다.

Qwen 3.5 시리즈(2026.02 출시)Qwen3.5-Flash경량 프로덕션용Qwen3.5-27B고밀도 범용Qwen3.5-35B-A3BMoE 효율 특화Qwen3.5-122B-A10B장문 컨텍스트 특화Qwen3.5-397B최대 플래그십35B 파라미터3B 활성 파라미터이전 235B 모델 성능 초과256K+ 컨텍스트장문 에이전트 워크플로8.6x 빠른 디코딩vs Qwen3-Max (32K)네이티브 멀티모달텍스트+이미지+비디오201개 언어 지원Apache 2.0 라이선스상업적 무료 사용

워크호스부터 컨텍스트 거인까지, 용도별 라인업

Qwen 3.5 시리즈는 서로 다른 배포 환경과 성능 요구사항을 커버하는 모델들로 구성된다.

가장 경량화된 Qwen3.5-Flash는 대량 배포 환경에서의 처리량과 비용 효율성을 극대화하도록 설계됐다. API 서빙, 실시간 응답이 필요한 애플리케이션, 비용 민감한 엔터프라이즈 환경에 적합하다.

Qwen3.5-27B는 MoE가 아닌 고밀도(Dense) 아키텍처의 27억 파라미터 모델이다. 표준 컴퓨팅 환경에서 예측 가능한 성능을 제공하며, 일반적인 NLP 작업부터 멀티모달 이해까지 폭넓은 용도에 활용 가능하다.

Qwen3.5-35B-A3B가 시리즈에서 가장 주목할 만한 성과를 보여준다. 총 350억 파라미터에 활성 파라미터 30억으로, 공식 벤치마크에서 전 세대 플래그십인 Qwen3-235B-A22B를 능가하는 성능을 보였다. 이전 모델이 220억의 활성 파라미터를 사용했던 것을 감안하면, 약 7배 적은 연산으로 더 나은 결과를 달성한 셈이다. 이 효율성은 소형 모델이 더 스마트해지고 있다는 새로운 패러다임을 상징적으로 보여준다.

Qwen3.5-122B-A10B는 100억 활성 파라미터와 256K 이상의 컨텍스트 윈도우를 지원해 긴 문서 분석, 복잡한 멀티스텝 에이전트 작업, 대규모 코드베이스 이해에 특화되어 있다. 일부 소식에 따르면 1백만 토큰 컨텍스트 지원도 가능하다.

작은 모델이 큰 모델을 이기는 벤치마크

Qwen 3.5가 가져온 가장 인상적인 벤치마크 결과 중 하나는 Qwen3.5-9B 모델의 GPQA Diamond 점수다. 이 소형 모델은 81.7점을 기록하며, OpenAI의 gpt-oss-120B(파라미터 수로 10배 이상 큰 모델)를 능가했다.

코딩, 수학적 추론, 다국어 이해 벤치마크 전반에 걸쳐 Qwen 3.5의 소형 모델들은 자신보다 훨씬 큰 독점 모델들과 경쟁하거나 이를 앞서는 성과를 일관되게 보여준다. 이 결과가 함의하는 바는 크다. 규모가 성능의 결정자라는 통념이 흔들리고, 아키텍처 설계와 데이터 품질이 파라미터 수를 능가하는 요소가 될 수 있다는 것이다.

이른 융합으로 처리하는 멀티모달과 201개 언어

Qwen 3.5의 또 다른 핵심 특징은 멀티모달 능력이 처음부터 아키텍처에 내재되어 있다는 점이다. 이전 세대 모델들이 텍스트 기반 LLM에 이미지 인식 기능을 외부에서 덧붙이는(bolt-on) 방식이었다면, Qwen 3.5는 텍스트, 이미지, 비디오를 하나의 통합 아키텍처에서 이른 융합(early-fusion) 방식으로 처리한다. 이는 멀티모달 추론의 일관성과 효율성을 높이는 구조적 이점이다.

언어 지원도 주목할 만하다. 201개 언어를 지원하여 영어와 중국어 중심의 기존 LLM들이 다루기 어려웠던 저자원 언어(low-resource languages)에서도 실용적인 성능을 제공한다. 이는 글로벌 배포를 목표로 하는 기업들에게 특히 중요한 요소다.

왜 오픈소스로 풀었나

Qwen 3.5가 Apache 2.0 라이선스로 완전 오픈소스 공개된 것은 단순한 기술 발표를 넘어서는 전략적 의미를 지닌다.

첫째, 기업 고객에 대한 독점 모델 대비 경쟁 우위다. 모델 가중치를 직접 보유하고 프라이빗 인프라에서 실행할 수 있어 데이터 프라이버시와 컴플라이언스 요구사항이 높은 산업에서 강력한 대안이 된다.

둘째, 커뮤니티 기반 개선이다. 오픈소스 생태계의 연구자와 개발자들이 모델을 파인튜닝하고 개선 사항을 기여함으로써, 알리바바 단독 팀보다 더 빠른 혁신 속도를 가능하게 한다.

셋째, 에이전틱 프레임워크 통합이다. OpenClaw, Claude Code, AutoGen 등 주요 오픈소스 에이전트 프레임워크와의 호환성은 Qwen 3.5를 에이전틱 AI 스택의 백본 모델로 빠르게 자리잡게 하고 있다.

중국 AI 스프린트라는 더 큰 맥락

Qwen 3.5 출시는 더 넓은 맥락에서 볼 필요가 있다. 이 모델은 ByteDance와 Zhipu AI의 업그레이드 모델들과 같은 날 발표되는 조율된 중국 AI 스프린트의 일환이었다. 2026년 2월 중국 AI 생태계의 동시 다발적 발표들은 미국 중심의 AI 경쟁 구도에 강력한 도전장을 던졌다.

이 흐름은 AI 분야에서 오픈소스 대 독점 모델의 대결이 동시에 중국 대 미국이라는 지정학적 경쟁과 겹쳐지는 복잡한 구도를 형성하고 있음을 보여준다. Qwen 3.5는 오픈소스 모델이 유료 프론티어 모델을 성능 면에서 따라잡거나 앞설 수 있다는 것, 그리고 더 작은 모델이 더 효율적인 아키텍처를 통해 훨씬 큰 모델의 성능을 달성할 수 있다는 것을 동시에 입증했다.

Sources

Qwen3.5알리바바오픈소스LLMMoE에이전틱AI