27B가 397B를 이기고, 오픈소스가 처음으로 독점 모델 위에 섰다
Alibaba Qwen3.6-27B와 Z.ai GLM-5.1이 SWE-Bench에서 거둔 성과와 코딩 데이터 큐레이션 전략, 오픈소스·독점 모델 격차 소멸, 기업 AI 도입 전략 변화를 정리한다.
2026-08-14 · 최초 발행 2026-04-24
2026년 4월, 중국 AI 생태계에서 발표된 두 가지 오픈소스 모델이 글로벌 LLM 경쟁 구도를 뒤흔들고 있다. Alibaba의 Qwen3.6-27B는 270억 파라미터 dense 구조로 자사 397B MoE 모델을 코딩 벤치마크에서 앞질렀고, Z.ai의 GLM-5.1은 SWE-Bench Pro에서 Claude Opus 4.6과 GPT-5.4를 모두 능가하며 오픈소스 모델 최초로 독점 모델을 제쳤다. 오픈소스와 독점 모델 사이의 성능 격차가 사실상 소멸 단계에 접어들었음을 보여주는 이정표적 사건이다.
27B dense가 397B MoE를 앞선 이유
Alibaba의 Qwen 팀이 2026년 4월 22일 Apache 2.0 라이선스로 공개한 Qwen3.6-27B는 dense 아키텍처(Mixture-of-Experts가 아닌 전통적 트랜스포머)를 채택한 270억 파라미터 오픈웨이트 모델이다. 이 모델의 가장 주목할 만한 특징은 규모 대비 성능, 즉 파라미터 효율성이다.
코딩 능력을 평가하는 대표적 벤치마크인 SWE-Bench Verified와 SWE-Bench Pro에서 Qwen3.6-27B는 훨씬 큰 모델들과 대등하거나 그 이상의 성능을 보였다.
| 모델 | 파라미터 | SWE-Bench Verified | SWE-Bench Pro | Terminal-Bench 2.0 |
|---|---|---|---|---|
| Qwen3.6-27B | 27B (dense) | 77.2% | 53.5% | 59.3% |
| Qwen3.5-397B-A17B (MoE) | 397B / 활성 17B | 76.2% | 50.9% | 52.5% |
| Claude Opus 4.6 | 비공개 | 80.8% | 57.3% | - |
| GPT-5.4 | 비공개 | - | 57.7% | - |
27B dense 모델이 397B MoE 모델을 코딩 태스크에서 일관되게 능가한다는 결과는 단순히 파라미터 수가 성능을 결정하지 않음을 보여준다. 코드 특화 학습 데이터 큐레이션과 에이전틱 코딩 시나리오에 최적화된 파인튜닝 전략이 결합될 때 소규모 dense 모델이 훨씬 큰 MoE 모델을 앞설 수 있다.
Qwen3.6-27B가 도입한 핵심 기술 혁신 중 하나는 Thinking Preservation(사고 보존)이다. 기존 에이전트 워크플로우에서는 대화 턴이 넘어갈 때 이전 추론 과정이 컨텍스트에서 소실되는 문제가 있었다. Thinking Preservation은 추론 트레이스를 대화 히스토리 전반에 걸쳐 유지함으로써 중복 토큰 생성을 줄여 멀티턴 에이전트 작업의 추론 비용을 낮추고, KV 캐시 효율성을 향상시켜 긴 컨텍스트 창에서 반복 패턴을 재계산하지 않아도 되게 한다. 이는 수십~수백 회의 반복이 필요한 레포지토리 수준 코딩 에이전트에서 특히 중요하다.
오픈소스가 처음으로 정상에 오른 순간
Z.ai(Zhipu AI)가 2026년 4월 7일 MIT 라이선스로 공개한 GLM-5.1은 754B 파라미터의 거대한 Mixture-of-Experts 모델이다(활성 파라미터 약 40B). SWE-Bench Pro에서 58.4%를 기록하며 Claude Opus 4.6(57.3%)과 GPT-5.4(57.7%)를 모두 능가했다.
GLM-5.1의 설계는 순수한 에이전틱 엔지니어링(agentic engineering)에 초점을 맞추고 있다. 단순한 코드 생성을 넘어 실제 소프트웨어 엔지니어링 작업 흐름을 자율적으로 수행할 수 있도록 설계됐다. 대형 코드베이스 전체를 컨텍스트에 유지할 수 있는 200K 토큰 컨텍스트 창, 방대한 코드 생성·수정이 가능한 131K 토큰 최대 출력, 수백 회 반복을 통한 복잡한 엔지니어링 태스크 수행이 가능한 최대 8시간 자율 코딩, NVIDIA GPU 없이 약 10만 장의 Huawei Ascend 910B 칩과 MindSpore 프레임워크로 이뤄진 학습이 특징이다. 특히 Huawei Ascend 910B로만 훈련됐다는 점은 미국의 AI 칩 수출 규제 환경에서 중국 AI 생태계의 독자적 하드웨어 스택 구축 의지를 보여주는 사례다.
SWE-Bench Pro는 표준 SWE-Bench Verified보다 훨씬 어렵고 현실적인 평가 기준을 제시한다. 단순한 GitHub 이슈 해결을 넘어 복잡한 멀티파일 리팩터링, 미묘한 버그 재현, 테스트 스위트 통과까지 포함한다.
SWE-Bench Pro의 높은 난이도는 현실 세계 소프트웨어 엔지니어링 역량을 측정하는 데 더 유효하지만, 동시에 한계도 존재한다. 벤치마크가 Python 코드베이스 위주로 구성되어 있고, 실제 기업 내 코드베이스의 복잡성(레거시 코드, 비공개 문서, 조직 특유의 코딩 관습 등)을 완전히 반영하지는 못한다.
3개월로 좁혀진 격차
Epoch AI의 분석에 따르면 2026년 현재 오픈웨이트 모델은 최첨단 독점 모델 대비 평균 약 3개월의 성능 격차만 남아 있다. 2025년까지만 해도 이 격차는 6~12개월 수준이었다. 코딩 특화 태스크에서는 GLM-5.1의 SWE-Bench Pro 1위 달성으로 사실상 격차가 역전되는 순간도 나타났다.
오픈소스 코딩 LLM이 강해진 핵심 요인은 세 가지다. 실행 가능하고 테스트 커버리지가 높은 코드를 필터링하고 에이전트가 실제로 수행한 코딩 트레이스(도구 호출 시퀀스, 수정 이력, 오류 해결 과정)를 학습 데이터로 활용하는 코드 데이터 큐레이션의 정교화, 코드 생성의 최종 결과(코드가 실행되는가)뿐만 아니라 중간 과정(올바른 방향으로 사고하고 있는가)에도 보상을 부여하는 RLHF와 프로세스 보상 모델(PRM)의 결합, SWE-agent·OpenHands 같은 에이전트 프레임워크와 실제 리포지토리에서 수집한 궤적 데이터로 모델을 파인튜닝하는 에이전틱 파인튜닝이 그것이다.
자체 호스팅이 현실적 선택지가 된다는 것
Qwen3.6-27B와 GLM-5.1의 등장은 단순한 기술 경쟁을 넘어 AI 생태계 주도권과 기업 AI 도입 전략에 깊은 함의를 가진다.
특히 Qwen3.6-27B는 RTX 4090 단일 GPU에서 실행 가능한 수준의 크기로, 독점 API 없이도 세계 최고 수준의 코딩 성능을 로컬 환경에서 구현할 수 있게 한다.
벤치마크 경쟁이 치열해질수록 평가 방법론의 한계에 대한 비판적 시각도 중요하다. SWE-Bench Pro를 포함한 현재 코딩 벤치마크는 몇 가지 한계를 가진다. 대부분의 벤치마크가 Python 코드베이스를 중심으로 구성되어 C++, Java, Rust 등 다른 언어에서의 성능을 반영하지 못하는 Python 편향, 오픈소스 벤치마크 데이터가 학습 데이터에 포함될 수 있어 진정한 일반화 능력보다 벤치마크 특화 성능을 측정할 위험이 있는 오염 가능성(Data Contamination), 레거시 코드·비공개 내부 라이브러리·조직 고유의 아키텍처 패턴이 공개 벤치마크에 반영되지 않는 현실 기업 코드베이스와의 괴리, 높은 SWE-Bench 점수가 엄청난 토큰 소비와 함께 달성된 경우 실제 운영 비용이 매우 높을 수 있는 에이전트 추론 비용 미반영이 그것이다.
2026년의 코딩 LLM 경쟁은 단기적으로 더욱 가속화될 것으로 보인다. Qwen, GLM 외에도 DeepSeek, Kimi(Moonshot AI), MiniMax 등 중국 오픈소스 모델들이 코딩 성능 경쟁에 뛰어들고 있으며, Meta의 LLaMA 시리즈와 Mistral도 코드 특화 버전을 강화하고 있다. 이 경쟁의 최종 승자는 모델 자체의 파라미터 수가 아니라, 코드 데이터 큐레이션의 품질, 에이전틱 파인튜닝 전략의 정교함, 그리고 실제 소프트웨어 개발 워크플로우와의 통합 완성도가 결정할 것이다.
Alibaba의 Qwen3.6-27B와 Z.ai의 GLM-5.1은 2026년 코딩 LLM 경쟁의 새로운 기준을 제시했다. 27B dense 모델이 397B MoE를 능가하고, 오픈소스 MoE가 독점 모델 정상에 오른 두 사건은 AI 모델 개발 패러다임이 파라미터 규모에서 학습 데이터 품질과 에이전틱 최적화로 이동하고 있음을 증명한다. 기업과 개발자들에게는 더 낮은 비용으로 세계 최고 수준의 코딩 자동화를 구현할 기회가 열렸으며, 오픈소스 LLM 생태계의 성숙은 AI 민주화의 실질적 가속을 의미한다.
Sources
- Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks - MarkTechPost
- Qwen3.6-27B: 27B Model Beats 397B on Coding (2026) - Build Fast With AI
- GitHub - QwenLM/Qwen3.6
- Qwen3.6-27B Benchmarks 2026: Scores, Rankings & Performance - BenchLM.ai
- AI joins the 8-hour work day as GLM ships 5.1 open source LLM, beating Opus 4.6 and GPT-5.4 on SWE-Bench Pro - VentureBeat
- Z.ai Releases GLM-5.1: 754B Model Tops SWE-Bench Pro - Winbuzzer
- GLM-5.1: Z.ai's Open-Weight Model Takes #1 on SWE-Bench Pro - NYU Shanghai RITS
- GLM-5.1 Open Source: #1 on SWE-Bench Pro (What to Know) - ModemGuides
- Best Open Source LLM in 2026: Rankings, Benchmarks, and the Models Worth Running - BenchLM.ai
- Open-Source vs Commercial LLMs: The Complete Guide (2026) - SitePoint
- zai-org/GLM-5.1 - Hugging Face
- GitHub - zai-org/GLM-5: GLM-5: From Vibe Coding to Agentic Engineering