JetBrains Mellum 2의 희소 MoE 구조와 온프레미스 코딩 워크플로우

JetBrains Mellum 2의 희소 MoE 구조, 모델 변형, 멀티 에이전트 활용, vLLM 온프레미스 배포와 경쟁 모델 대비 위치를 실무 관점에서 정리한다.

2026-08-14 · 최초 발행 2026-06-10

전체 모델을 매번 계산하지 않는 코딩 LLM

JetBrains는 2026년 6월 2일 Mellum 2(Mellum2)를 Apache 2.0 라이선스로 공개했다. 총 파라미터는 12B지만, 하나의 토큰을 처리할 때 활성화되는 파라미터는 2.5B다. 64개 전문가 가운데 8개만 선택하는 Mixture-of-Experts(MoE) 구조를 적용해 유사 규모 모델보다 추론 시간을 절반 이하로 줄였다.

이 설계가 겨냥하는 범위는 IDE 코드 완성에 한정되지 않는다. RAG 파이프라인, 멀티 에이전트 워크플로우, 온프레미스 배포처럼 소프트웨어 엔지니어링 과정에서 반복적으로 모델을 호출하는 환경까지 포함한다.

2025~2026년 AI 코딩 도구 시장은 Claude Code, GitHub Copilot, Cursor처럼 프론티어 모델을 사용하는 서비스가 주도했다. 다만 클라우드 의존성, API 비용, 레이턴시, 소스 코드의 외부 전송은 기업 도입 과정에서 계속 문제가 된다. 금융·의료·방산 분야에서는 코드가 외부 서버로 나가는 것 자체를 허용하지 않는 경우도 많다.

IntelliJ, PyCharm, WebStorm을 개발해 온 JetBrains는 이전 Mellum을 코드 자동완성에 특화된 모델로 선보였다. 후속 모델인 Mellum 2에서는 적용 범위를 에이전트 워크플로우로 넓히며 ‘포컬 모델(focal model)’이라는 역할을 제시했다. 단일 대형 모델에 모든 처리를 맡기지 않고 Mellum 2가 라우팅, 컨텍스트 수집, 요약, 검증처럼 반복적이며 짧은 지연 시간이 필요한 작업을 처리한다. 복잡한 추론만 더 큰 모델에 넘기는 방식이다.

라우터가 토큰마다 전문가를 고른다

Dense 모델은 토큰을 처리할 때 전체 파라미터를 활성화한다. Mellum 2의 희소 MoE 트랜스포머에서는 라우터가 토큰에 적합한 전문가 서브네트워크 일부를 골라 계산에 참여시킨다.

항목 수치
총 파라미터 12B
토큰당 활성 파라미터 2.5B
전문가 총 수 64개
토큰당 활성 전문가 8개
컨텍스트 윈도우 131,072 토큰
학습 토큰 약 10.6조 토큰
라이선스 Apache 2.0

전문가 수를 기준으로 보면 한 번의 forward pass에서 64개 중 8개, 약 12.5%가 선택된다. 공유 파라미터를 포함한 활성 파라미터 비율은 2.5B/12B ≈ 20.8%다. 이를 통해 동일 크기의 Dense 모델보다 2배 이상 빠른 추론 속도를 낸다. 개발자 세션에서 코드 자동완성을 수십 번 생성하는 환경일수록 이 차이가 더 뚜렷해진다.

입력 토큰라우터 네트워크64개 전문가 8개 선택Expert 1 활성화Expert 2 활성화Expert 3 활성화Expert 4-8 활성화출력 집계 (Weighted Sum)다음 레이어 또는 최종 출력

어텐션에는 Grouped-Query Attention(GQA)과 Sliding Window Attention을 함께 사용한다. GQA는 KV 헤드를 4개로 줄여 메모리 사용량을 낮추고, Sliding Window Attention은 긴 입력을 효율적으로 처리한다. 컨텍스트 윈도우는 131K 토큰으로, 대규모 코드베이스를 하나의 컨텍스트에서 다룰 수 있는 용량이다.

사전학습에는 약 10.6조 토큰이 사용됐다. 데이터 커리큘럼은 소프트웨어 엔지니어링 태스크에 맞춰 코드와 자연어, 수학적 추론 데이터를 혼합했다. 코드와 자연어가 계속 교차하는 실제 코딩 워크플로우를 반영한 구성이다. 아키텍처의 세부 내용은 JetBrains가 기술 보고서 arXiv 2605.31268에 공개했다.

작업에 맞춰 고르는 모델 변형

Mellum 2 모델 패밀리는 Base, Base-Pretrain, Instruct, Instruct-SFT, Thinking, Thinking-SFT로 나뉜다.

Mellum 2 모델 패밀리BaseBase-PretrainInstructInstruct-SFTThinkingThinking-SFT파인튜닝 기반 모델도메인 특화 학습용학습 체크포인트연구·실험용지시어 따르기 최적화일반 어시스턴트 작업Supervised Fine-Tuning특정 태스크 정밀 조정추론 강화복잡한 문제 해결추론+SFT 결합고품질 출력 최적화

일반적인 온프레미스 환경에는 Instruct 변형이 권장된다. vLLM으로 서빙하면서 Hermes 파서를 활성화하면 함수 호출(tool-calling) 워크플로우에 연결할 수 있다. 단계별 추론이 필요한 코드 생성이나 디버깅에는 Thinking 변형이 맞는다.

포컬 모델로 역할을 나누는 파이프라인

Mellum 2는 모든 문제를 단독으로 해결하는 대형 모델보다 고빈도·저지연 작업을 전담하는 모델에 가깝다. Claude Opus나 GPT-4o 같은 대형 모델이 오케스트레이터를 맡는다면, Mellum 2는 코드베이스 검색과 요약, 수정 계획 검증 같은 하위 작업을 처리할 수 있다.

코드베이스/DBMellum 2(서브에이전트)오케스트레이터(대형 모델)사용자코드베이스/DBMellum 2(서브에이전트)오케스트레이터(대형 모델)사용자이 버그 수정해줘(1) 관련 파일 컨텍스트 수집벡터 검색 + 파일 청크 로드관련 코드 청크 반환컨텍스트 요약 전달(2) 수정 계획 검증검증 결과 + 엣지케이스 리스트최종 수정 코드 제안

RAG 파이프라인에서는 벡터 DB가 반환한 코드 조각을 즉시 요약하고 응답을 생성하는 역할을 맡는다. 131K 토큰 컨텍스트에는 수십 개의 파일 청크를 한 프롬프트로 담을 수 있어, 멀티홉 검색 없이 광범위한 코드베이스를 다룰 수 있다.

JetBrains IDE인 IntelliJ, PyCharm, WebStorm 등과의 통합도 주요 사용 시나리오다. Mellum 2를 온프레미스 로컬 서버에서 실행하면 네트워크 라운드트립 없이 타이핑과 함께 코드 완성 제안을 제공할 수 있다.

또 다른 역할은 모델 라우팅이다. 프롬프트의 복잡도를 판별해 간단한 요청은 직접 처리하고, 복잡한 추론이 필요한 요청만 더 큰 모델로 넘기는 게이트키퍼로 둘 수 있다. 이 구성은 전체 시스템 비용을 크게 줄인다.

Apache 2.0 모델을 내부망에 배포하기

Apache 2.0 라이선스는 상업적 사용과 수정, 재배포, 특허 사용을 허용하며 저작권 표시 의무를 남긴다. Mellum 2를 기업 내부 AI 코딩 도구로 운영할 때 별도의 라이선스 비용은 없다.

vLLM을 이용한 Instruct 변형의 서빙 구성은 다음과 같다.

# vLLM을 이용한 Mellum 2 Instruct 서빙 예시
from vllm import LLM, SamplingParams

llm = LLM(
    model="JetBrains/Mellum-2-12b-instruct",
    tensor_parallel_size=2,    # GPU 2장 병렬
    max_model_len=131072,      # 최대 컨텍스트 131K
    enable_expert_parallel=True  # MoE 전문가 병렬 처리
)

sampling_params = SamplingParams(
    temperature=0.2,   # 코드 생성: 낮은 온도
    max_tokens=2048,
    top_p=0.95
)

# 함수 호출 (Hermes 파서 활성화 시)
outputs = llm.generate(
    ["def calculate_fibonacci(n: int) -> int:"],
    sampling_params
)

배포 규모에 따른 하드웨어 구성은 아래처럼 나뉜다.

배포 형태 GPU 구성 적합 시나리오
개인 개발자 RTX 4090 (24GB) × 1 로컬 실험·소규모 팀
팀 서버 A100 (40GB) × 1 10-30인 팀 공유 서버
엔터프라이즈 A100 (80GB) × 2+ 대규모 동시 요청 처리
CPU 전용 64GB RAM+ 개발·테스트 환경

MoE에서는 추론 시 2.5B 활성 파라미터만 처리하므로 동일 성능의 Dense 12B 모델보다 GPU 메모리 요구량이 낮다.

경쟁 모델 사이에서 잡은 위치

2026년 오픈소스 코딩 LLM 시장에서 Mellum 2는 최고 절대 성능보다 빠른 추론과 충분한 코딩 성능에 무게를 둔다.

성능 vs 속도 포지셔닝추론 속도: 최고성능: 경쟁력 있음성능: 높음속도: 중간HumanEval: 81.1%속도: 느림균형형성능/속도성능: 최상속도: 느림256K 컨텍스트Mellum 2(12B MoE / 2.5B 활성)DeepSeek Coder V2(21B MoE)Codestral 22B(Dense)StarCoder2 15B(Dense)Qwen3-Coder 30B(Dense)저지연 워크플로우적합복잡 코딩태스크 적합고품질 단일작업 적합범용 코딩적합최고 품질요구 적합

동급 Dense 모델보다 2배 이상 빠른 추론, Apache 2.0 라이선스, JetBrains IDE 생태계 최적화, 131K 토큰 컨텍스트, 배포 목적에 맞춘 모델 변형은 Mellum 2의 강점이다.

반면 벤치마크 절대 성능은 Qwen3-Coder 30B나 DeepSeek Coder V2보다 낮다. 복잡한 다단계 추론에는 Thinking 변형이 필요하고, JetBrains 생태계 밖에서 통합하려면 추가 설정도 거쳐야 한다.

따라서 Mellum 2의 자리는 ‘최고 성능’ 모델이 아니라 ‘최고 속도와 충분한 성능’을 겨냥한 모델로 볼 수 있다. 에이전트 파이프라인에서 초당 수십 번 호출되는 서브에이전트 역할에 특히 유리하다.

코드가 외부로 나갈 수 없는 조직의 구성

금융·의료·방산처럼 코드 외부 전송이 규정상 금지된 업종에서는 모델과 검색 인프라를 내부망에 함께 배치할 수 있다.

데이터 전송 차단기업 내부 코드베이스온프레미스 벡터 DB(Qdrant/Weaviate)Mellum 2 로컬 추론 서버(vLLM 기반)JetBrains IDE 플러그인또는 API 게이트웨이개발자 워크스테이션외부 인터넷

코드와 쿼리가 내부망을 벗어나지 않으므로 Mellum 2를 자체 운영 인프라에서 완전히 구동할 수 있다. 이 방식은 규정 준수(Compliance)와 데이터 주권(Data Sovereignty)을 함께 확보하는 구성이다.

비용 구조도 클라우드 API와 다르다. 50인 규모의 중간 개발팀을 기준으로 클라우드 API 비용은 월 수백만 원대에 이르지만, 온프레미스에서는 GPU 서버를 처음 구입한 뒤 전기료와 유지보수비가 운영비의 중심이 된다. 일반적으로 1~2년 안에 손익분기점에 도달한다.

코딩 모델 생태계가 향하는 방향

Mellum 2는 2026년 AI 코딩 도구 시장에서 나타나는 몇 가지 변화를 보여준다.

먼저 Claude Code, Codex, Cursor처럼 단일 모델에 의존하던 방식에서 소형 고속 모델과 대형 추론 모델이 협력하는 멀티 모델 파이프라인으로 이동하고 있다. Mellum 2는 이 구조에서 반복 작업을 맡는 모델이다.

Apache 2.0 오픈소스 모델의 확산은 클라우드 없이 자체 AI 코딩 인프라를 구축하는 선택지를 넓힌다. 외부 API를 사용할 수 없는 조직에도 온프레미스 AI가 현실적인 대안이 된다.

아키텍처 측면에서는 DeepSeek V2, Mixtral 8x22B에 이어 Mellum 2도 MoE를 채택했다. 희소 활성화가 효율적인 추론을 위한 주류 설계로 자리 잡으면서 특정 시나리오에서는 Dense 모델을 대체하는 흐름이 빨라질 전망이다.

JetBrains가 Mellum 시리즈를 직접 개발한 점도 눈에 띈다. IDE 제조사가 에디터의 컨텍스트 이해와 특화 모델 최적화를 결합한 선례이며, 이러한 방향은 더 확대될 가능성이 높다.

Mellum 2는 12B MoE, Apache 2.0 라이선스, 포컬 모델이라는 역할을 한데 묶었다. 절대적인 벤치마크 성능보다 개발 환경에서의 응답 속도와 비용, 데이터 주권을 우선한 모델이다. Hugging Face에서 바로 사용할 수 있어 진입 장벽도 낮으며, 2026년 기업 온프레미스 AI 코딩 도구를 검토할 때 균형 잡힌 선택지 가운데 하나다.

Sources

Mellum 2코딩 LLMMoE온프레미스vLLM