26M짜리 모델이 함수 호출에서 10배 큰 모델을 이긴 이유

Cactus Compute의 Needle이 Gemini 3.1 Flash Lite를 증류해 만든 26M 파라미터 온디바이스 함수 호출 모델의 SAN 아키텍처, INT4 양자화, Cactus 런타임을 정리한다

2026-08-14 · 최초 발행 2026-05-17

Cactus Compute가 공개한 Needle은 Google Gemini 3.1 Flash Lite를 지식 증류하여 만든 26백만 파라미터의 초소형 함수 호출 전용 모델이다. INT4 양자화 기준 14MB 크기로 스마트폰, 스마트워치, IoT 디바이스에서 서버 API 없이 LLM 기반 에이전트 워크플로우를 실행할 수 있다. MIT 라이선스로 완전 오픈소스 공개되었으며, 온디바이스 AI 에이전트 시대의 새로운 이정표로 평가받고 있다.

교사 모델의 지식을 좁은 태스크로 압축하다

Needle은 Gemini 3.1 Flash Lite(교사 모델)로부터 함수 호출 태스크에 특화된 지식을 학생 모델(26M)로 전이하는 태스크 특화 지식 증류(Task-Specific Knowledge Distillation) 전략을 채택한다. 범용 LLM 능력 전체를 증류하는 대신, 단일 샷 함수 호출(Single-Shot Function Calling)이라는 좁은 태스크에 집중함으로써 모델 크기를 수백 배 압축한다.

소프트 레이블 생성Gemini 3.1 Flash Lite(교사 모델)증류 데이터셋(2B 토큰 합성)사전학습16 TPU v6e · 27시간 · 200B토큰함수 호출 파인튜닝45분 · 2B 합성 데이터INT4 양자화 학습100스텝마다 노이즈 주입Needle 26M14MB INT4엣지 디바이스 배포스마트폰 · 워치 · IoT

사전학습은 TPU v6e 16개에서 27시간 동안 2,000억 토큰 코퍼스를 학습한다. 이후 20억 토큰 규모의 합성 함수 호출 데이터셋으로 파인튜닝을 수행하며 45분에 완료된다. 합성 데이터는 교사 모델이 다양한 함수 스키마와 사용자 요청을 시뮬레이션하여 생성하며, 이를 통해 인간 레이블링 비용을 제로에 수렴시킨다.

Needle의 핵심 아키텍처 혁신은 Simple Attention Network(SAN)다. 기존 트랜스포머의 피드포워드(MLP) 레이어를 완전히 제거하고 어텐션 레이어만으로 구성한다.

컴포넌트 사양
인코더 레이어 12층 (FFN 없음, 어텐션만)
디코더 레이어 8층 (마스크드 셀프어텐션 + 크로스어텐션)
히든 차원 512
어텐션 헤드 수 8 (KV 헤드 4개, GQA)
어휘 크기 8,192 BPE
위치 인코딩 RoPE (Rotary Position Embedding)
임베딩 공유 인코더-출력 투영 가중치 공유

FFN 레이어 제거는 파라미터 수를 극적으로 줄이는 동시에 함수 호출이라는 구조화된 출력 생성에서 오히려 성능을 개선한다. 함수 호출은 자유 텍스트 생성과 달리 엄격한 JSON 스키마를 따르므로, 복잡한 표현 학습보다 어텐션 기반 패턴 매칭이 더 효율적이다.

INT4 양자화 학습은 훈련 중 100스텝마다 양자화 노이즈를 정규화로 주입하는 양자화 인식 훈련(QAT) 방식을 적용한다. 이로 인해 사후 양자화(PTQ) 대비 정확도 저하 없이 14MB라는 극소형 모델 크기를 달성한다.

Cactus 런타임이 배터리를 지키는 방법

Cactus는 Needle을 엣지 디바이스에서 실행하기 위해 설계된 경량 추론 프레임워크다. 모바일 CPU와 NPU를 통합 스케줄링하여 배터리 소모를 최소화하면서 최대 추론 처리량을 달성한다.

NPU 사용 가능CPU 전용사용자 요청(자연어 + 함수 스키마)Cactus 런타임하드웨어가용성?NPU 가속저전력 추론CPU 추론최적화 커널프리필 처리6,000 tok/s디코딩1,200 tok/sJSON 함수 호출출력 구조화로컬 함수 실행(API 없음)

Cactus 런타임의 주요 성능 지표는 프리필 6,000 토큰/초, 디코드 1,200 토큰/초로, 온디바이스 함수 호출 워크플로우에 충분한 응답성을 제공한다.

온디바이스 추론에서 메모리 제약은 가장 큰 도전이다. Needle은 14MB INT4 모델 크기를 통해 저사양 디바이스의 RAM 내에서 완전히 동작한다. Cactus 프레임워크는 몇 가지 메모리 최적화 전략을 적용한다. KV 캐시 슬라이딩 윈도우는 디코딩 중 KV 캐시를 제한된 윈도우 크기로 유지하여 피크 메모리 사용량을 제어한다. 공유 임베딩 가중치는 인코더 임베딩과 출력 투영 레이어의 가중치를 공유하여 메모리 중복을 제거한다. GQA(Grouped Query Attention)는 8개 쿼리 헤드에 4개의 KV 헤드를 사용해 KV 캐시 메모리를 절반으로 줄인다.

배터리 효율 측면에서 NPU 오프로드와 양자화된 정수 연산은 부동소수점 연산 대비 전력 소비를 대폭 감소시킨다. 서버 API 호출을 제거함으로써 네트워크 라디오 전력 소비도 함께 절감된다.

10~23배 큰 모델을 이기는 좁고 깊은 특화

Needle이 등장하기 전 온디바이스 함수 호출 시장은 Phi-3.5 Mini, Qwen2.5 0.5B 등 범용 소형 모델이 주도했다. Needle은 태스크 특화 증류로 이들 모델을 정확도와 크기 양면에서 압도한다.

모델 파라미터 INT4 크기 단일샷 함수 호출 정확도
Needle (Cactus) 26M 14MB 최고 (기준)
FunctionGemma-270M 270M ~135MB Needle 이하
Qwen2.5 0.5B 500M ~250MB Needle 이하
Granite-350M 350M ~175MB Needle 이하
LFM 2.5-350M 350M ~175MB Needle 이하

10~23배 큰 모델들을 단일 샷 함수 호출 정확도에서 능가한다는 결과는 태스크 특화 증류의 효과를 명확히 입증한다. 범용 능력을 포기하는 대신 좁은 태스크에서 비교 불가능한 효율을 달성한 것이다.

Needle이 열어가는 온디바이스 AI 에이전트의 가능성은 여러 축에서 드러난다. 프라이버시 보호 측면에서는 사용자 데이터가 디바이스를 떠나지 않으므로 의료, 금융, 개인 일정 관리 등 민감한 영역에서 클라우드 API 의존 에이전트 대비 본질적으로 강한 프라이버시를 보장한다. 오프라인 동작 측면에서는 네트워크 연결 없이 완전한 에이전트 기능을 수행해, 비행기 탑승 중, 지하철 터널 안, 원격 지역에서도 AI 에이전트가 로컬 앱 API를 호출하여 작업을 수행할 수 있다. 지연 시간 제로화 측면에서는 서버 왕복 지연이 없으므로 실시간 반응이 필요한 IoT 제어, 로보틱스, AR 인터페이스에 적합하다.

온디바이스 에이전트 생태계Needle함수 호출 라우터로컬 API캘린더 · 연락처 · 알람IoT 제어스마트홈 · 센서시스템 함수파일 · 미디어 · 설정프라이버시 보장데이터 디바이스 처리오프라인 동작네트워크 불필요저지연 응답서버 왕복 없음

Needle은 Mac/PC에서 로컬 파인튜닝을 지원한다. 개발자가 도메인 특화 함수 스키마로 Needle을 파인튜닝하여 엔터프라이즈 내부 API 호출에 특화된 커스텀 모델을 구축할 수 있다. 이는 온디바이스 AI 에이전트를 특정 비즈니스 로직에 통합하는 새로운 개발 패러다임을 제시한다.

Needle은 26M 파라미터와 14MB INT4 크기로 온디바이스 LLM 기반 함수 호출의 현실적 가능성을 입증한 첫 번째 사례다. Simple Attention Network 아키텍처와 태스크 특화 증류 전략의 결합은 훨씬 큰 범용 소형 모델을 함수 호출 정확도에서 능가하는 결과를 달성했다. 프라이버시 보호, 오프라인 동작, 제로 지연이라는 온디바이스 AI의 핵심 가치를 실현하는 Needle은 스마트폰부터 IoT까지 엣지 AI 에이전트 생태계의 기초 인프라로 자리매김할 것으로 전망된다.

Sources

Needle지식증류온디바이스AI함수호출Cactus