gemma-tuner-multimodal — Apple Silicon만으로 Gemma 4를 파인튜닝하다

PyTorch MPS 백엔드로 Gemma 4·3n을 텍스트·이미지·오디오 세 모달리티에서 로컬 파인튜닝하는 gemma-tuner-multimodal의 부트스트랩 구조와 LoRA·QLoRA 전략, Apple Silicon 제약을 정리한다.

2026-08-14 · 최초 발행 2026-04-11

Apple Silicon Mac에서 NVIDIA GPU 없이도 멀티모달 AI 모델을 파인튜닝할 수 있는 시대가 열렸다. Matt Mireles가 6개월간 개발하여 2026년 4월 공개한 gemma-tuner-multimodal은 PyTorch Metal Performance Shaders(MPS)를 활용하여 Gemma 4와 Gemma 3n 모델을 텍스트, 이미지, 오디오 세 가지 모달리티로 파인튜닝하는 오픈소스 도구다. Hacker News 프론트 페이지에 올라 117포인트를 기록하며 로컬 멀티모달 파인튜닝에 대한 커뮤니티의 강한 수요를 확인시켰다.

고가 GPU 없이 멀티모달을 배우다

Google이 2026년 공개한 Gemma 4는 오픈 모델 중 가장 강력한 멀티모달 성능을 제공한다. 텍스트뿐 아니라 이미지와 오디오를 동시에 이해하고 생성할 수 있는 구조를 갖췄으며, Hugging Face Hub에서 가중치를 자유롭게 다운로드할 수 있다. Gemma 3n은 온디바이스 최적화 경량 모델로 모바일·엣지 디바이스를 겨냥한다.

기존 멀티모달 파인튜닝은 NVIDIA A100, H100 등 고가의 데이터센터급 GPU를 요구했다. 클라우드 GPU 인스턴스 대여 비용도 시간당 수 달러에 달하며, 대규모 데이터셋을 원격 서버로 전송하는 과정에서 개인정보 노출 위험도 있었다.

MPS가 준비되기 전엔 PyTorch도 로딩되지 않는다

gemma-tuner-multimodal은 Apple Silicon의 Metal Performance Shaders(MPS)를 PyTorch 백엔드로 활용한다. MPS 환경 변수가 PyTorch 로딩 전에 설정되도록 CLI 진입점에서 core.bootstrap을 조기 임포트하는 구조를 채택한다.

텍스트이미지+텍스트오디오+텍스트사용자 CLI 명령core.bootstrap 초기화MPS 환경 변수 설정PyTorch MPS 백엔드 로딩모달리티 선택Text LoRA 트레이너Vision LoRA 트레이너Audio LoRA 트레이너LoRA 어댑터 저장Hugging Face Hub 업로드
모달리티 학습 방식 주요 활용 Apple Silicon 지원
텍스트 전용 Text LoRA 인스트럭션 튜닝, 텍스트 완성 MPS 네이티브
이미지+텍스트 Vision LoRA 이미지 캡셔닝, VQA MPS 네이티브
오디오+텍스트 Audio LoRA 음성 이해, 오디오 분석 MPS 네이티브

세 모달리티 모두 Apple Silicon에서 네이티브로 실행되며 CUDA 의존성이 전혀 없다. 대규모 데이터셋의 경우 클라우드 스토리지에서 학습 중 직접 스트리밍하는 기능도 제공해 로컬 스토리지 제약을 우회한다.

저랭크 어댑터로 무게를 던다

gemma-tuner-multimodal은 LoRA를 기본 파인튜닝 전략으로 채택한다. 사전학습된 모델의 전체 가중치를 동결하고, 저랭크 어댑터 레이어만 학습해 메모리 사용량과 학습 시간을 대폭 절감한다. LoRA는 원본 가중치를 동결하고 저랭크 행렬 분해로 어댑터만 학습하고, QLoRA는 사전학습 모델을 4비트로 양자화한 뒤 LoRA 어댑터를 부착해 메모리 사용량을 추가로 절감한다. Hugging Face Hub 가중치에 대한 사전 구성된 기본 LoRA 설정을 제공하며, 어텐션 레이어의 Q, K, V 프로젝션에 어댑터를 적용하는 타겟 모듈 방식을 쓴다.

QLoRA를 적용하면 16GB 통합 메모리의 M2 MacBook Air에서도 Gemma 4 소형 모델의 파인튜닝이 가능해진다. M3 Max나 M4 Pro 이상의 고사양 칩에서는 더 큰 모델과 배치 사이즈로 학습할 수 있다.

MPS가 잘하는 것과 못하는 것

Metal Performance Shaders는 Apple이 GPU 연산을 위해 제공하는 프레임워크로, PyTorch 2.0부터 MPS 백엔드를 공식 지원한다. gemma-tuner-multimodal은 이 MPS 백엔드에 최적화된 학습 루프를 구현한다. CPU와 GPU가 메모리를 공유해 데이터 전송 오버헤드를 없애는 통합 메모리 아키텍처, Apple GPU에 특화된 연산 커널로 행렬 곱셈을 가속하는 Metal API 최적화, MPS 백엔드의 메모리 관리 최적화로 대형 모델을 수용하는 메모리 효율성이 강점이다. 다만 일부 CUDA 전용 연산자는 MPS에서 지원되지 않아 CPU 폴백이 필요하다는 제약이 있다.

다음 배치Gemma 4 가중치4비트 양자화(QLoRA)MPS 백엔드 로딩통합 메모리 할당Metal GPU 연산그래디언트 계산LoRA 어댑터 업데이트

로컬 학습을 밀어붙이는 커뮤니티

PyTorch 한국 사용자 커뮤니티에서는 Apple Silicon 기반 로컬 학습에 대한 관심이 꾸준히 늘고 있다. 특히 M 시리즈 칩의 통합 메모리가 대형 모델 추론과 파인튜닝에 유리하다는 점이 주목받고 있다. 한국어 PyTorch 튜토리얼과 MPS 백엔드 가이드를 제공하는 PyTorch Korea, 클라우드 의존 탈피와 개인 데이터 주권 확보에 대한 수요가 늘어나는 로컬 AI 트렌드, MLX·MPS·Core ML 등으로 확장되는 Apple Silicon 생태계, gemma-tuner-multimodal 같은 오픈소스 도구의 한국어 문서화 커뮤니티 기여가 함께 나타나고 있다.

gemma-tuner-multimodal은 H100을 대여하지 않고도 개인 Mac에서 멀티모달 모델을 커스터마이징할 수 있다는 점에서, 로컬 AI 개발의 접근성을 한 단계 끌어올린 도구다. Apple Silicon의 성능 향상과 PyTorch MPS 백엔드의 성숙이 맞물리면서 이러한 로컬 파인튜닝 워크플로우는 앞으로 더욱 보편화될 전망이다.

Sources

gemma-tuner-multimodalApple SiliconMPSLoRA멀티모달 파인튜닝