Moebius 경량 인페인팅 모델의 엣지 배포와 성능 효율
Moebius 0.22B 인페인팅 모델의 LλMI 구조, 지식 증류, FLUX.1-Fill-Dev 대비 성능과 엣지 배포 전략을 정리한다.
2026-08-14 · 최초 발행 2026-08-02
인페인팅 전용 모델이 크기보다 먼저 최적화해야 하는 것
Moebius(뫼비우스)는 화중과기대(HUST)와 VIVO AI Lab이 공동 개발한 0.22B 파라미터 이미지 인페인팅 모델이다. 2026년 6월 ECCV 2026 채택과 함께 공개됐으며, 2026년 6월 18일 arXiv 2606.19195 논문이 공개됐다.
마스킹된 부분을 주변 장면과 자연스럽게 이어 붙이는 인페인팅에 초점을 맞췄다. 226M(0.22B) 파라미터, 즉 GPT-2 수준의 크기에서 PixelHacker 대형 모델을 교사로 한 증류 학습을 적용한다. 코드와 가중치는 GitHub hustvl/Moebius에서 공개됐다.
11.9B 파라미터의 FLUX.1-Fill-Dev와 비교하면 파라미터 수는 2% 미만이다. 원본 비교에서는 6개 벤치마크에서 동등하거나 더 나은 성능을 보였고, 추론은 26.01ms/step으로 15배 이상 빠르다고 제시한다.
LλMI가 다루는 지역 특징과 전역 맥락
Moebius의 중심 구조는 Local-λ Mix Interaction(LλMI) 블록이다. 이 블록은 기존 트랜스포머 셀프 어텐션의 O(n²) 복잡도를 선형 근사로 바꾸는 방향을 택한다.
Local-λ 모듈은 텍스처, 엣지, 패턴처럼 이미지 안의 지역 공간 컨텍스트를 다룬다. Interactive-λ 모듈은 공간 특징을 전역 시맨틱 프라이어와 결합한다. 두 종류의 정보를 고정 크기 선형 행렬로 압축하고, 복잡한 상호작용은 잠재 공간 안에서 수행한다. 원본은 이 설계가 동일 표현력 대비 파라미터 수를 98% 절감한다고 설명한다.
증류는 픽셀 공간으로 디코딩하지 않고 잠재 공간에서만 수행한다. 픽셀 공간 변환을 생략해 학습 연산량을 줄이고, 픽셀·패치·시맨틱 수준의 표현을 동시에 정렬한다. 다중 기울기 기반 손실은 동적으로 균형을 조정하며, 이 증류 구조는 소규모 커스텀 도메인에도 재활용할 수 있다.
마스크 처리에서는 마스크와 비마스크 영역을 구분하고, 마스크 주변의 비마스크 픽셀에 가중치를 둔다. 경계부 색상과 텍스처의 연속성을 위한 손실 함수, 여러 해상도의 특징을 합치는 멀티스케일 융합, 다양한 형태와 크기의 랜덤 마스크 학습이 함께 언급된다.
벤치마크에서 확인한 성능과 속도
자연 장면과 인물 장면을 포함한 표준 벤치마크에서 원본은 다음 결과를 제시한다.
| 벤치마크 | Moebius (0.22B) | FLUX.1-Fill-Dev (11.9B) | 결과 |
|---|---|---|---|
| Places2 (Small) | FID 0.92, LPIPS 0.091 | SOTA 기준치 | Moebius 초과 |
| CelebA-HQ | 동등 수준 | SOTA 기준치 | 동등 |
| FFHQ | 동등 수준 | SOTA 기준치 | 동등 |
| 자연 장면 텍스처 | 아티팩트 無 | 색상 불일치 발생 | Moebius 우위 |
| 인물 얼굴 자연스러움 | 일부 초과 | SOTA 기준치 | Moebius 일부 초과 |
| 추론 속도 | 26.01ms/step | ~390ms/step(추정) | Moebius 15배 이상 |
FID는 낮을수록 실제 이미지에 가까운 지표이며, 원본은 0.92를 매우 우수한 값으로 평가한다. LPIPS 0.091은 지각적 유사도 기준의 고충실도 복원을 확인하는 수치로 제시된다. 특히 풀잎과 물결 같은 미세 패턴 복원에서는 Local-λ 모듈의 지역 텍스처 포착 능력이 강점으로 설명된다.
대형 범용 모델과 특화 모델 사이의 선택
FLUX.1-Fill-Dev는 11.9B 파라미터, ~390ms/step 추론, 24GB+ VRAM, 클라우드 전용 배포를 비교 조건으로 둔다. 다양한 도메인에서의 범용 품질이 강점이다.
Moebius는 0.22B 파라미터, 26.01ms/step 추론, 2-4GB VRAM, 엣지·모바일 배포를 비교 조건으로 둔다. 인페인팅 특화와 고속 추론이 선택 근거다.
| 기준 | Moebius 선택 | FLUX.1-Fill-Dev 선택 |
|---|---|---|
| 배포 환경 | 엣지·모바일·온디바이스 | 클라우드·고성능 서버 |
| 주요 작업 | 인페인팅 특화 | 범용 이미지 생성·편집 |
| 응답 지연 | 실시간 처리 필요 | 배치 처리 허용 |
| 인프라 비용 | 최소화 목표 | 품질 우선 |
| 파인튜닝 | 소규모 도메인 특화 | 대규모 범용 학습 |
| SDXL 대비 | Moebius가 인페인팅 품질 우위 | SDXL은 범용 생성 강점 |
SDXL은 860M~2.6B 규모로 범용 생성에 강점이 있으며 인페인팅에는 파인튜닝이 필요하다. Moebius는 0.22B 인페인팅 특화 구조로, 원본은 SDXL 대비 크기가 1/10 이하이면서 동등 이상 인페인팅 품질을 제시한다.
온디바이스부터 하이브리드까지의 배포 경로
0.22B 규모는 최신 스마트폰, 태블릿, 엣지 서버에서 직접 배포할 수 있는 후보가 된다. 원본은 Apple A18 Pro와 Snapdragon 8 Elite를 대상 기기로 들며, 2-4GB VRAM에서 온디바이스 추론이 가능하다고 설명한다. INT8/INT4 양자화를 적용하면 메모리를 절반 추가 절감할 수 있다.
배경 제거 후 인페인팅, 객체 삭제, 흠집 복원 같은 편집 흐름에 연결할 수 있다. 배포 포맷은 ONNX, CoreML(iOS), TFLite(Android), OpenVINO(인텔 엣지)가 제시된다. EdgeFusion처럼 NPU를 최적화하면 삼성 Exynos에서 1초 내 완성이 가능하다는 사례도 원본에 포함돼 있다.
도메인 적응에서는 1,000~10,000장으로 특화 파인튜닝이 가능하며, 대형 모델 대비 1/10 수준의 데이터량이라고 제시된다. 의료 이미지 복원(X-ray, CT 이미지 아티팩트 제거), 위성 이미지 클라우드 제거, 제조업 결함 영역 시뮬레이션, 문화재 디지털 복원이 적용 예시다. A100 GPU 기준 하루 미만 파인튜닝으로 도메인 적응을 완료할 수 있고, 솔더 조인트 세그멘테이션 같은 품질 검사 자동화도 사례로 언급된다.
클라우드 API 대체 비용을 검토할 때 원본은 Z-Image-Turbo 기준 USD 0.01/이미지를 사용한다. 월 100만 이미지 처리 시 클라우드 API는 약 $10,000, 로컬 GPU 서버는 월 $500~1,000으로 제시된다. 월 처리량 10만 이미지 초과 시 로컬 배포가 경제적이라는 손익분기점도 함께 제시한다. RTX 4090(24GB) 1대는 초당 ~38 스텝 처리, 초당 수십 장 인페인팅이 가능한 구성 예시다.
고품질 요청은 클라우드로 보내고 대량 반복 작업은 Moebius 로컬에서 처리하는 하이브리드 구성이 이 비용 모델에 맞는다.
이 파이프라인은 입력, 마스크 자동 생성, 환경별 라우팅, 인페인팅, 품질 검증, 출력 순서로 구성된다. SAM(Segment Anything Model)을 연결하면 사용자 클릭을 줄일 수 있고, LPIPS 임계치를 넘으면 클라우드로 폴백한다. 원본의 대기 시간 목표는 온디바이스 100ms 미만, 엣지 서버 50ms 미만이다.
경량화 설계에서 확인할 품질 속성
원본은 2026년 경량 모델 흐름을 태스크 특화 모델의 분화, 대형 모델 증류의 중심화, NPU 생태계 성숙, 양자화 고도화, 엣지-클라우드 하이브리드로 정리한다.
| 모델 | 파라미터 | 목표 | 특징 |
|---|---|---|---|
| Moebius | 0.22B | 인페인팅 특화 | LλMI + 증류, 26ms/step |
| SD 3.5 Medium | 2.5B | 소비자 VRAM | 타이트한 VRAM 예산 |
| FLUX.2 Klein | 4B | 실시간 생성 | 소비자 하드웨어 실시간 |
| Z-Image-Turbo | 6B | 기업 GPU | 1초 미만 지연, $0.01/장 |
| EdgeFusion | 비공개 | NPU 전용 | Samsung Exynos, 1초 완성 |
경량화 선택지는 지식 증류, 가중치 양자화, 프루닝, 아키텍처 재설계로 나뉜다. Moebius는 PixelHacker에서 Moebius로 지식을 전달하는 증류와 LλMI 기반 아키텍처 재설계를 핵심으로 삼고, 배포 단계에는 FP32에서 INT8/INT4로 바꾸는 양자화를 적용할 수 있다. LλMI 블록은 프루닝 철학도 내재하지만 희소성 활용이 어렵다는 한계가 원본에 제시된다.
ISO 25010 기준으로 보면 26ms/step 추론은 성능 효율성, 6개 벤치마크의 일관성은 신뢰성, 오픈소스 공개는 유지보수성, CPU/GPU/NPU 배포는 이식성과 연결된다. 민감 이미지를 클라우드로 전송하지 않아도 되는 온디바이스 처리 방식은 보안성 측면의 선택 근거가 된다.
Sources
- https://arxiv.org/abs/2606.19195 - Moebius: Efficient Image Inpainting with 0.22B Parameters (arXiv 2606.19195)
- https://github.com/hustvl/Moebius - Moebius 공식 GitHub 저장소 (hustvl/Moebius)
- https://huggingface.co/black-forest-labs/FLUX.1-Fill-dev - FLUX.1-Fill-Dev 모델 카드 (HuggingFace)
- https://arxiv.org/abs/2501.05753 - EdgeFusion: On-Device Text-to-Image Generation (arXiv)
- https://stability.ai/news/stable-diffusion-3-5 - Stable Diffusion 3.5 Medium 공식 발표 (Stability AI)