인터넷 없이 받아쓰는 법, 구글이 아이폰에 조용히 내놓았다
Gemma 4 E2B/E4B 기반 오프라인 받아쓰기 앱 Google AI Edge Eloquent의 양자화·PLE·LiteRT-LM 최적화 기법과 처리 파이프라인, 경쟁 솔루션 비교를 정리한다.
2026-08-14 · 최초 발행 2026-04-17
2026년 4월, 구글은 인터넷 연결 없이 완전한 온디바이스 환경에서 구동되는 AI 받아쓰기 앱 Google AI Edge Eloquent를 iOS 플랫폼에 조용히 출시했다. Gemma 4 경량 모델 기반의 ASR(Automatic Speech Recognition) 엔진을 탑재한 이 앱은 단순한 음성-텍스트 변환을 넘어, 발화 중 삽입되는 불필요한 필러 워드(filler word)를 실시간으로 제거하고 자연스러운 문어체 문장으로 정제하는 기능을 제공한다.
오프라인에서 완결되는 받아쓰기
구글 AI Edge 팀이 개발한 이 무료 받아쓰기 앱은 모델 다운로드 후 네트워크 연결이 필요 없는 완전 오프라인 처리, Gemma 기반 ASR 모델이 기기 내 CPU/GPU에서 직접 추론하는 온디바이스 ASR, "음"·"어"·"그" 같은 필러 워드와 자기 수정 발화를 자동 제거하는 지능형 텍스트 정제, 선택적으로 Gemini 클라우드 모델로 텍스트를 후처리하는 클라우드 하이브리드 모드, 고유명사·전문 용어를 등록해 도메인 특화 정확도를 높이는 개인 컨텍스트 사전을 갖췄다. 사용량 제한이나 구독 요금 없이 무제한 무료로 쓸 수 있고, 현재 영어를 지원하며 추가 언어는 예정돼 있다. 현재 iOS(App Store) 전용으로 출시됐고, 앱스토어 설명에 Android 버전 언급이 있으나 Google Play에는 아직 나오지 않았다.
모바일에 맞춘 Gemma 4 엣지 모델
Eloquent의 핵심 엔진은 구글의 오픈 모델 계열 Gemma 4 중에서도 모바일 전용으로 설계된 E2B(Edge 2B)와 E4B(Edge 4B) 모델이다.
| 모델 | 파라미터 | 대상 환경 | 주요 특징 |
|---|---|---|---|
| Gemma 4 E2B | ~2B (효과적) | 모바일, IoT | 초경량, 오프라인 완전 지원 |
| Gemma 4 E4B | ~4B (효과적) | 모바일, 엣지 서버 | 균형형, 고정확도 |
| Gemma 4 31B | 31B | 서버, 고성능 PC | 고성능 dense 모델 |
| Gemma 4 26B MoE | 26B MoE | 고처리량 서버 | Mixture-of-Experts 구조 |
E2B/E4B 모델은 표준 Gemma 아키텍처와 달리 Per-Layer Embedding(PLE) 기법을 도입한다. 기존 트랜스포머 모델에서 모든 레이어가 동일한 임베딩 테이블을 공유하는 것과 달리, PLE는 각 디코더 레이어마다 독립적인 소형 임베딩을 할당해 레이어 수가 늘어나도 임베딩 메모리 증가를 최소화하고, 활성화되는 임베딩 범위를 레이어 단위로 제한해 추론 메모리를 절감하며, 레이어 깊이별로 문맥에 최적화된 토큰 표현을 가능하게 한다. E2B/E4B는 텍스트·이미지·오디오 입력을 단일 모델 아키텍처에서 통합 처리해, 별도 ASR 전처리 모델 없이 오디오 토큰을 직접 처리한다 — 음성 신호를 스펙트로그램에서 오디오 토큰으로 변환한 뒤 동일 디코더가 처리하며, 음성 인식과 텍스트 정제를 단일 추론 패스에서 수행한다.
가중치를 깎아내는 양자화 전략
Eloquent가 스마트폰에서 실시간 음성 인식을 가능하게 하는 핵심은 다층적 모델 압축 전략이다.
기본 온디바이스 배포 형식인 INT4(4-bit) 양자화는 모델 크기를 약 75% 줄이고, 초경량 모드인 INT2(2-bit) 양자화는 LiteRT-LM을 통해 E2B 모델을 1.5GB 이하로 운영할 수 있게 한다. 민감 레이어는 INT8, 나머지는 INT4/INT2로 선택 적용하는 혼합 정밀도 양자화, 활성화 값은 FP16을 유지하고 가중치만 INT4로 압축하는 가중치 전용 양자화도 지원된다.
프루닝과 LiteRT-LM이 더하는 최적화
LiteRT 모델 최적화 툴킷은 중요도 낮은 뉴런·헤드를 제거해 추론 속도를 높이는 구조적 프루닝, 유사 가중치를 공유 코드북으로 대체하는 가중치 클러스터링, 프루닝 후 희소 행렬 연산으로 메모리 대역폭을 절감하는 스파스 행렬 최적화를 추가로 지원한다. TensorFlow Lite의 후계인 LiteRT 위에 대형 언어 모델 전용 최적화 레이어를 얹은 LiteRT-LM 런타임은 임베딩을 RAM에 전부 로드하지 않고 필요 시 파일 시스템에서 직접 참조하는 메모리 맵 PLE, 자기회귀 디코딩 시 키-값 캐시를 온디바이스 SRAM에 효율적으로 관리하는 KV-Cache 최적화, 모바일 워크로드에 맞춰 배치 처리 오버헤드를 없앤 배치 없는 단일 추론, Apple Neural Engine·ARM Cortex·Metal GPU 간 레이어를 분산 실행하는 CPU/GPU 혼합 실행을 제공한다.
마이크에서 텍스트까지 이어지는 파이프라인
Eloquent의 음성-텍스트 변환 파이프라인은 두 모드로 운용된다.
오프라인 모드가 거치는 단계들
발화 구간을 검출하고 무음 구간을 분리하는 VAD(Voice Activity Detection), 16kHz PCM 신호를 mel-spectrogram으로 변환한 뒤 오디오 토큰화하는 오디오 토크나이징, Gemma 4 Edge 모델이 오디오 토큰에서 원시 전사 텍스트를 생성하는 ASR 추론, 동일 모델 내에서 필러 워드를 제거하고 자기 수정 발화를 정리하며 문장 부호를 추가하는 텍스트 정제, 등록된 고유명사·전문어로 오탈자를 보정하는 개인 사전 보정 순으로 처리된다. 클라우드 하이브리드 모드에서는 음성에서 원시 텍스트로 바꾸는 ASR 추론은 온디바이스에서 동일하게 처리하고, 텍스트 후처리(정제·편집)만 Gemini API 클라우드 모델로 위임한다. 이때 네트워크로 전송되는 데이터는 오디오가 아니라 원시 전사 텍스트뿐이라 프라이버시가 부분적으로 보호된다.
완전 오프라인이 지키는 프라이버시
완전 오프라인 모드에서는 음성 데이터가 외부로 전혀 전송되지 않아, 개인 발화 패턴이나 의료·법률 등 민감 도메인 받아쓰기에도 쓸 수 있고 GDPR·HIPAA 같은 데이터 규제 환경에서의 활용 가능성도 넓다. 클라우드 RTT(Round-Trip Time) 제거로 실시간(real-time) 응답성이 확보되며, 네트워크 지연 0ms·서버 큐잉 지연 0ms로 항공기·지하·원격지 같은 오프라인 환경에서도 완전히 동작한다. Apple Neural Engine(ANE)·Qualcomm Hexagon DSP 같은 전용 AI 가속기를 직접 활용하고 Metal·Vulkan 기반 GPU 셰이더 연산도 지원해, 전용 가속기 활용으로 CPU 연산 대비 에너지 소비를 줄인다. Eloquent는 Google AI Edge 플랫폼(ai.google.dev/edge)의 실제 응용 사례이자 레퍼런스 구현체로, MediaPipe·LiteRT(구 TFLite)·AI Edge Quantizer·Gemma Edge 모델군이 이 생태계를 이룬다.
경쟁 솔루션과 나란히 놓고 보면
| 솔루션 | 오프라인 지원 | ASR 모델 | 텍스트 정제 | 프라이버시 |
|---|---|---|---|---|
| Google AI Edge Eloquent | 완전 지원 | Gemma 4 Edge | 온디바이스 | 최고 (온디바이스) |
| Apple 받아쓰기 | 부분 지원 | Apple 독자 | 제한적 | 높음 |
| Whisper (로컬 실행) | 완전 지원 | OpenAI Whisper | 없음 (별도 구성 필요) | 높음 |
| Google 클라우드 STT | 미지원 | 클라우드 전용 | 고품질 | 낮음 |
| OpenAI Whisper API | 미지원 | 클라우드 전용 | 제한적 | 낮음 |
다국어 확장과 안드로이드 출시를 기다리며
현재 영어 전용이지만 다국어 지원 추가가 공식 로드맵에 있고, 앱스토어 설명에 언급된 Android 버전도 출시가 예상된다. 의료·법률·기술 분야별 커스텀 ASR 모델로 확장할 가능성도 있고, 더 작은 Gemma 4 E1B 초경량 모델로 IoT 디바이스까지 뻗어나갈 수 있다. 온디바이스 화자 분리(diarization)와 결합한 실시간 회의 받아쓰기·회의록 자동화도 다음 단계로 거론된다. INT2/INT4 양자화·PLE·LiteRT-LM 등 다층적 최적화 기법을 결합해 1.5GB 이하 메모리로 실시간 음성 인식을 구현했다는 점에서, Eloquent는 Edge AI가 연구 영역을 벗어나 일상 생산성 도구로 진입했음을 보여주는 사례로 평가된다.
Sources
- Google AI Edge Eloquent | Google AI for Developers
- Google AI Edge Eloquent App - App Store
- Google quietly launched an AI dictation app that works offline | TechCrunch
- Google AI Edge Eloquent is a Gemma-powered dictation app that works offline - Neowin
- Google quietly releases free offline AI dictation app for iPhone | TNW
- Google AI Edge Eloquent is an offline voice dictation app - 9to5Google
- Google Launches AI Edge Eloquent Dictation App to Advance On-Device Speech Recognition | The AI Insider
- Gemma 4 for Edge Deployment: How the E2B and E4B Models Run on Phones and Raspberry Pi | MindStudio
- Bring state-of-the-art agentic skills to the edge with Gemma 4 - Google Developers Blog
- Bringing AI Closer to the Edge and On-Device with Gemma 4 | NVIDIA Technical Blog
- Google AI Edge Eloquent Dictation App: Offline AI That Edits Your Speech | Gadget Hacks
- Model optimization | Google AI Edge | Google AI for Developers