Cohere Transcribe — 오픈소스가 리더보드 1위에 오른 방법

HuggingFace Open ASR 리더보드 1위를 차지한 Cohere Transcribe의 비대칭 인코더-디코더 구조와 성능 비교, 회의록·접근성·콜센터 활용 시나리오, Whisper 대비 장단점을 정리한다.

2026-08-14 · 최초 발행 2026-04-03

음성 인식(ASR) 분야에서 오픈소스 모델이 상용 API를 능가하는 시대가 열리고 있다. Cohere가 2026년 3월 공개한 Transcribe는 HuggingFace Open ASR 리더보드에서 평균 WER 5.42%로 1위를 차지하며, Whisper Large v3, ElevenLabs Scribe v2, Qwen3-ASR 등 기존 강자들을 제치고 영어 음성 인식의 새로운 기준을 수립했다.

전사에만 집중한 대가

Cohere Transcribe(모델명: cohere-transcribe-03-2026)는 오디오 입력을 텍스트로 변환하는 전용 ASR 모델이다. 범용 음성 언어 모델이 아닌 음성 전사에 특화된 설계를 채택해 정확도와 효율성 모두에서 최적화를 달성했다. 파라미터는 2B(20억 개), 지원 언어는 14개, 라이선스는 Apache 2.0이며 50만 시간의 큐레이션된 오디오-텍스트 쌍으로 학습됐다. HuggingFace 무료 다운로드와 Cohere API(무료 제공) 두 경로로 배포된다.

인코더에 힘을 몰아준 이유

Cohere Transcribe는 Distil-Whisper의 접근법을 발전시켜, 전체 파라미터의 90% 이상을 인코더에 할당하고 경량 디코더를 유지하는 비대칭 구조를 채택했다. 이런 설계는 오토리그레시브 추론 연산량을 최소화하면서도 높은 성능을 유지할 수 있게 해준다.

오디오 입력특징 추출기대형 인코더(파라미터 90%+)경량 디코더(파라미터 10%-)텍스트 출력
구성 요소 설계 특징 효과
인코더 전체 파라미터의 90%+ 할당 음향 특징의 정밀 표현
디코더 경량화 (10%- 파라미터) 추론 연산량 최소화
학습 데이터 50만 시간 큐레이션 데이터 다양한 음향 환경 대응
멀티링구얼 14개 언어 동시 지원 단일 모델로 다국어 처리

순위표가 말해주는 것

HuggingFace Open ASR 리더보드에서 Cohere Transcribe의 성능을 주요 경쟁 모델과 비교하면 다음과 같다.

모델 유형 평균 WER(%) 영어 순위
Cohere Transcribe 오픈소스 5.42 1위
ElevenLabs Scribe v2 상용 API 약 6.0+ 2위권
Whisper Large v3 오픈소스 약 7.0+ 3위권
Qwen3-ASR-1.7B 오픈소스 약 7.5+ 4위권

다국어 성능에서도 Cohere Transcribe는 13개 비영어 언어에서 대부분의 벤치마크에서 기존 오픈소스 최고 모델과 동등하거나 우수한 결과를 보였으며, 다국어 ASR 리더보드에서 전체 4위, 오픈소스 중 2위를 기록했다.

소리가 검색 인덱스가 되기까지

Cohere Transcribe를 활용한 실무 음성 인식 파이프라인은 다음과 같이 구성할 수 있다.

음성 소스(마이크, 파일, 스트림)전처리(리샘플링, 노이즈 제거)음성 구간 검출(VAD)Cohere Transcribe(음성 전사)후처리(구두점, 대소문자)NLP 파이프라인(요약, 분류, 번역)출력(자막, 회의록, 검색 인덱스)

회의록에서 콜센터까지

Cohere Transcribe의 낮은 WER은 회의록 자동 생성 파이프라인의 핵심 구성 요소로 쓸 수 있다. Apache 2.0 라이선스로 온프레미스 배포가 가능해, 기밀 회의 내용이 외부 API로 전송되지 않아야 하는 기업 환경에 적합하다.

동영상·팟캐스트 콘텐츠의 자막 생성도 자동화할 수 있다. 14개 언어 지원으로 다국어 콘텐츠의 접근성을 단일 모델로 향상시킬 수 있고, 무료 API 제공으로 소규모 서비스도 부담 없이 도입할 수 있다.

고객 상담 통화를 실시간으로 전사하고 후속 NLP 파이프라인과 연결하면 감정 분석, 주제 분류, 품질 평가까지 자동화할 수 있다.

Whisper와 비교하면

정확도에서는 WER 5.42%로 Whisper Large v3 대비 약 1.5% 이상 낮은 오류율을 달성했고, 효율성에서는 비대칭 인코더-디코더 구조로 추론 비용을 줄였다. 접근성 면에서는 Apache 2.0 라이선스와 무료 API로 진입 장벽이 낮고, 14개 언어를 단일 모델로 지원한다는 것도 장점이다.

다만 2B 파라미터는 엣지 디바이스 배포에 추가 최적화가 필요하고, 14개 언어는 Whisper의 99개 언어 지원보다 제한적이다. 음성 전사 전용으로 설계돼 음성 이해(Speech Understanding)나 QA 기능은 포함돼 있지 않다.

Cohere Transcribe는 ASR 전용 설계와 50만 시간 큐레이션 데이터 학습을 통해 HuggingFace Open ASR 리더보드 1위를 달성한 오픈소스 모델이다. 비대칭 인코더-디코더 아키텍처로 높은 정확도와 추론 효율성을 동시에 확보했으며, Apache 2.0 라이선스와 무료 API 제공으로 실무 도입의 장벽을 크게 낮췄다. 다만 언어 범위와 기능 확장성 측면에서는 후속 업데이트가 기대되는 상황이다.

Sources

Cohere Transcribe음성 인식Open ASRWhisperWER