CVSS(Common Voice Speech Synthesis) — 구글의 다국어 음성 번역 시스템
구글이 공개한 다국어 음성-음성 번역 코퍼스 CVSS의 ASR·MT·TTS 구조, CVSS-C/CVSS-T 방식, End-to-End·Cascade 번역 유형과 활용 사례를 정리한다.
2026-08-14 · 최초 발행 2025-05-23
CVSS는 컴퓨터 보안 분야의 취약점 점수 체계(Common Vulnerability Scoring System)와 이름이 같지만 전혀 다른 시스템이다. 여기서 다루는 CVSS는 Common Voice Speech Synthesis의 약자로, 구글이 오픈소스로 공개한 다국어 음성-음성 번역 시스템이다. 21개 언어에서 영어로, 영어에서 15개 언어로 직접 전문 번역이 가능한 말뭉치(코퍼스)를 제공하며, 언어 장벽을 음성 대 음성으로 바로 넘어서려는 시도로 평가받는다.
ASR·MT·TTS로 이어지는 파이프라인
CVSS는 세 가지 핵심 기술 요소로 구성된다. 자동음성인식(ASR: Automatic Speech Recognition)은 사람의 음성을 텍스트로 변환하며, 다양한 억양·방언·배경 소음에도 정확히 인식하도록 딥러닝 알고리즘을 활용하고 실시간 처리 능력을 갖춘다. 기계번역(MT: Machine Translation)은 인식된 텍스트를 목표 언어로 옮기며, 문맥적 의미와 문화적 뉘앙스를 고려한 신경망 기반 번역 모델을 적용해 지속적으로 품질을 개선한다. 텍스트음성변환(TTS: Text-to-Speech)은 번역된 텍스트를 자연스러운 음성으로 바꾸며, 억양·속도·음조를 조절해 발화를 자연스럽게 만들고 다양한 목소리 타입을 제공한다.
표준 음성으로 갈 것인가, 원본 목소리를 살릴 것인가
CVSS는 목적에 따라 두 방식으로 나뉜다. CVSS-C(Common Voice Speech Synthesis - Common)는 모든 번역 음성을 단일 표준화자의 음성으로 전달해 일관된 사용자 경험을 만든다. 관광 가이드 앱, 다국어 고객 서비스 시스템, 교육용 언어 학습 도구, 국제 회의 통역 지원처럼 일반 사용자 대면 번역에 최적화되어 있다.
CVSS-T(Common Voice Speech Synthesis - Targeted)는 소스 음성에서 목소리 특성을 캡처해 보존하므로, 언어가 달라져도 원본과 번역본의 음성 특성이 비슷하게 유지된다. 영화·TV 프로그램 더빙, 다국어 비디오 컨퍼런싱, 개인화된 언어 학습 솔루션, 다국어 가상 비서처럼 원본과의 음성적 연속성이 중요한 영역에 적합하다.
바로 넘길 것인가, 단계를 거칠 것인가
음성-음성 번역을 구현하는 방식도 두 갈래로 나뉜다. End-to-End Direct S2ST(Speech-to-Speech Translation)는 입력 음성에서 곧바로 출력 음성으로 번역하는 방식으로, 중간 텍스트 변환 과정이 없어 지연 시간이 짧고 음향 특성과 운율(prosody) 보존에 강점이 있다.
처리 속도가 빠르고 텍스트 변환 오류 가능성이 줄어들며 음성의 감정적 특성을 보존할 수 있다는 장점이 있지만, 계산 복잡성이 높고 대규모 학습 데이터가 필요하며 디버깅과 오류 수정이 어렵다는 단점도 따른다.
Cascade Direct S2ST는 입력 음성에서 텍스트로, 다시 번역 텍스트로, 마지막으로 출력 음성으로 이어지는 단계적 접근이다.
각 단계별로 최적화된 모듈을 연결할 수 있어 시스템 구성이 유연하고, 각 모듈을 독립적으로 최적화할 수 있으며 중간 결과를 확인하며 디버깅하기 쉽고 기존 ASR·MT·TTS 시스템을 그대로 활용할 수 있다는 장점이 있다. 다만 각 단계에서 오류가 누적될 수 있고, 처리 시간이 상대적으로 길며, 음성 특성 보존에 제한이 있다는 점은 단점이다.
실제로 어디에 쓰이는가
국제 비즈니스 컨퍼런스에서는 CVSS-C를 활용해 발표자의 음성을 여러 언어로 동시 번역하고, 각 참가자가 자신의 언어로 발표 내용을 들을 수 있게 한다. 다국어 고객 서비스 센터는 CVSS-C 기반 음성 대응 시스템으로 상담원과 고객 간 실시간 언어 장벽을 없애 고객 만족도와 서비스 범위를 넓힌다. 국제 영화 배급에서는 CVSS-T로 배우의 목소리 특성을 유지하면서 원본에 가까운 더빙을 제작해, 현지화되었지만 원작의 느낌을 살린 경험을 제공한다. 다국어 교육 플랫폼은 원어민 강사의 발음 특성을 유지한 채 교육 콘텐츠를 여러 언어로 제공하는 데 CVSS를 적용한다.
아직 풀지 못한 과제들
관용구·은유·문화적 참조 같은 문화적 뉘앙스를 정확히 번역하는 일은 여전히 어렵고, 문맥을 고려한 의미적 번역 능력이 더 필요하다. 화자의 감정·강조·억양을 번역된 언어로 자연스럽게 표현하는 음성 특성 보존은 특히 CVSS-T에서 중요한 문제로 남아 있다. 고품질 번역과 빠른 응답 시간 사이의 균형을 맞추는 실시간 처리 속도, 모바일 같은 제한된 컴퓨팅 자원에서의 최적화도 과제다. 표준어가 아닌 사투리나 비표준 발음, 다양한 발화 스타일에 대한 적응력을 높이는 일도 남아 있다.
어디로 향하고 있는가
음성뿐 아니라 제스처·표정 같은 비언어적 요소까지 함께 고려하는 멀티모달 통합, AR/VR 환경과 결합한 몰입형 다국어 커뮤니케이션이 다음 방향으로 거론된다. 현재 지원하지 않는 저자원 언어로의 지원 확대, 적은 학습 데이터로도 효과적인 번역을 가능케 하는 기술, 사용자의 말투와 대화 맥락을 학습해 더 정확한 번역을 제공하는 개인화, 의학·법률 같은 특정 도메인에 최적화된 번역 모델도 발전 방향으로 제시된다. 클라우드 의존성을 줄이고 개인정보 보호를 강화하는 온디바이스 처리 역시 모바일 환경에서 고품질 번역을 제공하기 위한 과제로 남아 있다.