PersonaPlex — 듣는 동시에 말하는 음성 AI
NVIDIA PersonaPlex의 풀듀플렉스 음성 대화 아키텍처와 하이브리드 프롬프팅 시스템, 학습 데이터 구성, Gemini Live 대비 화자 전환 지연·끼어들기 성공률 벤치마크를 정리한다.
2026-08-14 · 최초 발행 2026-04-11
기존 음성 AI는 사용자의 말이 끝나야 응답을 시작하는 반이중(half-duplex) 방식이었다. NVIDIA가 2026년 1월 공개한 PersonaPlex는 이 한계를 넘어 듣기와 말하기를 동시에 수행하는 풀듀플렉스(full-duplex) 음성 대화 모델이다. 7B 파라미터 규모의 오픈 모델로, 화자 전환 지연이 0.07초에 불과하며 Gemini Live(1.3초)를 크게 앞서는 자연스러운 대화 경험을 제공한다.
사람의 대화는 원래 겹쳐서 흐른다
인간의 자연스러운 대화는 본질적으로 풀듀플렉스다. 상대방의 말을 들으면서 맞장구를 치고, 적절한 타이밍에 끼어들며, 동시에 다음 발화를 준비한다. 기존 음성 AI 시스템은 이러한 동시성을 지원하지 못했다. 사용자 발화 완료 후 ASR(음성 인식)→LLM 처리→TTS(음성 합성)를 순차 실행하는 반이중(Half-Duplex) 방식과 달리, 풀듀플렉스(Full-Duplex)는 입력 음성 처리와 출력 음성 생성을 동시에 수행한다. 화자가 전환되는 자연스러운 타이밍을 감지하는 턴테이킹(Turn-Taking), "응"·"그렇지" 같은 상대방 발화 중 삽입되는 반응 신호인 백채널링(Backchanneling)도 여기서 함께 요구된다.
기존 캐스케이드 파이프라인(ASR→LLM→TTS)은 각 단계의 지연이 누적돼 자연스러운 대화 리듬을 깨뜨렸다. PersonaPlex는 이 파이프라인을 단일 트랜스포머 아키텍처로 통합해 근본적으로 다른 접근법을 취한다.
하나의 트랜스포머로 듣고 말하다
PersonaPlex는 Kyutai의 Moshi 아키텍처와 가중치를 기반으로 구축됐다. 단일 트랜스포머 네트워크 내에서 음성 이해와 생성을 동기적으로 처리해, 자연스러운 끼어들기, 중첩 발화, 빠른 턴테이킹, 맥락 인식 백채널을 지원한다.
| 컴포넌트 | 역할 | 상세 |
|---|---|---|
| Moshi 아키텍처 | 풀듀플렉스 기반 프레임워크 | 입출력 동시 처리 구조 |
| Helium LM | 언어 모델 백본 | 의미 이해와 일반화 담당 |
| 보이스 프롬프트 | 음성 특성 정의 | 오디오 토큰 시퀀스로 목표 화자 스타일 설정 |
| 텍스트 프롬프트 | 페르소나 속성 정의 | 역할, 배경, 시나리오 맥락 지정 |
목소리와 역할을 함께 지정하다
PersonaPlex의 차별적 특징은 보이스 프롬프트와 텍스트 프롬프트를 결합한 하이브리드 프롬프팅 시스템이다. 이 두 프롬프트가 함께 모델의 대화 정체성(conversational identity)을 정의한다. 오디오 토큰 시퀀스로 구성돼 목표 음성 특성과 발화 스타일을 설정하는 보이스 프롬프트, 페르소나 속성(역할, 배경, 시나리오 맥락)을 지정하는 텍스트 프롬프트가 결합하면 특정 음색의 목소리로 특정 역할을 수행하는 AI 캐릭터가 만들어진다. 고객 서비스 에이전트, 교육 튜터, 게임 NPC 등 다양한 역할 수행에 이 조합이 활용된다.
실제 대화와 합성 대화를 섞어 학습하다
PersonaPlex의 학습은 실제 인간 대화 데이터와 합성 데이터를 결합하는 전략을 채택한다. 이 조합으로 자연스러운 대화 역학과 안정적인 태스크 수행 능력을 동시에 달성한다.
Fisher English Corpus는 7,303개의 실제 전화 대화로 총 1,217시간 분량이다. 실제 대화에서 각 화자의 맥락과 성격 특성을 LLM으로 역생성하는 LLM 역추론을 거쳐, 39,322개의 합성 어시스턴트 대화와 105,410개의 시나리오별 합성 고객 서비스 대화를 생성했다. Moshi 사전학습 가중치를 기반으로 5,000시간 미만의 지도 데이터만으로 태스크 수행 능력을 확보했다.
사람보다 빠른 전환
PersonaPlex는 대화 자연스러움(Dialog Naturalness MOS)에서 경쟁 모델을 상회하는 성능을 달성했다.
| 모델 | Dialog Naturalness MOS | 끼어들기 성공률 | 화자 전환 지연 |
|---|---|---|---|
| PersonaPlex | 3.90 | 100% | 0.07초 |
| Gemini Live | 3.72 | - | 1.3초 |
| Qwen 2.5 Omni | 3.70 | - | - |
| Moshi(베이스라인) | 3.11 | - | - |
특히 사용자 끼어들기에 대한 100% 성공률은 풀듀플렉스 아키텍처의 실질적 효과를 입증한다. 화자 전환 지연 0.07초는 인간 대화의 평균 전환 간격(약 0.2초)보다도 빠르다.
목소리와 코드를 모두 열다
PersonaPlex는 모델 가중치와 코드를 Hugging Face와 GitHub에서 완전 공개했다. nvidia/personaplex-7b-v1로 접근 가능하며, 연구자와 개발자가 자유롭게 활용할 수 있다. 자연스러운 음성 상담 에이전트를 구축하는 고객 서비스, 실시간 대화형 언어 학습 튜터로서의 교육, NPC와의 자연스러운 음성 인터랙션이 필요한 게임, 음성 기반 인터페이스가 필요한 사용자를 위한 어시스턴트가 활용 전망으로 꼽힌다.
NVIDIA PersonaPlex는 풀듀플렉스 아키텍처로 음성 AI의 자연스러움을 한 단계 끌어올린 모델이다. 0.07초의 화자 전환 지연과 100% 끼어들기 성공률은 기존 반이중 방식의 근본적 한계를 극복했음을 보여준다. 하이브리드 프롬프팅 시스템으로 음성 특성과 페르소나를 동시에 제어할 수 있으며, 오픈소스 공개로 다양한 응용 분야에서의 활용이 기대된다.