NVIDIA PersonaPlex로 구현하는 풀듀플렉스 음성 AI

NVIDIA PersonaPlex의 풀듀플렉스 음성 대화 구조, 하이브리드 프롬프팅, 학습 데이터와 성능 지표를 정리한다.

2026-08-15 · 최초 발행 2026-04-11

음성 대화의 병목은 발화가 끝날 때까지 기다리는 구조에 있다

기존 음성 AI는 사용자의 발화가 끝난 뒤 ASR(음성 인식), LLM 처리, TTS(음성 합성)를 차례로 수행하는 반이중(half-duplex) 방식에 머물렀다. 각 단계의 지연이 누적되면 대화의 리듬도 끊긴다.

NVIDIA가 2026년 1월 공개한 PersonaPlex는 듣기와 말하기를 함께 처리하는 풀듀플렉스(full-duplex) 음성 대화 모델이다. 7B 파라미터 규모의 오픈 모델이며, 화자 전환 지연은 0.07초다. Gemini Live의 1.3초와 비교되는 수치다.

사람 사이의 대화에서는 상대가 말하는 도중에도 맞장구를 치고, 끼어들 시점을 판단하며, 다음 발화를 준비한다. 여기서 필요한 동작은 다음과 같다.

  • 반이중(Half-Duplex): 사용자 발화 완료 → ASR(음성 인식) → LLM 처리 → TTS(음성 합성) 순차 실행
  • 풀듀플렉스(Full-Duplex): 입력 음성 처리와 출력 음성 생성을 동시에 수행
  • 턴테이킹(Turn-Taking): 대화에서 화자가 전환되는 자연스러운 타이밍 감지
  • 백채널링(Backchanneling): "응", "그렇지" 같은 상대방의 발화 중 삽입되는 반응 신호

PersonaPlex는 ASR→LLM→TTS 캐스케이드 대신, 이 흐름을 단일 트랜스포머 아키텍처로 통합한다.

단일 트랜스포머에서 입력과 응답을 함께 다루는 방식

PersonaPlex는 Kyutai의 Moshi 아키텍처와 가중치를 기반으로 구축됐다. 음성 이해와 음성 생성을 단일 트랜스포머 네트워크 안에서 동기적으로 처리해, 중첩 발화와 빠른 화자 전환, 자연스러운 끼어들기, 맥락을 반영한 백채널을 지원한다.

백채널 필요턴테이킹끼어들기 감지입력 음성 스트림오디오 토크나이저Helium 언어 모델 백본보이스 프롬프트(음성 특성)텍스트 프롬프트(페르소나속성)음성 디코더출력 음성 스트림대화 상태 판단반응 신호 생성화자 전환 실행현재 발화 중단
컴포넌트 역할 상세
Moshi 아키텍처 풀듀플렉스 기반 프레임워크 입출력 동시 처리 구조
Helium LM 언어 모델 백본 의미 이해와 일반화 담당
보이스 프롬프트 음성 특성 정의 오디오 토큰 시퀀스로 목표 화자 스타일 설정
텍스트 프롬프트 페르소나 속성 정의 역할, 배경, 시나리오 맥락 지정

목소리와 역할을 함께 지정하는 하이브리드 프롬프팅

PersonaPlex는 보이스 프롬프트와 텍스트 프롬프트를 결합해 대화 정체성(conversational identity)을 설정한다.

보이스 프롬프트는 오디오 토큰 시퀀스로 구성되며 목표 음성 특성과 발화 스타일을 정한다. 텍스트 프롬프트는 역할, 배경, 시나리오 맥락처럼 페르소나의 속성을 지정한다. 두 입력을 함께 사용하면 특정 음색으로 특정 역할을 수행하는 AI 캐릭터를 만들 수 있다.

고객 서비스 에이전트, 교육 튜터, 게임 NPC는 이 방식의 활용 시나리오다.

실제 대화와 합성 대화를 결합한 학습

학습에는 실제 인간 대화 데이터와 합성 데이터가 함께 사용된다. 자연스러운 대화 역학을 학습하는 한편, 태스크 수행 능력도 확보하기 위한 구성이다.

Fisher English Corpus7,303개 실제 대화1,217시간 음성 데이터LLM 기반 생성39,322개 합성 어시스턴트대화105,410개 합성 고객 서비스대화PersonaPlex 학습페르소나 감독 학습

Fisher English Corpus에는 실제 전화 대화 7,303개와 총 1,217시간의 음성 데이터가 포함된다. PersonaPlex는 실제 대화의 각 화자에 대한 맥락과 성격 특성을 LLM으로 역생성하는 방식을 사용했다.

여기에 39,322개의 합성 어시스턴트 대화와 105,410개의 합성 고객 서비스 대화를 더했다. Moshi 사전학습 가중치를 기반으로 5,000시간 미만의 지도 데이터에서 태스크 수행 능력을 확보했다.

자연스러움과 화자 전환 지표

PersonaPlex는 대화 자연스러움(Dialog Naturalness MOS)에서 비교 모델보다 높은 수치를 기록했다.

모델 Dialog Naturalness MOS 끼어들기 성공률 화자 전환 지연
PersonaPlex 3.90 100% 0.07초
Gemini Live 3.72 - 1.3초
Qwen 2.5 Omni 3.70 - -
Moshi(베이스라인) 3.11 - -

사용자 끼어들기에 대한 100% 성공률은 풀듀플렉스 아키텍처가 실제 대화 상호작용에 미치는 효과를 보여준다. 0.07초의 화자 전환 지연은 인간 대화의 평균 전환 간격인 약 0.2초보다도 빠르다.

공개 모델로 가능한 음성 인터페이스

PersonaPlex는 모델 가중치와 코드를 Hugging Face와 GitHub에서 완전 공개했다. nvidia/personaplex-7b-v1로 접근할 수 있어 연구자와 개발자가 활용할 수 있다.

자연스러운 음성 상담 에이전트, 실시간 대화형 언어 학습 튜터, 음성으로 상호작용하는 게임 NPC, 음성 기반 인터페이스가 필요한 사용자를 위한 어시스턴트가 적용 대상으로 제시된다. 풀듀플렉스 처리와 하이브리드 프롬프팅은 음성 특성 및 페르소나를 함께 제어해야 하는 대화형 시스템에서 특히 주목할 구조다.

Sources

PersonaPlexNVIDIA음성 AI풀듀플렉스AI 에이전트