ViMax 멀티 에이전트 단편 영상 생성 파이프라인
ViMax가 스크립트 작성부터 스토리보드, 캐릭터 일관성 검증, 영상 합성까지 에이전트 협업으로 처리하는 구조를 분석한다.
2026-08-14 · 최초 발행 2026-06-10
아이디어가 완성 영상이 되는 경로
영상 한 편을 만들려면 시나리오, 장면 설계, 촬영 구도, 캐릭터 관리와 후반 작업이 서로 맞물려야 한다. 홍콩대학교 데이터 사이언스 연구실(HKUDS)이 공개한 ViMax는 이 협업 구조를 12개의 특화 AI 에이전트로 옮긴 오픈소스 프레임워크다. 아이디어 한 줄을 입력하면 스크립트 작성부터 스토리보드 설계, 장면 생성, 캐릭터 일관성 검증과 최종 렌더링까지 파이프라인이 자율적으로 이어진다.
ViMax의 정식 명칭은 Agentic Video Generation이다. 감독, 시나리오 작가, 프로듀서와 영상 생성기의 역할을 하나의 엔드투엔드 시스템에 묶었다. GitHub의 HKUDS/ViMax 저장소는 공개 후 1,100개 이상의 스타를 확보했으며, 프로젝트는 Python 3.12와 MIT 라이선스를 기반으로 한다.
입력 방식은 작업의 출발점에 따라 나뉜다.
- Idea2Video: 짧은 아이디어 문장에서 완성 영상을 생성한다.
- Novel2Video: 장편 소설이나 스토리 텍스트를 분할된 장면 영상으로 바꾼다.
- Script2Video: 작성이 끝난 스크립트를 영상으로 자동 합성한다.
- AutoCameo: 특정 인물이나 캐릭터를 영상 속에 자연스럽게 넣는다.
모드마다 별도의 제작 체계를 사용하는 것은 아니다. 같은 멀티 에이전트 파이프라인을 공유하면서 입력 상태에 맞는 에이전트부터 활성화한다.
제작팀을 에이전트로 나눈 구조
ViMax의 에이전트는 각자 정해진 입력을 받아 다음 단계에서 사용할 결과를 만든다. 중앙 오케스트레이션 레이어는 이 결과를 전달하고, 검증 실패가 발생하면 생성 단계로 작업을 되돌린다.
| 에이전트 | 맡은 작업 | 다음 단계로 넘기는 결과 |
|---|---|---|
| Script Agent | 텍스트에서 장면·캐릭터·액션 식별 | 구조화된 스크립트 |
| Scene Segmentation Agent | 스크립트를 개별 장면으로 분리 | 장면 메타데이터 |
| Character Extractor | 등장인물의 외형·성격 프로파일 추출 | 캐릭터 시트 |
| Storyboard Artist | 내러티브 의도를 시각적 프레임으로 변환 | 스토리보드 이미지 |
| Reference Image Selector | 장면별 레퍼런스 이미지 검색·선택 | 레퍼런스 세트 |
| Best Image Selector | 복수 후보에서 최적 이미지 선정 | 최종 프레임 후보 |
| Video Generator | 프레임 지시사항을 바탕으로 영상 생성 | 장면 클립 |
| Consistency Agent | 캐릭터와 스타일의 일관성 검증 | 검증 결과 |
| Sequencing Agent | 클립 순서와 전환 효과 결정 | 시퀀스 플랜 |
| Audio Sync Agent | 대사·배경음악·음향효과 동기화 | 오디오 트랙 |
| Output Composer | 클립과 오디오를 하나의 결과물로 합성 | 완성 영상 파일 |
장편 텍스트의 맥락을 장면까지 이어가는 RAG
Novel2Video가 장편 소설을 다룰 수 있는 배경에는 RAG(Retrieval-Augmented Generation) 기반 스크립트 설계 엔진이 있다. 텍스트를 일정 길이로 단순 분할하는 대신 플롯 전환점, 캐릭터 등장과 클라이맥스 같은 서사 구조를 분석해 의미상 자연스러운 경계를 찾는다.
분절 뒤에도 주요 플롯 전개, 캐릭터 대사와 인과관계는 RAG 컨텍스트에 남는다. 각 단위는 장면 번호, 배경 설명, 캐릭터 행동과 대사를 포함하는 표준 스크립트 형식으로 변환되고, 장면별 메타데이터와 함께 하위 에이전트로 전달된다.
이전 장면의 컨텍스트를 검색하고 참조하는 방식이므로 단순 청킹에서 생기는 맥락 단절을 줄일 수 있다. ViMax는 이 구조로 100페이지짜리 소설도 일관된 영상 시리즈로 변환한다.
스토리보드가 생성과 검증의 공통 명세가 된다
장면별 프레임이 좋아도 서사 흐름과 시각적 리듬이 맞지 않으면 영상 전체의 완성도는 떨어진다. Storyboard Artist Agent는 이미지를 순서대로 배치하는 데 그치지 않고 촬영 언어를 사용해 장면의 표현 방식을 정한다.
감정의 강도에 따라 클로즈업, 미디엄 샷, 롱 샷이나 버드아이 뷰 같은 카메라 앵글을 고른다. 팬, 틸트, 트래킹, 줌인과 줌아웃으로 움직임을 설계하고, 전경·중경·배경을 배치해 깊이와 프레이밍을 조절한다. 컷, 페이드와 크로스 디졸브 같은 전환 방식도 이 단계에서 다룬다.
완성된 스토리보드는 단순한 레이아웃이 아니다. Video Generator, Consistency Agent와 Sequencing Agent가 함께 참조하는 공유 명세서다. 하위 에이전트들이 같은 기준을 사용하면서 장면 사이의 시각 스타일을 맞춘다.
장면마다 달라지는 캐릭터를 어떻게 통제하는가
각 장면을 독립적으로 생성하면 같은 캐릭터가 다른 외모로 나타날 수 있다. ViMax는 캐릭터 프로파일을 고정하고, 생성 결과를 다시 검사하는 구조로 이 문제를 다룬다.
Character Extractor Agent는 캐릭터가 처음 등장할 때 헤어 컬러, 의상 스타일, 체형과 얼굴 특징을 캐릭터 시트로 정리한다. 이 시트는 이후 모든 장면을 만들 때 참조 컨텍스트로 주입된다.
영상이 생성된 뒤에는 Consistency Agent가 해당 클립을 이전 장면과 비교한다. 캐릭터 외형이나 시각 스타일이 기준에서 벗어나면 불일치 항목을 Video Generator에 전달하고 재생성을 요청한다. 통과할 때까지 생성과 검증이 연결되는 클로즈드 루프다.
유사한 접근법을 사용한 CineAGI 연구에서는 멀티 에이전트 일관성 검증이 기존 단일 모델보다 캐릭터 일관성을 28.7%, 전체 일관성을 40% 높였다. ViMax도 같은 연구 흐름의 설계 철학을 따른다.
영상 생성 프레임워크 사이에서 ViMax의 위치
멀티 에이전트 영상 생성은 ViMax만의 접근법은 아니다. 연구마다 일관성, 상태 기억, 음악 동기화나 시각 지시처럼 서로 다른 문제에 초점을 맞춘다.
| 프레임워크 | 개발 주체 | 중심 설계 | 강점 |
|---|---|---|---|
| ViMax | HKU HKUDS | 12개 에이전트, RAG 스크립트, 4가지 입력 모드 | 엔드투엔드, 오픈소스 |
| StoryAgent | 학술 연구 | LoRA-BE 인트라샷 일관성, 멀티 에이전트 | 커스터마이징 스토리텔링 |
| CineAGI | 학술 연구 | 캐릭터 중심 분리 파이프라인, 오디오-비주얼 동기화 | 멀티 캐릭터 일관성 |
| CoAgent | 학술 연구 | 내러티브 계획, 상태 메모리, 폐루프 검증 | 장편 코히런트 영상 |
| AutoMV | 학술 연구 | 음악 속성 추출을 활용한 뮤직비디오 생성 | 음악 동기화 |
| Kubrick | 학술 연구 | VLM 에이전트 협업과 합성 영상 생성 | 자연어에서 시각 지시로 변환 |
ViMax의 차이는 학술 프로토타입에 머물지 않고 실제로 사용할 수 있는 오픈소스로 공개됐다는 데 있다. pip 설치와 API 키 설정을 마치면 간단한 Python 코드 몇 줄로 실험할 수 있다.
콘텐츠 제작 현장에서의 활용
브랜드 스토리나 제품 소개 텍스트를 입력해 단편 홍보 영상을 만드는 콘텐츠 마케팅 자동화에 적용할 수 있다. 반복되는 SNS 쇼트폼 제작 비용을 크게 줄이는 용도다.
교육 분야에서는 교과서 단원의 내용을 Novel2Video에 넣어 학습용 애니메이션으로 바꿀 수 있다. 텍스트 중심의 학습 자료를 시각 콘텐츠로 빠르게 전환하는 작업에 맞는다.
시나리오 작가와 독립 창작자는 완성된 스크립트를 영상 프로토타입으로 시각화할 수 있다. 투자자나 파트너에게 보여줄 피치 영상을 만드는 데 특히 효과적이다. 게임 스튜디오는 스토리 기반 인게임 시네마틱을 자동 생성하고 핵심 게임플레이 개발에 리소스를 집중하는 방식으로 활용할 수 있다.
파이프라인을 계층별로 보면
입력부터 출력까지의 전체 구조는 스크립트 처리, 기획, 생성·검증과 후반 작업으로 이어진다. Consistency Agent의 검증에 실패한 클립만 Video Generator로 돌아가며, 통과한 결과는 시퀀싱과 오디오 동기화를 거쳐 최종 파일이 된다.
운영 전에 확인할 제약
ViMax의 오케스트레이션은 여러 모델 호출을 연결한다. 12개 에이전트가 순차 또는 병렬로 동작하고 각 단계에서 대형 언어 모델이나 비전 모델을 사용하므로 API 비용과 GPU 자원 소모가 크다. 장편 영상은 생성에 상당한 시간과 비용이 들 수 있다.
최종 클립의 품질은 ViMax 자체보다 백엔드의 텍스트-투-비디오 모델에 크게 좌우된다. Sora, Runway, Kling 같은 모델을 연결할 수 있지만 ViMax는 생성 모델을 대체하지 않는 오케스트레이션 레이어다.
Consistency Agent가 품질 기준을 충족하지 못한 클립을 Video Generator로 돌려보내는 구조도 실행 시간에 영향을 준다. 재생성 횟수가 늘면 전체 파이프라인의 완료 시점도 늦어진다.
현재 ViMax는 범용 모델을 기반으로 동작한다. 특정 영상 스타일이나 브랜드 아이덴티티를 계속 유지해야 한다면 도메인 특화 파인튜닝이 추가로 필요하다.
RAG 스크립트 엔진, 촬영 언어를 반영한 스토리보드와 클로즈드 루프 검증은 ViMax의 핵심 축이다. 이 구조는 단순히 클립을 생성하는 데서 멈추지 않고 서사와 시각적 일관성을 하나의 제작 흐름 안에서 관리한다. 다만 실제 활용 범위는 연산 비용과 생성 시간, 연결한 영상 생성 모델의 품질을 함께 고려해 정해야 한다.
Sources
- https://github.com/HKUDS/ViMax
- https://pyshine.com/ViMax-Agentic-Video-Generation-Multi-Agent-Framework/
- https://www.xugj520.cn/en/archives/vimax-agentic-video-generation.html
- https://dev.to/wonderlab/open-source-project-of-the-day-part-17-vimax-video-generation-framework-all-in-one-director-43p9
- https://pixel4it.com/vimax-agentic-video-generation-guide/
- https://arxiv.org/html/2604.23579v1
- https://arxiv.org/html/2512.22536v1
- https://arxiv.org/pdf/2411.04925
- https://arxiv.org/html/2503.07314v1
- https://arxiv.org/html/2512.16954v1