NVIDIA Cosmos 3가 통합한 물리 AI 추론과 행동 생성
NVIDIA Cosmos 3의 Two-Tower 구조와 행동 생성, 모델 패밀리, 오픈 배포 경로, Gemini Robotics와의 차이를 정리한다.
2026-08-14 · 최초 발행 2026-06-10
추론과 생성이 한 모델 안에서 만나는 이유
2026년 6월 1일 NVIDIA가 공개한 Cosmos 3는 물리 법칙에 기반한 추론, 월드 생성, 행동 생성을 단일 모델로 묶는다. 텍스트와 이미지, 비디오, 앰비언트 사운드, 행동 데이터를 네이티브로 이해하고 생성하는 세계 최초의 완전 오픈 옴니모델이며, 훈련에는 20조 토큰의 멀티모달 데이터가 사용됐다.
현실에서 움직이는 로봇에는 서로 맞물린 세 가지 능력이 필요하다. 먼저 주변 환경과 객체의 관계를 이해해야 한다. 이어서 다음 상태를 예측하거나 훈련에 쓸 세계를 합성해야 한다. 마지막에는 이해한 내용을 모터 제어, 관절 각도, 이동 궤적 같은 실행 가능한 행동으로 바꿔야 한다.
기존 Physical AI 스택에서는 이 역할이 분리돼 있었다. 비전-언어 모델이 장면을 해석하고, 시뮬레이터가 환경을 만들며, 정책 모델이 행동을 결정했다. 개발자는 대규모 실제 훈련 데이터를 모으는 동시에 서로 다른 시스템을 통합해야 했다.
Cosmos 3는 분리됐던 시뮬레이션과 추론, 행동 예측 파이프라인을 하나의 파운데이션 모델 아래 놓는다. 모델이 행동을 내놓기 전에 물리적 맥락을 먼저 해석하는, 이른바 “Think Before It Acts” 구조다.
Reasoner와 Generator를 연결하는 Two-Tower MoT
Cosmos 3의 중심에는 Mixture-of-Transformers(MoT) 아키텍처가 있다. 기존 Mixture-of-Experts(MoE)와 달리 각 트랜스포머 레이어에 서로 다른 파라미터 세트를 사용하는 두 타워를 둔다.
생성에 앞서 물리 맥락을 읽는 Reasoner Tower
Reasoner Tower는 자기회귀 트랜스포머 기반의 비전-언어 모델이다. 이미지와 비디오, 텍스트를 비롯한 멀티모달 관측값에서 객체 사이의 상호작용, 물체의 운동 패턴, 시공간 관계를 파악한다. Generator Tower가 결과물을 만들기 전에 필요한 물리적 맥락을 구성하는 역할이다.
Cosmos3-Nano는 Qwen3-VL 8B 아키텍처를 기반으로 한 16B 파라미터 모델이다. Cosmos3-Super는 Qwen3-VL 32B 아키텍처를 기반으로 하며 64B 파라미터를 갖는다.
조건에 맞는 세계와 행동을 만드는 Generator Tower
Generator Tower는 확산 트랜스포머다. Reasoner Tower가 해석한 맥락을 조건으로 받아 물리적으로 그럴듯한 비디오 시퀀스와 동기화된 오디오, 행동 궤적을 생성한다.
두 타워의 파라미터는 각 레이어에서 분리돼 있지만 Joint Attention을 통해 정보를 주고받는다. 그 결과 같은 모델을 VLM, 비디오 생성기, 순방향·역방향 다이나믹스 모델, 로봇 정책 모델로 사용할 수 있으며 역할에 따라 아키텍처를 바꿀 필요가 없다.
출력 방식은 모달리티에 따라 달라진다. 텍스트는 표준 다음 토큰 자기회귀 디코딩으로 생성된다. 이미지와 비디오, 오디오, 행동 같은 비텍스트 데이터는 반복적 노이즈 제거를 거쳐 합성된다. 서로 다른 형식의 결과물이 하나의 통합 추론 패스에서 함께 나오는 구조다.
Super·Nano·Edge가 맡는 배포 영역
Cosmos 3 패밀리는 개발 단계와 실행 환경에 맞춰 구분된다.
| 구분 | 파라미터 | 기반 아키텍처 | 주요 용도 |
|---|---|---|---|
| Cosmos 3 Super | 64B | Qwen3-VL 32B | 포스트 트레이닝·최고 정확도 로봇·AV |
| Cosmos 3 Nano | 16B | Qwen3-VL 8B | 빠른 비디오·행동 추론, 경량 배포 |
| Cosmos 3 Edge | 미공개 | 미공개 | 실시간 엣지 온-디바이스 추론 (출시 예정) |
Cosmos 3 Super는 포스트 트레이닝 로봇·AV 모델과 최고 수준의 물리 정확도, 고품질 비디오·행동 생성에 초점을 맞춘다. Cosmos 3 Nano는 고품질 비디오·행동 추론을 수분의 1초 안에 처리하는 경량 구조다. 출시 예정인 Cosmos 3 Edge는 로봇과 AV의 실시간 온디바이스 추론을 겨냥한다.
장면 해석을 실행 가능한 행동으로 바꾸기
Cosmos 3는 시나리오를 설명하거나 비디오를 합성하는 데서 멈추지 않는다. 로봇이 실제로 사용할 수 있는 수치 행동 데이터를 모델 안에서 직접 생성한다.
출력 대상에는 로봇 팔의 각 관절이 취할 관절 각도(Joint Angles), 물체를 잡거나 놓을 때 필요한 그리퍼 위치(Gripper Positions), 이동 경로를 시계열 좌표로 표현한 궤적 포인트(Trajectory Points), 자율주행 차량의 자기 운동을 나타내는 **에고모션(Egocentric Motion)**이 포함된다.
이 데이터는 로봇 정책 모델의 학습 자료로 쓰거나 합성 훈련 데이터셋을 만드는 데 활용할 수 있다. 빨래 개기, 창고 안전 시나리오 합성, 자율주행 시뮬레이션 생성이 구체적인 적용 사례다.
물리 세계를 학습한 데이터 규모
Cosmos 3의 훈련에는 역대 최대 규모의 멀티모달 Physical AI 데이터셋이 사용됐다. 전체 규모는 20조 토큰이며 텍스트, 이미지, 비디오, 오디오, 행동 데이터가 포함된다. 이미지 데이터는 약 10억 장, 실제 및 합성 비디오는 4억 건이다. 여기에 인간과 로봇의 행동 궤적, 앰비언트 오디오가 함께 들어간다.
데이터셋은 NVIDIA 소유 데이터와 공개적으로 이용할 수 있는 상업적 허용 데이터로 구성됐다. 알려진 제한 콘텐츠는 큐레이션 과정에서 제외됐다.
오픈 가중치부터 프로덕션 엔드포인트까지
Cosmos 3의 배포 경로는 직접 실행과 관리형 접근을 함께 제공한다. HuggingFace에서는 OpenMDW-1.1 라이선스가 적용된 오픈 가중치를 받을 수 있다. 공개 모델에는 Cosmos3-Nano, Cosmos3-Super, Cosmos3-Super-Text2Image, Cosmos3-Super-Image2Video가 포함된다.
OpenMDW-1.1은 Linux Foundation이 2026년 5월 28일 공개한 Open Model Distribution and Weights 프레임워크다. 모델 가중치와 코드, 문서, 데이터를 하나의 법적 구조로 관리해 상업적 활용과 커뮤니티 기여에 적용할 규칙을 제시한다.
프로덕션 환경에서는 Cosmos 3 Reasoner NIM을 사용할 수 있다. 사전 구축·최적화된 컨테이너가 텍스트, 이미지, 비디오를 입력받아 텍스트를 반환하는 OpenAI 호환 서버를 제공한다. 온프레미스와 클라우드 배포를 모두 지원하며 프로덕션 등급 Reasoner 엔드포인트로 가는 가장 빠른 경로다.
API를 바로 시험하려면 build.nvidia.com을 이용한다. 합성 데이터 생성과 파인튜닝 도구는 GitHub의 NVIDIA/cosmos 리포지토리에서 제공된다.
| 목적 | 접근 방법 | 주소 |
|---|---|---|
| 모델 직접 실험 | build.nvidia.com API 엔드포인트 | build.nvidia.com |
| 오픈 가중치 다운로드 | HuggingFace (nvidia/Cosmos3-Nano, nvidia/Cosmos3-Super) | huggingface.co/nvidia |
| 합성 데이터 생성·파인튜닝 | GitHub NVIDIA/cosmos 리포지토리 | github.com/NVIDIA/cosmos |
| 프로덕션 배포 | NVIDIA NIM 마이크로서비스 (Reasoner NIM) | NVIDIA NIM 카탈로그 |
| 기술 문서 | NVIDIA Technical Blog·기술 리포트 PDF | developer.nvidia.com |
Gemini Robotics와 갈리는 생태계 전략
2026년 Physical AI 파운데이션 모델 시장에서는 NVIDIA와 Google DeepMind가 서로 다른 전략을 취하고 있다.
| 비교 항목 | Cosmos 3 | Gemini Robotics-ER 1.6 |
|---|---|---|
| 아키텍처 | Two-Tower MoT (자기회귀 + 확산) | VLA (Gemini 2.0 기반) |
| 오픈 여부 | 완전 오픈 가중치 (OpenMDW-1.1) | API 접근 (클로즈드 가중치) |
| 행동 생성 | 네이티브 (모델 내장) | 네이티브 (VLA 구조) |
| 훈련 데이터 규모 | 20조 토큰, 4억 비디오 | 공개되지 않음 |
| 모달리티 | 텍스트·이미지·비디오·오디오·행동 | 텍스트·이미지·비디오·행동 |
| 강점 | 오픈소스 생태계, 합성 데이터 생성 | 정밀 조작, Gemini 언어 추론 |
| 배포 경로 | HuggingFace, NIM, 온프레미스 | Gemini API, Google AI Studio |
| 최신 모델 | Cosmos 3 Super (64B), Nano (16B) | Gemini Robotics-ER 1.6 |
Cosmos 3는 자기회귀 Reasoner와 확산 Generator를 결합한 Two-Tower MoT를 사용한다. Gemini Robotics-ER 1.6은 Gemini 2.0 기반 VLA 구조다. 두 모델 모두 행동을 네이티브로 생성하지만 공개와 배포 방식이 다르다.
NVIDIA는 가중치를 내려받아 온프레미스에서 파인튜닝하고 합성 데이터를 만들 수 있는 오픈소스 생태계 전략을 택했다. 이 접근은 GPU 하드웨어 사업과도 연결된다. Google DeepMind는 Gemini API와 Google AI Studio를 통한 클라우드 접근을 유지한다. Gemini Robotics-ER 1.6은 공간 추론과 멀티뷰 이해를 강화해 더 높은 자율성을 지닌 물리 에이전트를 지향하며, 정밀 조작에서는 오리가미 접기와 세밀한 물체 파악에 특화된 능력을 보인다.
합성 데이터와 정책 모델이 이어지는 과정
Cosmos 3를 로봇·자율주행 개발에 넣으면 장면 추론부터 정책 모델 배포까지의 흐름이 다음과 같이 연결된다.
개발자가 장면 이미지와 작업 지시를 입력하면 Reasoner가 객체 관계와 운동, 공간 정보를 해석한다. Generator는 이 맥락을 받아 비디오와 행동 궤적을 포함한 합성 데이터를 만들고, 개발자는 반환된 데이터로 정책 모델을 훈련한다. 배포된 정책 모델은 실제 로봇이나 AV에 관절 각도, 그리퍼 위치, 궤적을 전달한다. 실행 결과는 다시 Reasoner에 피드백되고 정책 모델을 위한 인컨텍스트 개선 제안으로 이어진다.
Cosmos 3는 이 과정에서 합성 데이터 생성기와 실시간 추론 엔진 역할을 함께 맡는다. 물체 낙하, 충돌 직전 상황, 악천후처럼 실제 세계에서 수집하기 어려운 희귀 시나리오도 물리 법칙을 따르는 합성 데이터로 만들 수 있다. 이렇게 생성한 데이터는 정책 모델의 일반화 능력을 높이는 데 사용된다.
Physical AI 개발이 향하는 방향
Cosmos 3는 단일 기능 모델에서 옴니모달 모델로 이동하는 흐름을 보여준다. 텍스트, 이미지, 비디오, 오디오, 행동이라는 5가지 모달리티를 네이티브로 통합해 장면 해석과 생성, 실행 데이터 출력을 하나의 모델에서 처리한다.
합성 데이터의 비중도 커진다. 실제 로봇 데이터를 모으는 데 드는 비용과 안전 리스크 때문에 물리 정확도를 갖춘 합성 데이터 생성은 Physical AI 개발의 핵심 경쟁력이 되고 있다. Cosmos 3는 이 데이터를 정책 모델 훈련과 시뮬레이션에 직접 연결한다.
완전 오픈 가중치 전략은 파운데이션 모델의 활용 방식에도 영향을 준다. OpenAI와 Google이 클로즈드 모델을 유지하는 가운데 NVIDIA는 개발자가 모델을 직접 내려받고 수정할 수 있는 경로를 제공한다. 이는 GPU 판매와의 시너지를 확대하는 동시에 Physical AI 파운데이션 모델 생태계의 주도권을 확보하려는 전략이다.
Cosmos 3 Edge가 출시 예정 모델로 포함된 점은 엣지 추론 수요를 반영한다. 자율주행 차량과 산업용 로봇은 클라우드 레이턴시 없이 실시간으로 동작해야 한다. 따라서 온디바이스에서 실행할 수 있는 Physical AI 모델의 중요성은 계속 높아질 전망이다.
Cosmos 3는 물리 추론과 월드 생성, 행동 생성을 Two-Tower Mixture-of-Transformers 아래 통합한다. 20조 토큰으로 훈련된 완전 오픈 옴니모델이라는 위치를 바탕으로 로봇, 자율주행, 산업 시뮬레이션에서 합성 데이터 생성과 정책 모델 훈련 비용을 대폭 낮출 잠재력을 갖는다. Gemini Robotics-ER 1.6과 함께 2026년 Physical AI 파운데이션 모델 경쟁의 두 축을 이루며, 오픈소스 생태계를 통해 물리 세계를 이해하는 AI의 활용 범위를 넓힐 것으로 전망된다.
Sources
- How Cosmos 3 Helps Physical AI Think Before It Acts | NVIDIA Blog
- Develop Physical AI Reasoning, World, and Action Models with NVIDIA Cosmos 3 | NVIDIA Technical Blog
- NVIDIA Launches Cosmos 3, the Open Frontier Foundation Model for Physical AI | NVIDIA Newsroom
- Welcome NVIDIA Cosmos 3: The First Open Omni-model for Physical AI Reasoning and Action | HuggingFace
- NVIDIA Releases Cosmos 3: A Two-Tower Mixture-of-Transformers Foundation Model | MarkTechPost
- Nvidia's Cosmos 3 open AI world model helps robots, autonomous vehicles | Axios
- Cosmos 3: Omnimodal World Models for Physical AI — Technical Report
- nvidia/Cosmos3-Nano · Hugging Face
- nvidia/Cosmos3-Super · Hugging Face
- Gemini Robotics-ER 1.6 | Google DeepMind
- GitHub - NVIDIA/cosmos