Runway Gen-4.5가 Elo 1위에 오른 이유: 물리 법칙을 내재화한 영상 생성

Runway Gen-4.5의 Artificial Analysis Elo 1위 벤치마크 방법론과 Physically-Informed Diffusion 아키텍처, 인간 동작·카메라 제어·이미지 컨디셔닝 기술을 정리한다.

2026-08-14 · 최초 발행 2026-05-03

2026년 1월 Runway가 공개한 Gen-4.5는 Artificial Analysis Text-to-Video 벤치마크에서 Elo 1,247점을 기록하며 단숨에 1위를 차지했다. Veo 3(1,226점), Sora 2 Pro(1,206점)를 각각 21점, 41점 차이로 앞선 이 결과는 단순한 순위 변동이 아니다. Gen-4.5는 물리 법칙 시뮬레이션, 인간 동작 정확도, 카메라 무브먼트 제어 세 가지 핵심 역량에서 동시에 도약을 이뤘으며, Runway는 이를 General World Model(GWM)이라는 개념으로 정의한다.

체스 점수 시스템으로 영상 모델을 겨루게 하다

Elo 점수는 원래 체스 선수 간 상대적 실력을 수치화하기 위해 개발된 알고리즘이다. Artificial Analysis는 이를 AI 영상 생성 모델 비교에 적용했다. 평가자는 동일한 프롬프트로 생성된 두 모델의 영상을 블라인드(blind) 상태로 나란히 보고, 어느 쪽이 더 우수한지 선택한다. 이 페어와이즈(pairwise) 비교 결과가 누적되면서 각 모델의 Elo 점수가 지속적으로 갱신된다.

21점 차이의 실질적 의미는 Runway Gen-4.5가 Veo 3과 직접 대결할 때 약 53%의 확률로 승리한다는 것을 의미한다. 작은 수치처럼 보이지만 수천 번의 비교에서 통계적으로 유의미하게 검증된 차이다.

Artificial Analysis 벤치마크는 단일 점수가 아니라 여러 차원에서 모델을 평가한다.

Artificial Analysis 벤치마크모션 품질 (Motion Quality)시각적 충실도 (VisualFidelity)프롬프트 준수도 (PromptAdherence)시간적 일관성 (TemporalCoherence)물리 법칙 준수 (PhysicsCompliance)오디오 품질 (Audio Quality)통합 Elo 점수Gen-4.5: 1,247점 (1위)Veo 3: 1,226점 (2위)Sora 2 Pro: 1,206점 (3위)

FVD(Fréchet Video Distance)는 생성 영상 분포와 실제 영상 분포 사이의 거리를 측정하는 정량적 지표로, 낮을수록 실제 영상에 가깝다. Temporal Consistency는 프레임 간 일관성 지수로, 광학 흐름(optical flow) 분석을 통해 예상치 못한 급격한 변화를 감지한다. 이 두 지표에서 Gen-4.5는 경쟁 모델 대비 우위를 보인다.

세상의 물리 법칙을 모델에 내재화하다

Runway는 Gen-4.5를 단순한 영상 생성 모델이 아닌 General World Model로 정의한다. GWM은 실제 세계의 물리적 규칙을 내재화하여, 중력, 관성, 마찰, 유체 역학 등의 물리 현상이 영상에 자연스럽게 반영되도록 하는 것이 목표다. 이는 텍스처나 색상을 사실적으로 재현하는 것과는 차원이 다른 과제로, 물체의 시간에 따른 상태 변화를 예측하는 시뮬레이션 능력이 요구된다.

Gen-4.5의 핵심 아키텍처는 기존 Diffusion 모델에 물리적 사전 지식(physics prior)을 주입하는 방식이다. 학습 데이터에서 물리적으로 타당한 모션 패턴을 강화 학습(reinforcement learning)을 통해 선별적으로 학습하고, 비물리적 모션(예: 물체가 중력 없이 공중에 떠 있는 현상)에 페널티를 부과하는 방식으로 물리 준수도를 높인다.

통과위반텍스트/이미지 입력물리적 사전 지식 인코더시각적 인코더Physics-Informed 어텐션레이어모션 예측 모듈물리 준수 검증프레임 생성모션 벡터 보정1080p 최종 출력동기화된 사운드 디자인

Gen-4.5에서 물체의 낙하, 충돌, 반동 등 물리적 상호작용이 개선된 것은 내부 모션 예측 모듈이 물체의 질량(mass proxy), 속도, 가속도 정보를 토큰 레벨에서 추적하기 때문이다. 공이 바닥에 튀는 장면에서 탄성 계수에 따른 반동 높이, 액체가 용기에서 넘치는 장면에서의 표면 장력 효과, 무거운 물체가 천천히 기울어지는 장면에서의 관성 효과 등이 이전 세대 대비 현실적으로 재현된다.

눈 깜빡임까지 감정과 맞물리는 인간 동작

Gen-4.5의 인간 동작 생성에서 가장 두드러지는 개선점은 미세 표정(micro-expression)의 정확성이다. 눈 깜빡임 속도, 눈썹의 미묘한 움직임, 입꼬리의 섬세한 변화 같은 비언어적 신호들이 정서적 상태와 일치하도록 생성된다. 감정과 신체적 단서의 연동(예: 두려움 → 빠른 눈 깜빡임, 신뢰 → 몸 앞으로 기울기)이 자연스럽게 표현되는데, 이는 Gen-4.5의 학습 데이터 큐레이션 과정에서 심리학적으로 타당한 감정-동작 쌍(emotion-motion pair)을 강화하는 방식으로 구현된 것으로 파악된다.

여러 인물이 등장하는 씬에서 Gen-4.5는 각 인물의 동작 궤적을 독립적으로 추적하면서도 인물 간 상호작용의 물리적 타당성을 유지한다. 두 인물이 악수하는 장면, 스포츠 경기에서 선수들이 충돌하는 장면 등 복잡한 다체 상호작용에서의 일관성이 향상됐다.

6자유도 카메라와 가려졌다 나타나는 오브젝트

Gen-4.5는 Runway의 Advanced Camera Control 기능과 통합되어, 6자유도(6-DoF) 카메라 이동을 세밀하게 제어한다. 영화적 촬영 기법인 달리인, 달리아웃, 오비트, 크레인 샷 등을 텍스트 프롬프트 또는 카메라 경로 파라미터로 직접 지정할 수 있다. 카메라 이동이 빠른 씬에서도 피사체와 배경 간의 상대적 운동 관계가 물리적으로 타당하게 유지된다.

복수의 오브젝트가 동시에 움직이는 씬에서 각 오브젝트의 상태를 개별 토큰으로 추적하는 오브젝트-중심 어텐션(object-centric attention) 메커니즘이 시간적 일관성을 강화한다. 이 메커니즘은 오브젝트 간 오클루전(occlusion)이 발생할 때도 가려진 오브젝트의 상태를 내부적으로 유지하여, 오클루전 해소 후 자연스럽게 다시 등장하도록 처리한다.

아니오입력 프레임 시퀀스오브젝트-중심 어텐션오브젝트 (1) 상태 추적오브젝트 (2) 상태 추적오브젝트 (N) 상태 추적오클루전 처리 모듈오클루전 발생?숨겨진 상태 유지 (내부 메모리)일반 렌더링오클루전 해소 자연 복원최종 프레임

사진 한 장에서 영상이 살아나는 법

Gen-4.5는 Image-to-Video 모드에서 첫 프레임 이미지를 입력받아 해당 이미지에서 자연스럽게 이어지는 영상을 생성한다. 입력 이미지의 시각적 스타일, 조명, 색감, 오브젝트 배치가 이후 프레임 전체에 걸쳐 일관되게 유지된다. 특히 정적인 사진에서 출발하여 카메라 이동이나 씬 내 오브젝트 움직임이 자연스럽게 시작되는 "사진이 살아나는(photo animation)" 효과가 Gen-4.5에서 크게 향상됐다. 이미지 컨디셔닝 강도(conditioning strength)를 조절하여 입력 이미지에 얼마나 충실할지, 또는 얼마나 창의적으로 벗어날지를 제어하는 파라미터도 제공된다.

Runway Gen-4.5는 Artificial Analysis 벤치마크 Elo 1,247점 1위라는 객관적 성과와 함께, General World Model이라는 개념적 진화를 동시에 이룬 모델이다. 물리 법칙을 내재화한 Physically-Informed Diffusion 아키텍처, 미세 표정까지 재현하는 인간 동작 생성, 정밀한 6-DoF 카메라 제어가 결합되어 AI 영상 생성의 사실성 기준을 새로 정립했다. 단일 클립 길이와 생성 비용의 제약은 여전하지만, 물리적으로 타당한 세계 시뮬레이션을 향한 Gen-4.5의 방향성은 다음 세대 AI 영상 모델이 나아갈 길을 명확히 제시한다.

Sources

RunwayGen4.5GeneralWorldModel물리시뮬레이션Elo벤치마크AI영상생성