Gemini Robotics 2가 바꾸는 전신 통합 로봇 제어 설계
Gemini Robotics 2의 전신 단일 VLA 정책을 중심으로 통합 제어의 장점, 안전 계층, 시뮬레이션 전이와 운영 요건을 정리한다.
2026-09-01 · 최초 발행 2026-08-02
Google DeepMind는 2026년 7월 30일 Gemini Robotics 2를 공개하며 다리, 몸통, 팔, 다관절 손가락을 하나의 학습 정책으로 제어하는 사례를 제시했다. Gemini Robotics 1.5까지는 이동과 조작을 별도 컨트롤러가 맡고, 인계 지점에서 두 제어 흐름을 연결하는 방식이었다. 새 모델은 이 분리를 단일 종단 간 VLA 정책으로 묶었다.
통합은 전신 협응을 다루는 범위를 넓히지만, 안전 문제까지 학습 정책에 맡길 수 있다는 뜻은 아니다. 균형과 조작의 상호작용을 함께 학습하는 대신, 오류 역시 전신으로 번질 수 있기 때문이다.
부위별 접합이 사라진 제어 구조
Gemini Robotics 2는 VLA 본체 모델, 임바디드 추론용 VLM, 온디바이스 VLA의 세 모델로 함께 출시됐다. 휴머노이드가 걷고, 웅크리고, 몸을 뻗어 어질러진 방을 정리하는 모습과 지퍼백 밀봉, 봉투 묶기, 전구 교체 같은 다섯 손가락 조작이 시연됐다.
기존 방식에서는 이동 컨트롤러와 조작 컨트롤러의 인계 지점이 설계의 핵심이었다. 전신 협응이 필요한 동작을 추가할 때마다 이 접합 구조를 다시 맞춰야 했다. 단일 정책에서는 새로운 동작을 기계적인 인계 구조 변경 없이 학습 대상으로 넣을 수 있다. 균형 유지와 조작이 동시에 필요한 상황의 부위 간 상호작용도 정책이 직접 학습한다.
반면 실패를 국소화하기는 더 어렵다. 부위별 컨트롤러 구조에서는 팔 제어의 오류가 다리까지 번지지 않을 수 있지만, 단일 정책에서는 전신 동작이 함께 이탈할 수 있다. 분포 밖 상황에서 어떤 동작을 할지 학습 정책만으로 보장할 수 없으므로, 규칙 기반 안전 정지 계층을 별도로 둬야 한다.
통합 정책을 받쳐야 하는 실행 계층
관측과 행동 공간부터 전신 기준으로 정의해야 한다. 다리, 몸통, 팔, 손가락의 관절 명령은 단일 행동 벡터로 다루며, 부위별로 서로 다른 제어 주기를 사용하면 정책 출력의 의미가 흔들린다. 관측에는 시각 입력뿐 아니라 고유 수용 감각도 포함해야 한다. 시각만으로는 자세 안정성을 판단할 수 없다.
행동 공간을 관절 토크로 정할지 목표 자세로 정할지도 결정해야 한다. 목표 자세 기반의 경우 하위 제어기가 안전 한계를 강제하기 쉽다.
학습은 시뮬레이션에서 대량으로 수행한 뒤 실기로 옮기는 편이 비용과 안전 측면에서 유리하다. 실기 직접 학습은 파손과 사고 위험을 안는다. 시뮬레이션과 실기의 차이를 줄이려면 물리 파라미터를 무작위화해야 한다. 단일 물리 설정에 최적화한 정책은 실기에서 무너질 수 있다. 전이 후 성능 저하 폭을 측정해 기록하는 일도 필요하다. 이 저하 폭이 시뮬레이션 신뢰도의 지표가 된다.
안전 감시는 정책 외부의 규칙 기반 계층으로 분리한다. 관절 속도, 힘, 기울기, 작업 공간 이탈을 검사하고 임계를 넘으면 즉시 정지해야 한다. 이 감시 계층은 정책과 독립된 코드 경로에 구현해야 한다. 동일한 모델이 판단하면 이상 상황에서 함께 실패할 수 있다.
정지 자체도 별도 설계 대상이다. 보행 중 급정지는 넘어짐을 유발할 수 있으므로, 안정 자세로 수렴하는 정지 궤적이 필요하다. 관절 범위, 최대 속도, 최대 힘은 하드웨어나 저수준 제어기에서 강제해 상위 정책 출력이 물리적 한계를 넘지 못하게 해야 한다. 사람 근처에서 수행하는 작업은 단독 작업보다 더 낮은 힘 한계를 적용한다.
시각, 관절 각도, 힘 센서, 관성 측정은 시간 동기화해 결합한다. 동기화 오차는 전신 협응에서 특히 치명적이다. 센서 결측 시의 동작도 미리 정의해야 하며, 시각 입력이 끊겼을 때 계속 움직이는 기본값은 위험하다.
관측 획득부터 관절 명령 전달까지의 지연은 구간별로 계측하고 예산을 배분한다. 총 지연이 커지면 균형 제어가 발산한다. 예산을 초과했을 때 저수준 안정화 동작으로 전환할 경로가 필요하다.
이상 동작은 정상 동작의 관절 궤적 분포에서 벗어나는지를 기준으로 검출한다. 학습 정책은 분포 밖 입력에서 예측할 수 없는 출력을 낼 수 있다. 검출 이력은 재학습 데이터로 남긴다. 이상 사례가 곧 학습 공백을 보여주는 자료다.
현장 도입은 작업 범위와 검증 경로부터 제한한다
전신 협응이 실제로 필요한 작업부터 적용하는 편이 낫다. 고정 위치에서 조작만 필요한 공정에 전신 정책을 적용하면 위험만 늘어난다. 작업 목록은 화이트리스트로 관리해야 한다. 학습 정책은 지시만 바꿔 새 동작을 시도할 수 있으므로, 적용 범위는 프롬프트가 아니라 운영 규칙으로 통제해야 한다.
적용 국가와 산업의 로봇 안전 규격 요구사항도 먼저 확인한다. 학습 기반 제어는 결정론적 검증을 전제한 기존 규격과 정합이 어려운 부분이 있다. 인증 대응 자료에는 안전 정지 계층의 독립성과 동작 한계 강제 방식을 문서화한다.
사람이 접근할 수 있는 구역과 로봇 전용 구역은 물리적으로 구분한다. 협업 구역에서는 힘과 속도 한계를 별도로 낮춘다. 구역 경계 감지 수단은 이중화해 단일 센서의 고장이 곧 경계 상실이 되지 않도록 한다.
실기 검증은 시뮬레이션 통과, 무부하 실기, 저부하 실기, 실작업의 순서로 나누고 각 단계의 통과 기준을 수치로 정한다. 모든 단계에 정지 시험을 포함해야 한다. 안전 정지가 실제로 동작하는지 확인하지 않은 배치는 성립하지 않는다.
운영 절차에는 비상 정지 위치, 전원 차단 절차, 사고 후 보존 자료를 명시한다. 운영자는 학습 정책의 한계도 알아야 한다. 이전에는 잘 수행하던 동작이라도 조건이 바뀌면 실패할 수 있다.
정책 버전과 배포된 로봇의 매핑은 계속 관리한다. 어느 로봇이 어떤 정책으로 동작하는지 알 수 없으면 사고 원인을 규명할 수 없다. 이상 동작 기록은 정기적으로 검토하고, 재학습 여부를 결정할 회의체를 둔다.
통합·분리·규칙 기반 제어의 선택 기준
| 구분 | 단일 통합 정책 | 부위별 컨트롤러 조합 |
|---|---|---|
| 동작 자연스러움 | 높음 | 접합부에서 부자연 |
| 신규 동작 추가 | 학습으로 가능 | 인계 구조 재설계 |
| 실패 격리 | 어려움 | 부위 단위로 격리 |
| 검증 가능성 | 낮음 | 상대적으로 높음 |
| 안전 계층 필요성 | 필수 | 부분적 |
| 개발 부담 | 학습 인프라 필요 | 제어 설계 부담 |
단일 통합 정책은 균형 유지와 조작이 동시에 필요한 상황에서 상호작용을 학습에 포함한다. 그 결과 접합부의 조율 실패를 없애고, 새로운 동작도 기계적 재설계 없이 추가할 수 있다. 반대로 부위별 컨트롤러 조합은 각 컨트롤러를 독립적으로 검증·교체할 수 있고 한 부위의 오류를 다른 부위와 격리하기 쉽다. 다만 인계 지점 설계가 성능 한계가 되며, 전신 협응 동작마다 접합 구조를 다시 구성해야 한다. 통합 정책을 채택하더라도 안전 정지와 한계 강제는 독립 계층에 남기는 혼합 구성이 현실적인 절충이다.
시뮬레이션 학습 후 전이하는 방식은 대량 시행과 위험 동작 탐색이 무료에 가깝고 파손 위험도 없다. 그러나 접촉 물리와 센서 잡음 재현에는 한계가 있어 실기 전이 시 성능이 떨어질 수 있으며, 그 저하 폭을 사전에 알기 어렵다. 실기 직접 학습은 전이 격차가 없지만 시행 비용이 크고 학습 과정 자체가 안전 사고 위험을 만들며 데이터 수집 속도도 느리다. 시뮬레이션에서 물리 파라미터를 무작위화해 학습한 뒤 실기에서 소량 미세조정하는 조합이 비용과 안전을 함께 고려한 표준 경로가 된다.
학습 기반 제어는 다양한 물체와 환경에 적응하고, 명시 규칙으로 표현하기 어려운 접촉 조작을 처리할 수 있다. 대신 분포 밖 상황의 동작을 보장하지 못하고 형식 검증도 사실상 불가능하다. 규칙 기반 제어는 동작 예측과 검증·인증에는 유리하지만 예외마다 규칙을 더해야 하며, 비정형 환경에서는 규칙 폭발을 감당하기 어렵다. 상위 동작 생성은 학습에 맡기고 안전 한계와 정지 판단은 규칙에 맡기는 계층 분담이 실무 구성의 기준이 되며, 인증 대응의 근거도 된다.
실시간성·안전성·추적성으로 보는 운영 조건
통합 정책의 추론 시간이 제어 주기를 넘으면 안정성이 무너진다. 제어 주기와 지연 예산은 실시간 시스템 설계의 기본 제약이며, 계층 분리는 단순한 성능 문제가 아니라 구조 문제다. 센서 시간 동기화 역시 융합 품질의 전제이므로 동기화 오차 예산을 별도로 관리해야 한다.
안전 기능을 주 기능과 독립된 경로로 구현하는 것은 기능 안전 설계의 기본 원칙이다. 같은 모델이 판단하면 공통 원인 고장이 된다. 보행 중 급정지처럼 정지가 새로운 위험을 만들 수 있으므로, 정지 동작 자체의 안전성도 검토 대상이다.
학습 기반 시스템은 결정론적 테스트만으로 완전성을 보이기 어렵다. 통계적 수용 기준과 이상 사례 축적을 통한 지속 검증으로 이를 보완한다. 정책 버전과 배포 대상을 연결하는 일은 형상관리 대상이며, 추적성이 없으면 사고 원인 분석도 성립하지 않는다.
전신 정책이 자리 잡을 때의 운영 변화
전신 단일 정책이 휴머노이드 제어의 기본 구성으로 자리 잡고, 부위별 접합 방식은 레거시로 밀려나는 흐름이 예상된다. 학습 기반 제어의 인증에 대응하려면 안전 계층의 독립성과 한계 강제 방식을 문서화하는 관행도 요구될 전망이다.
온디바이스 VLA가 제공되면 네트워크 의존 없이 현장 배치하는 사례가 늘고, 지연 예산 설계의 중요성도 커진다. 이상 동작 기록을 재학습 데이터로 순환시키는 운영 파이프라인은 로봇 도입의 표준 구성 요소로 편입될 수 있다.
Gemini Robotics 2는 다리부터 손가락까지를 하나의 학습 정책으로 다루며, 이동과 조작을 접합하던 로봇 제어 설계를 통합 구조로 옮겼다. 이 구조는 접합부의 조율 실패를 제거하고 새로운 동작을 기계적 재설계 없이 학습으로 추가할 수 있게 하지만, 실패가 국소화되지 않는 대가도 함께 갖는다. 안전 정지와 동작 한계 강제는 정책 내부가 아닌 독립된 규칙 기반 계층에 두고, 정지 동작이 안정 자세로 수렴하는지까지 검토해야 한다. 시뮬레이션 학습 후 소량의 실기 미세조정과 이상 동작 기록의 재학습 순환은 검증이 어려운 학습 기반 제어를 운영 가능한 수준으로 유지하는 장치다.
Sources
- Gemini Robotics 2 brings whole body intelligence to robots | Google DeepMind
- Google DeepMind Ships Three Physical AI Models For Whole Body Control, Dexterity And Multi Robot Collaboration | MarkTechPost
- Gemini Robotics 2 Controls Full Humanoids: Legs, Torso, Arms, and Fingers Under One Policy | TechTimes
- Google DeepMind unveils Gemini Robotics 2 as Apptronik humanoid demonstrates whole-body AI | Robotics & Automation News
- Google DeepMind launches Gemini Robotics 2 with full humanoid body control and multi-robot teamwork | GCN