Gemini Robotics-ER 1.6: 계측기 판독 23%에서 93%로 끌어올린 체화 추론 모델
Google DeepMind가 공개한 Gemini Robotics-ER 1.6의 체화 추론 아키텍처와 계측기 판독 벤치마크, Boston Dynamics Spot 통합, 안전 거부 행동, 산업 활용 사례를 정리한다.
2026-08-14 · 최초 발행 2026-04-17
압력 계측기의 눈금을 읽는 로봇의 정확도가 23%에 머물러 있었다면 현장에 투입할 수 없었을 것이다. Google DeepMind가 2026년 4월 14일 공개한 Gemini Robotics-ER 1.6은 이 수치를 93%까지 끌어올렸다. 체화 추론(Embodied Reasoning)을 강화한 이 모델은 공간 추론, 다중 뷰 이해, 계측기 판독 같은 물리 세계 태스크에서 이전 세대를 크게 뛰어넘었고, Boston Dynamics의 4족 보행 로봇 Spot에 통합되어 AI 시각 점검(AIVI) 기능을 실질적으로 강화한다.
로봇이 몸으로 세계를 읽어야 하는 이유
체화 추론은 로봇이 물리 환경 내 자신의 몸과 주변을 인식하고 행동을 설계하는 추론 방식을 뜻한다. Gemini Robotics-ER 1.6은 여기에 에이전틱 비전(Agentic Vision)을 더했다 — 시각 추론과 코드 실행을 결합해 영상의 정량적 판독 정확도를 높이는 기법이다. 목표는 다중 단계 작업·도구 사용·환경 적응 능력을 산업 현장 수준으로 끌어올리는 것이다.
| 항목 | 내용 |
|---|---|
| 릴리스 일자 | 2026년 4월 14일 |
| 모델 | Gemini Robotics-ER 1.6 |
| 전 세대 | Gemini Robotics-ER 1.5, Gemini 3.0 Flash |
| 접근 채널 | Gemini API, Google AI Studio |
| 첫 공식 파트너 | Boston Dynamics(Spot, Orbit/AIVI 통합) |
| 안전성 | DeepMind가 '가장 안전한 로봇 모델'로 평가 |
이전 세대 대비 공간·물리 추론, 포인팅, 개수 세기, 성공 여부 판정이 모두 개선됐다.
카메라 입력에서 행동까지 이어지는 경로
다중 뷰 인코더가 복수 카메라·센서 입력을 통합된 공간 표현으로 변환하면, 공간 표현 모듈이 객체 위치·크기·상대 관계를 3D로 추정한다. Reasoning Core는 이 정보를 태스크 플래너에 전달해 관측·조작·이동 중 하나로 분기시키고, 계측기 눈금 값을 읽는 것 같은 정량적 판독에는 에이전틱 비전과 코드 실행이 결합된다.
계측기 눈금을 읽는 정확도, 23%에서 93%로
| 모델 | 계측기 판독 성공률 |
|---|---|
| Gemini Robotics-ER 1.5 | 23% |
| Gemini 3.0 Flash | 67% |
| Gemini Robotics-ER 1.6 | 86% |
| Gemini Robotics-ER 1.6 + 에이전틱 비전 | 93% |
에이전틱 비전은 이미지 크롭·보정·수치 추출을 코드로 반복 실행해 판독 오차를 줄인다. 화학 플랜트·정유·반도체 팹의 계측기·사이트 글래스(sight glass) 판독에 직접 적용할 수 있는 수준이다.
시각·언어·행동을 하나의 루프로 묶는 VLA
VLA(Vision-Language-Action)는 시각·언어·행동 모달리티를 단일 모델에서 연쇄 처리하는 패러다임이다.
Spot의 카메라 6대가 제공하는 360도 시야로 시각 입력을 받고, "압력 계측기를 확인하고 값이 100 초과면 경보" 같은 자연어 지시를 목표 분해→이동→관측→판독→조건 분기 순서로 추론·계획한다. 필요하면 에이전틱 비전으로 계측기 판독 코드를 호출하고, 보행 명령·아암 조작·보고 생성으로 행동을 실행한다.
Spot의 점검 방식이 바뀌었다
Spot의 AI 시각 점검(AIVI) 기능에 ER 1.6이 내장됐고, Orbit 소프트웨어에서 AIVI-Learning과 결합해 현장 적응 학습을 수행한다. 계측기·경고등·누수 같은 미세 시각 변화 감지 능력이 강화되면서, 기존의 사전 정의 경로 중심 점검이 지시 기반 자율 점검으로 전환됐다.
무엇을 거부하도록 설계했나
그리퍼 하중 한계를 초과하는 객체는 집어 올리기를 거부하고, 위험 물질(예: 액체) 접촉 작업은 회피한다. 사람·동물 근처에서는 안전 거리를 유지하며, 불확실한 상황에서는 보수적 행동을 선택한다. 이 물리적 안전 제약 준수 능력은 이전 세대 대비 큰 폭으로 향상됐다.
| 항목 | ER 1.5 | Gemini 3.0 Flash | ER 1.6 | ER 1.6 + 에이전틱 비전 |
|---|---|---|---|---|
| 공간 추론 | 기준 | 향상 | 큰 향상 | 동일 |
| 포인팅·카운팅 | 기준 | 향상 | 큰 향상 | 동일 |
| 성공 여부 판정 | 기준 | 향상 | 큰 향상 | 동일 |
| 계측기 판독 | 23% | 67% | 86% | 93% |
| 안전 거부 | 기준 | 개선 | 최상 | 최상 |
공장 점검부터 창고 피킹까지
화학·정유·발전 플랜트는 24/7 점검 인력 부족을 겪는다. Spot과 ER 1.6을 조합하면 정기 라운드·계측기 판독·이상 보고를 자동화할 수 있고, 사람 점검 주기를 늘리면서 이상을 더 일찍 발견할 수 있다.
창고·물류 센터에서는 다품종 소량 주문이 늘면서 단일 매니퓰레이터의 성능이 부족해지는 문제가 있었다. VLA 파이프라인으로 자연어 주문을 객체 위치 추론과 안전한 피킹으로 연결하면, 경로 재계획 지연이 줄고 신규 품목 온보딩 시간도 단축된다.
도입 전에 따져야 할 것들
카메라 피드가 클라우드 모델로 전달되므로 데이터 처리 위치와 암호화 정책을 먼저 정해야 한다. 실시간 조작 제어와 클라우드 추론을 결합하려면 지연 버퍼와 폴백 전략이 필요하고, 모델의 거부 행동만 믿지 말고 하드웨어 인터락·물리 세이프티 케이지를 함께 둬야 한다. 현장 데이터로 파인튜닝할 때는 모델 거동 변화를 평가·롤백하는 절차가 필수이며, 산업용 로봇 안전 규격(ISO 10218, 13849 등)과 AI 의사결정의 정합성도 검토해야 한다.
체화 추론과 에이전틱 비전을 결합한 이번 릴리스는 로봇이 물리 세계를 '읽고' 행동하는 능력을 산업 현장 수준으로 끌어올렸다. Boston Dynamics Spot과의 통합은 연구 데모를 넘어 점검·피킹·안전 관리 태스크에 곧바로 투입될 수 있는 VLA 파이프라인이 성숙 단계에 들어섰음을 보여준다.
Sources
- Gemini Robotics ER 1.6: Enhanced Embodied Reasoning — Google DeepMind
- Boston Dynamics and Google DeepMind Unveil a Smarter Spot — IEEE Spectrum
- Boston Dynamics integrates Google DeepMind's Gemini Robotics model into Spot — Robotics and Automation News
- Google DeepMind Releases Gemini Robotics-ER 1.6 — MarkTechPost
- Gemini Robotics-ER 1.6: Real-World Robotics Intelligence — Labellerr
- Google DeepMind Unveils Gemini Robotics-ER 1.6: A Leap in Spatial Reasoning — Humanoids Daily
- Boston Dynamics and Google DeepMind are using Gemini to make Spot smarter — The Robot Report