Gemini Robotics 2 소개
Gemini Robotics 2는 Google DeepMind가 2026년 7월 30일 공개한 차세대 로봇 AI 모델 제품군으로, 휴머노이드 로봇의 발끝부터 손끝까지 전신을 통합적으로 제어하는 전신 지능(Whole-body Intelligence) 을 구현한 것이 가장 큰 특징입니다. 걷고, 웅크리고, 몸을 굽혀 물건을 집는 전신 동작부터 매듭을 묶는 손끝의 정교한 조작, 그리고 여러 대의 로봇이 하나의 작업을 분담하는 협업까지, 로봇이 물리적 세계에서 수행할 수 있는 작업의 폭을 크게 넓혔습니다. 이 지능은 네트워크 없이 로봇 장치 위에서 직접 실행할 수도 있으며, 몇 시간 만에 완전히 새로운 로봇 몸체에 적응합니다.
지금까지 대부분의 로봇은 좁고 반복적인 작업 시퀀스를 위해 사전 프로그래밍되거나 사람이 원격 조종하는 방식으로 운용되어 왔습니다. 스스로 학습하거나 예측 불가능한 환경에 적응하는 능력이 부족했고, 한 로봇에서 학습한 기술을 다른 형태의 로봇으로 옮기는 것도 매우 어려웠습니다. Google DeepMind는 이 문제를 풀기 위해 2025년 3월 Gemini의 멀티모달 이해 능력을 실제 행동으로 연결한 Gemini Robotics를 처음 선보였고, 이후 모션 전이(Motion Transfer) 기법과 에이전트 구조를 도입한 Gemini Robotics 1.5, 체화 추론 능력을 강화한 Gemini Robotics ER 1.6으로 발전시켜 왔습니다. Gemini Robotics 2는 이 계보를 잇는 메이저 업데이트로, 상반신 중심의 탁상 작업에 머물던 이전 세대와 달리 처음으로 휴머노이드 전신 전체를 하나의 모델이 제어합니다.
이번 발표에서 추론 모델인 Gemini Robotics ER 2는 Google AI Studio와 Gemini API에서 개발자 누구나 사용할 수 있는 공개 프리뷰로 제공되며, Gemini Enterprise Agent Platform에서는 비공개 프리뷰로 제공됩니다. 행동을 담당하는 VLA 모델과 On-Device 모델은 조기 액세스 파트너 신청을 받아 제공됩니다. 아래 영상에서 Gemini Robotics 2가 가능하게 하는 작업들을 한눈에 볼 수 있습니다.
세 가지 모델로 구성된 라인업: 행동하는 VLA, 추론하는 ER, 로컬에서 도는 On-Device
Gemini Robotics 2는 역할이 서로 다른 세 가지 모델로 구성됩니다. 시각과 언어 입력을 모터 제어 신호로 변환해 완전한 휴머노이드는 물론 다양한 양팔 로봇까지 움직이는 시각-언어-행동(Vision-Language-Action, VLA) 모델 Gemini Robotics 2, 로봇의 고수준 두뇌 역할을 하며 사람과 대화하고 여러 단계의 작업을 계획하는 체화 추론(Embodied Reasoning, ER) 모델 Gemini Robotics ER 2, 그리고 네트워크 연결 없이 로봇 장치 위에서 직접 실행되도록 최적화된 경량 VLA 모델 Gemini Robotics On-Device 2입니다.
| 구분 | Gemini Robotics 2 | Gemini Robotics ER 2 | Gemini Robotics On-Device 2 |
|---|---|---|---|
| 역할 | VLA 모델, 시각과 언어를 모터 제어로 변환 | 체화 추론 모델, 작업 계획과 오케스트레이션 | 경량 VLA 모델, 로봇 하드웨어에서 로컬 실행 |
| 입력 | 텍스트, 이미지 | 텍스트, 이미지, 비디오, 오디오 | 이미지, 텍스트, 행동 |
| 출력 | 행동(Action) | 텍스트 | 행동(Action) |
| 제공 상태 | 비공개 프리뷰 | 공개 프리뷰 (AI Studio, Gemini API) | 신뢰 테스터(Trusted Testers) |
세 모델은 함께 동작합니다. ER 2가 방을 관찰하고 작업을 여러 단계로 쪼갠 뒤 VLA에 실행을 지시하고, 각 단계의 진행 상황을 추적하면서 실패하면 스스로 수정합니다. 이러한 구조 덕분에 로봇은 수 분에 걸쳐 수백 개의 결정을 내려야 하는 긴 작업 시퀀스를 안정적으로 수행하고, 처음 보는 상황과 목표에도 일반화할 수 있습니다. 또한 Gemini Robotics 2는 일상적인 명령을 이해하고 응답하는 대화형 모델이어서, 행동을 수행하면서 자신의 접근 방식을 설명할 수 있고 사용자는 전문 용어 없이도 로봇의 행동을 바로잡을 수 있습니다. DeepMind는 이런 특성이 변화가 잦거나 위험한 환경에서 로봇에게 지시를 내리는 데 적합하다고 설명합니다.
발끝에서 손끝까지: 휴머노이드 전신 제어
사람이 사는 공간은 사람의 움직임에 맞춰 설계되어 있어, 좁고 어수선한 공간에서 손을 뻗고, 몸을 굽히고, 균형을 잡아야 합니다. 이전 세대 모델이 휴머노이드의 상반신만 제어해 탁상 작업을 수행했다면, Gemini Robotics 2는 물리적 AI를 전신 동작으로 확장했습니다. 모델이 로봇의 무게 중심을 동적으로 조절하기 때문에, 고정된 자세에서 팔만 뻗는 것이 아니라 안전하게 발을 내딛고, 쪼그려 앉고, 몸을 굽히며 실제 공간을 누빌 수 있습니다.
예를 들어 Apptronik의 휴머노이드 로봇 Apollo 2에 "물뿌리개를 아래쪽 선반의 초록색 통에 넣어줘"라고 지시하면, Apollo는 명령을 처리한 뒤 테이블로 걸어가 물뿌리개를 집어 들고, 몇 걸음 옮겨 선반의 정확한 위치에 내려놓습니다. 아래 영상에서 어질러진 방을 정리하는 전신 제어 동작을 확인할 수 있습니다.
DeepMind가 공개한 벤치마크에 따르면, Inspire 핸드를 장착한 Apollo 로봇의 범용 전신 조작(General Whole Body Manipulation) 정확도는 테이블에서 집기 68.4%, 바닥에서 집기 45.7%, 선반에서 집기 76.3%를 기록했습니다. 아직 이동 속도 면에서는 개선의 여지가 있지만, 전신 협응이 필요한 복잡한 실세계 작업으로 가는 중요한 진전입니다.
매듭 묶기와 지퍼백 밀봉: 손과 그리퍼의 정교한 조작
가정과 일터에서 진짜 쓸모 있는 로봇이 되려면 섬세함이 필요합니다. Gemini Robotics 2는 로봇이 다관절 손을 쓰든 그리퍼를 쓰든, 서로 다른 엔드 이펙터(End Effector) 전반에서 새로운 수준의 정교한 조작 능력(Dexterity) 을 제공합니다.
이번 모델은 Apollo 2에 장착된 Sharpa의 5손가락, 22자유도(Degrees of Freedom, DoF) SharpaWave 핸드를 제어해 매듭 묶기나 지퍼백 밀봉 같은 섬세한 동작을 수행합니다. 벤치마크 기준으로 전구 돌려 빼기 92%, 쓰레기봉투 묶기 44%, 지퍼백 밀봉 40% 등의 성공률을 기록했습니다. 또한 Franka Robotics의 FR3 Duo 플랫폼에서 표준 2지 평행 그리퍼로 빈틈없이 물건을 채워 넣는 포장(Tight Packing) 같은 복잡한 작업도 수행하는데, 정밀 삽입 작업에서 89.6%, 다양한 도구 키팅에서 78.9%, 일반 집고 놓기에서 74.2%의 정확도를 보였습니다. DeepMind는 인간 수준의 정교한 조작에 도달하기 위해 정밀도와 속도를 계속 끌어올리고 있다고 밝혔습니다.
로봇의 고수준 두뇌: Gemini Robotics ER 2의 에이전틱 추론
실세계의 작업 대부분은 여러 단계를 거쳐야 완료됩니다. Gemini Robotics ER 2는 이 복잡성을 관리하는 물리적 에이전트로, 사용자 지시를 처리하고 사람과 소통하는 로봇의 고수준 두뇌 역할을 합니다. 개발자는 VLA 모델이나 내비게이션 API 같은 저수준 제어 인터페이스를 도구(Tool)로 선언하고, 비디오와 오디오, 텍스트를 모델에 직접 스트리밍하는 방식으로 에이전트 구조를 구성할 수 있습니다. ER 2는 Google 검색이나 Google Calendar 같은 도구는 물론 사용자 정의 함수도 네이티브로 호출해 환경을 이해하는 데 활용할 수 있으며, 행동을 수행하는 동시에 다음 단계를 생각하도록 설계되었습니다.
도구 오케스트레이션 성능은 실제 로봇의 VLA 제어, 시뮬레이션 VLA 제어, 사람의 원격 조작(Tele-op) 세 가지 모드에서 평가되었는데, ER 2는 모든 모드에서 이전 버전인 ER 1.6을 앞섰습니다. 실제 VLA 제어 성공률은 48.6%에서 60.0%로, 시뮬레이션 VLA는 37.4%에서 42.9%로, 사람 원격 조작 지휘는 63.6%에서 74.0%로 향상되었습니다.
로보틱스에서는 고수준 추론도 실행 속도가 뒷받침되어야 합니다. ER 2는 지연시간에 민감한 작업에 최적화된 양방향 스트리밍 엔드포인트인 Gemini Live API에 통합되어, 어색하게 멈춰서 생각하는 구간 없이 여러 단계의 작업을 매끄럽게 지휘합니다. DeepMind는 이를 보여주기 위해 Boston Dynamics의 4족 보행 로봇 Spot의 내비게이션과 매니퓰레이터 API를 ER 2가 오케스트레이션하는 데모를 만들었습니다. 아래 영상에서 자연어 명령 한 마디에 팝콘 간식을 가져다주는 Spot을 볼 수 있으며, 데모 코드는 robotics-samples 저장소에 공개되어 있습니다.
작업의 시작과 끝을 아는 시간적 지능
로보틱스의 가장 어려운 과제 중 하나는 작업이 언제 끝났는지를 아는 것입니다. ER 2는 연속적인 비디오 피드를 지켜보면서 로봇이 자신의 진행 상황을 추적하고, 문제가 생기면 적응하며, 다음 단계로 넘어갈 정확한 시점을 판단하게 합니다. 이를 위해 두 가지 기초 능력이 개선되었습니다.
진행률 분류(Progress Classification) 는 비디오의 각 프레임을 다섯 단계의 진행률(0-20%, 20-40%, 40-60%, 60-80%, 80-100%)로 분류해 작업 완료까지의 진척도를 추적하는 능력입니다. 진행률을 정량화하면 로봇이 실시간 상황 인식을 갖게 되어, 전체 워크플로우를 처음부터 다시 시작하지 않고도 실패한 단계만 재시도할 수 있습니다. ER 2는 이 작업에서 57.4%의 정확도를 기록해 GPT 5.6 Sol(46.2%), Gemini 3.6 Flash(43.9%), ER 1.6(42.7%), Opus 5(37.1%)를 모두 앞섰습니다.
순간 포착(Moment Finding) 은 커피를 그만 따라야 하는 순간처럼 결정적인 사건이 일어나는 정확한 비디오 프레임을 찾아내는 능력입니다. ER 2는 91.3%의 정확도와 0.96초의 평균 절대 오차(Mean Absolute Distance)를 달성했습니다. 정확도에서는 훨씬 큰 규모의 모델과 비슷한 수준이지만, 그 일부에 불과한 연산 비용과 4배 빠른 실행 속도로 이 정밀도를 제공한다는 점이 다릅니다. 실제 로봇을 안전하게 운용하는 데 필요한 1초 미만의 지연시간을 실용적인 비용으로 달성한 것입니다.
공간 지능의 전반적 향상: 성공 감지, 계기판 읽기, 공간 VQA
ER 2는 핵심 공간 추론 능력도 전반적으로 끌어올렸습니다. 성공/실패 감지는 정지 이미지 대신 원시 비디오 피드에서 동작해 쏟아짐, 미끄러짐, 어긋남 같은 실행 도중의 실패를 잡아내고, 계기판 읽기는 원형 다이얼을 넘어 디지털 디스플레이, 선형 눈금, 자, 액체 온도계까지 10종의 계측기로 확장되었습니다. 공간 시각 질의응답(Visual Question Answering, VQA) 역시 Gemini의 멀티모달 이해 발전에 힘입어 개선되었습니다. 벤치마크에서 ER 2는 이미지 기반 성공 감지 87.7%, 비디오 기반 성공 감지 82.4%, 체화 추론 질의응답(ERQA) 78.5%, 일반화된 계기판 읽기 65.7%로 비교 대상 모델 중 전 항목 최고 정확도를 기록했습니다.
서로 다른 로봇이 한 팀으로: 멀티 로봇 협업
모든 작업에 들어맞는 단일 로봇은 없습니다. 실내에서는 바퀴 달린 로버가, 험한 지형에서는 휴머노이드가 유리할 수 있습니다. 이번 업데이트에서 처음 도입된 멀티 로봇 협업(Multi-robot Collaboration) 은 서로 다른 종류의 로봇들이 공유된 의미 이해를 바탕으로 소통하고, 서로의 물리적 강점을 인식해 작업을 자율적으로 분배하며, 로봇 한 대로는 불가능한 복잡한 워크플로우를 함께 완수하게 합니다. 아래 영상에서 Apptronik의 Apollo 2와 Franka의 모바일 FR3 Duo가 작업을 주고받으며 협업하는 모습을 볼 수 있습니다.
200개 미만의 예제로 새 로봇에 적응하는 On-Device 2
많은 로봇 응용 분야는 네트워크 지연이나 인터넷 연결 없이 동작해야 합니다. Gemini Robotics On-Device 2는 이런 제약을 처리하도록 설계된 가장 효율적인 VLA 모델로, 로봇 장치에서 직접 실행됩니다. 이 모델은 태생적으로 여러 로봇 형체를 지원하는 멀티 임바디먼트(Multi-embodiment) 구조이며, Gemini Robotics 1.5에서 도입된 모션 전이 기법을 계승했습니다.
그 결과 완전히 새로운 양팔 로봇이라도 보통 200개 미만의 예제와 몇 시간의 적응 시간만으로 동작시킬 수 있습니다. 형태와 센서, 자유도가 크게 다른 로봇에서도 작동하는데, 아래 영상에서 Dexmate와 SO101, Trossen Robotics 플랫폼이 다양한 작업을 수행하는 모습을 확인할 수 있습니다.
안전성: ASIMOV-Agentic 벤치마크와 인간 근접 감지
로봇의 물리적 능력이 커질수록 안전의 중요성도 커집니다. DeepMind는 릴리스마다 전통적인 물리적 안전장치와 견고한 AI 안전 프레임워크를 결합하는 다층적 접근을 취해 왔으며, 이번 버전은 특히 실세계의 불확실성을 헤쳐 나가고 사람 곁에서 협업하는 상황의 안전성을 발전시켰습니다. 그 일환으로 이번 릴리스에서는 에이전트의 안전 오케스트레이션과 불확실성 해소를 평가하는 새 벤치마크 ASIMOV-Agentic을 공개했습니다. 이 벤치마크는 체화 추론 에이전트가 VLA의 안전하지 않은 도구 호출을 거부하는 능력, 작업의 실행 가능성을 예측하는 능력, 그리고 불확실할 때 선제적으로 사람의 개입을 요청하는 능력을 측정합니다.
벤치마크 결과에서 ER 2는 안전 지침 준수(Safety Instruction Following) 97.9%, 1미터 이내 인간 근접 감지(Human Proximity) 93.0%를 기록해, 각각 47.2%와 51.1%에 그친 ER 1.6은 물론 Opus 5와 GPT 5.6 Sol 같은 프론티어 모델도 앞섰습니다. 실제로 ER 2는 사람이 너무 가까이 다가오면 안전 도구 호출(Safety Tool Call)을 발동시켜 휴머노이드 로봇을 안전하게 정지시키고, 주변이 정리된 뒤에만 자율적으로 작업을 재개합니다. 이는 협동 로봇 안전 표준의 핵심 요구사항이기도 합니다. 자세한 내용은 Gemini Robotics 2 안전 기술 보고서(PDF)에서 확인할 수 있습니다.
모델 카드로 본 Gemini Robotics ER 2의 기술 사양
2026년 7월 발행된 Gemini Robotics ER 2 모델 카드(PDF)에 따르면, ER 2는 Gemini 3.5 Flash를 기반으로 공간, 시간, 물리 추론 능력을 강화한 시각 언어 모델(Vision-Language Model, VLM)입니다. 학습에는 Gemini 3.5 학습 데이터셋에 더해 다양한 체화 추론 작업을 담은 추가 데이터셋이 사용되었고, Google의 TPU에서 JAX와 ML Pathways로 학습되었습니다.
| 항목 | 내용 |
|---|---|
| 기반 모델 | Gemini 3.5 Flash |
| 입력 | 텍스트, 이미지, 비디오, 오디오 (인터리빙 가능) |
| 컨텍스트 윈도우 | 최대 128K 토큰 |
| 출력 | 텍스트, 최대 64K 토큰 |
| 도구 사용 | 검색, 함수 호출, 코드 실행, 구조화된 출력, URL 컨텍스트 |
| Live API | 지원 (텍스트 출력) |
| 제공 채널 | Google AI Studio, Gemini API, Gemini Enterprise Agent Platform(비공개 프리뷰) |
한 가지 유의할 점은 사용 범위 제한입니다. 모델 카드는 의료, 교통처럼 오작동이 죽음이나 부상, 재산 피해로 이어질 수 있는 안전 필수(Safety-critical) 환경에서 로보틱스 모델을 사용하지 말 것과, 상용 및 공공 환경에 배치하기 전 신중히 판단할 것을 명시하고 있습니다.
직접 사용해보기
Gemini Robotics ER 2는 Google AI Studio에서 gemini-robotics-er-2-preview 모델을 선택해 바로 실험해볼 수 있습니다. Gemini API 로보틱스 문서와 함께, 모델 설정과 프롬프트 작성 방법을 담은 시작하기 노트북도 공개되어 있습니다. VLA 모델과 On-Device 모델을 자체 하드웨어에서 테스트하고 싶다면 신뢰 테스터 대기자 명단에 신청할 수 있습니다. DeepMind는 현재 Apptronik, Boston Dynamics, Agile Robots 등의 파트너와 함께 100곳 이상의 신뢰 테스터와 협력하고 있으며, Google의 AI와 Gemini Robotics 모델로 초기 단계 스타트업의 성장을 돕는 프로그램도 함께 운영하고 있습니다.
범용 물리 AI를 향한 이정표
DeepMind는 Gemini Robotics 2를 물리적 세계에서 AGI(Artificial General Intelligence)를 실현하는 여정의 중요한 이정표로 평가합니다. 로봇공학의 진정한 잠재력을 열려면 단일 작업 자동화를 넘어 범용 지능으로 나아가야 하며, 이 핵심 지능을 구축해 사람과 함께 복잡한 문제를 해결하는 물리적 세계의 AI를 만드는 것이 목표라고 밝혔습니다. 앞으로는 이 모델들을 더 복잡한 작업으로 확장해 유용한 로봇의 개발을 가속하고 로보틱스 커뮤니티를 지원할 계획입니다.
Gemini Robotics 2 발표 블로그 (Google DeepMind)
Gemini Robotics ER 2 소개 블로그 (Google 블로그)
Gemini Robotics 샘플 코드 저장소
Gemini Robotics 모델 홈페이지
더 읽어보기
-
Gemini Robotics 1.5: Google DeepMind가 새로 공개한 사고하고 배우며 안전하게 진화하는 로봇 AI
-
Google DeepMind, Gemini 기반 VLA(Vision-Language-Action) 모델 Gemini Robotics 출시
-
Physical AI 연구 한 번에 살펴보기 1편: LLM 월드 지식에서 VLA와 월드 모델, 체화 에이전트까지
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
이 글이 유용하셨다면 아래
쪽 좋아요
를 눌러주세요 — 파이토치 한국 사용자 모임
이 새로운 소식을 정리하고 공유하는 데 힘이 됩니다! ![]()









