Helix 2.5 소개
Figure의 Helix 2.5는 사람의 행동 데이터로 사전 학습한 뒤, 처음 방문하는 가정에서도 집안일을 수행하도록 만든 휴머노이드 로봇용 모델입니다. Figure는 2026년 9월 17일 발표에서 베이 에어리어의 학습에 포함되지 않은 30개 집을 대상으로 거실 정리, 수건 접기, 침대 정돈을 평가한 결과를 공개했습니다.
로봇이 한 장소에서 작업을 잘하는 것과, 가구 배치나 물건이 달라져도 같은 작업을 수행하는 것은 별개의 문제입니다. 초기 Helix를 소개한 커뮤니티 글이 시각과 언어를 행동으로 연결하는 모델을 다뤘다면, 이번 발표는 학습한 행동이 새로운 집으로 얼마나 이전되는지에 초점을 맞춥니다. 이전 Helix 02는 전신을 협응해 긴 작업을 수행했지만, 실제로 운용할 장소에서 수집한 데이터를 사용했습니다.
이번에는 사람의 행동 데이터셋 Index로 학습한 공통 기반 모델에서 세 가지 작업용 정책을 만들었습니다. 여기서 제로샷 일반화(Zero-Shot Generalization) 의 대상은 새로운 집과 조작할 물체입니다. 집안일 자체를 전혀 배우지 않은 모델이 곧바로 모든 가사를 수행했다는 의미는 아닙니다.
새 집에서 집안일을 하려면 이동과 조작을 함께 해결해야 합니다
테이블 앞에 고정된 로봇 팔과 달리, 가정용 휴머노이드는 물건을 찾고 가까이 이동한 뒤 자세를 바꿔 손을 뻗어야 합니다. 침대를 정돈할 때도 한 위치에서 이불을 당기는 것으로 끝나지 않고, 반대편으로 이동해 다른 모서리를 잡아야 합니다. 방 안의 좁은 공간과 가구 배치는 이러한 동작의 순서와 접근 위치를 바꿉니다.
이처럼 이동과 물체 조작을 결합하는 것을 이동 조작(Locomanipulation) 이라고 합니다. 물체를 더 잘 보기 위해 몸을 움직이는 능동 지각(Active Perception) 도 함께 필요합니다. Figure가 선택한 세 작업은 단단한 물체와 변형되는 천을 다루면서, 양손 협응과 전신 제어를 모두 요구합니다.
Figure의 원문 데모 영상에서 추출한 장면입니다. 최상단 대표 이미지는 내용을 설명하기 위한 생성 일러스트입니다.
세 작업을 보여주는 원문 데모
좁은 가정 공간에서의 이동
제로샷의 범위는 평가할 집과 물체입니다
Figure는 평가할 30개 집에서 데이터를 수집하지 않았고, 작업을 학습시키는 데이터에도 평가용 장난감, 수건, 침구를 포함하지 않았다고 설명합니다. 평가용 물체는 실험 전에 따로 확보했으며, 작업 학습 데이터와의 중복 여부를 AI 모델로 확인한 뒤 사람이 재검토했습니다. 로봇은 각 집에 원래 있던 소파와 침대, 수건을 접을 수 있는 작업면을 사용했습니다.
다만 작업별 행동은 다른 장소에서 수집한 데이터로 미세 조정(Fine-Tuning) 했습니다. 각 작업은 30개 집 전체에서 하나의 고정된 체크포인트(Checkpoint) 를 사용했고, 평가 장소나 물체에 맞춰 가중치를 바꾸지 않았습니다. 평가 중 얻은 행동 기록이나 성능을 체크포인트 선택에 사용하지도 않았습니다. 따라서 공통 기반 모델 하나에서 출발했다는 말과, 단일 체크포인트가 세 작업을 모두 수행했다는 말은 구분해야 합니다.
출처: Figure, 원문 Table 1. 각 집의 물체와 가구를 이용하고, 초기 배치를 고정하지 않은 평가 설정입니다.
| 작업 | 달라지는 환경과 물체 | 완료 조건 |
|---|---|---|
| 거실 정리 | 모양과 재질이 다른 장난감, 가구, 바닥, 조명 | 흩어진 장난감 13~15개를 모두 바구니에 넣기 |
| 수건 접기 | 크기와 두께가 다른 수건, 높이와 마찰이 다른 작업면 | 모든 수건을 접어 바구니에 넣기. 성공률 도표는 수건 4개 전체 완료 기준 |
| 침대 정돈 | 침구 재질, 침대 높이와 프레임, 주변 여유 공간 | 두 베개와 이불 양쪽 모서리를 침대 위쪽에 배치하고 이불 펴기 |
초기 상태도 정해진 위치를 반복 재현하지 않았습니다. 사람은 장난감을 바닥과 소파, 테이블 등에 흩뿌리고, 수건은 방향과 구김을 통제하지 않은 채 놓으며, 침구는 흐트러뜨렸습니다. Figure는 이러한 초기화 조건을 비교하는 모든 정책에 동일하게 적용했다고 설명합니다.
성공 판정은 작업 전체의 완료를 요구합니다
대표 성공률에는 부분 점수를 주지 않았습니다. 예를 들어 수건을 접었더라도 바구니에 넣지 못하면 해당 수건은 실패입니다. 안전을 위해 사람이 개입해야 하는 경우에도 해당 시행을 중단하고 실패로 처리했습니다.
부록에는 세부 품질 등급과 시간 제한도 있습니다. 장난감은 하나당 1분, 수건은 하나당 3분이며, 침대 정돈에서는 각 베개와 이불의 각 측면에 1분씩 제한을 둡니다. 수건의 접힘 품질은 모서리 간 거리를 기준으로 나누고, 침구는 침대 상단 3분의 1 영역에 들어갔는지와 정렬 상태를 평가합니다. 이러한 기준은 단순히 물체를 잡았는지를 넘어, 정해진 작업을 끝까지 수행했는지를 확인하기 위한 것입니다.
Index 사전 학습의 효과를 같은 조건에서 비교했습니다
핵심 비교 실험은 모델 구조, 최적화 방식, 하이퍼파라미터, 작업별 학습 데이터와 평가 조건을 고정하고, 사전 학습(Pretraining) 여부만 바꿨습니다. 한 정책은 무작위 가중치에서 작업을 학습했고, 다른 정책은 Index로 사전 학습한 Helix 2.5에서 시작했습니다. Figure에 따르면 Helix 2.5의 사전 학습 자체도 무작위 초기화에서 Index만으로 진행했으며, 사전 학습된 시각 언어 모델에서 시작한 Helix 02와 이 점이 다릅니다.
출처: Figure, 원문 Figure 1. 아래 표는 도표에 기재된 성공 횟수와 백분율을 옮긴 것입니다.
| 작업 | Index 사전 학습 없음 | Index 사전 학습 있음 |
|---|---|---|
| 수건 접기 | 12/140회, 9% | 87/140회, 62% |
| 장난감 정리 | 7/140회, 5% | 56/140회, 40% |
| 침대 정돈 | 16/140회, 11% | 94/140회, 67% |
| 세 작업 합산 | 35/420회, 8% | 237/420회, 56% |
원문 본문과 도표의 표기가 다릅니다. Figure는 본문에서 전체 성공률이 9%에서 56%로 높아졌다고 설명하지만, 도표의 합산 값은 35/420회와 237/420회입니다. 이를 계산하면 각각 약 8.3%와 56.4%이며, 도표에는 8%와 56%로 표시되어 있습니다. 위 표는 횟수와 함께 확인할 수 있는 도표 기준을 따릅니다.
이 결과는 같은 작업 데이터를 사용하더라도, 폭넓은 사람의 행동을 먼저 학습한 모델이 새로운 환경에서 더 잘 수행했다는 근거입니다. 다만 작업별 성능 차이는 큽니다. Index를 사용한 경우에도 장난감 정리는 40%였고, 침대 정돈은 67%였습니다. 합산 성공률 56%를 모든 가사 작업이나 모든 가정에서 기대할 수 있는 보장치로 해석할 수는 없습니다.
Index에는 특정 평가 작업만 모아둔 것이 아닙니다
Index 소개 글에 따르면, Figure는 사람들이 집과 직장에서 실제 일을 하는 영상을 수집합니다. 수집 데이터에는 요리와 청소, 세탁뿐 아니라 물류센터, 식당, 공장, 사무실의 작업도 포함됩니다. 처리 과정은 품질 필터링, 부정 제출 검토, 중복 제거, 데이터 분포 재조정, 주석 생성의 다섯 단계로 구성됩니다.
Helix 2.5 발표에서 Figure는 개별 평가 작업이 Index 사전 학습 데이터에서 차지하는 비중이 각각 1.90%를 넘지 않는다고 밝혔습니다. 부록에서는 영상 임베딩과, 시각 언어 모델이 만든 활동 및 물체 설명의 텍스트 임베딩을 각각 군집화해 작업 분포를 분석했다고 설명합니다. 이는 평가 작업에 대한 광범위한 사전 경험과, 평가에 사용한 집이나 물체를 미리 본 것을 구분하기 위한 설명입니다.
작업 데이터는 줄이고 전신 오류 복구를 관찰했습니다
Figure는 같은 작업을 수행하는 기존 Helix 02 정책과도 비교했습니다. Helix 02는 평가할 환경에서 수집한 데이터를 사용했고, Helix 2.5는 절반의 작업 적응 데이터를 사용하면서도 30개 새로운 집에서 같은 수준의 성공률을 보였다고 설명합니다. 이 비교는 앞서 소개한 사전 학습 유무 비교와 별개의 실험입니다.
따라서 이를 총학습 데이터나 전체 학습 비용이 절반으로 줄었다는 뜻으로 읽으면 안 됩니다. 줄어든 것은 작업을 지정하기 위한 적응 데이터이며, Helix 2.5에는 별도의 Index 사전 학습이 있습니다. 또한 원문은 이 비교에 사용한 작업의 구체적 데이터 시간과 성공률 수치를 제시하지 않으므로, 데이터 절감 효과를 모든 작업으로 확대할 근거는 부족합니다.
Figure가 정성적으로 강조하는 변화는 자기 수정(Self-Correction) 입니다. 로봇은 작업 중 뒤로 물러나 자세를 바꾸거나, 침대 주변을 돌아 다른 위치에서 이불을 다시 정돈합니다. Figure는 이러한 복구 행동을 Index 사전 학습의 중요한 효과로 해석하지만, 복구 행동만의 성공률을 분리한 수치는 제시하지 않았습니다.
이동과 조작, 관찰 위치를 조정하는 동작은 다음 원문 영상에서도 볼 수 있습니다.
데이터 규모가 커질수록 행동 예측 손실이 낮아졌습니다
Figure는 사람의 데이터를 더 많이 사용하면 로봇 학습 성능이 어떻게 변하는지도 측정했습니다. 스케일링 법칙(Scaling Law) 실험에서는 Index의 서로 포함 관계에 있는 부분집합을 1배, 2배, 4배, 8배로 늘려 네 모델을 학습했습니다. 모델 크기와 후속 작업 학습 조건은 고정하고, 동일한 작업 데이터로 미세 조정한 뒤 따로 남겨둔 평가 데이터에서 다음 로봇 행동을 예측하는 손실을 측정했습니다.
출처: Figure, 원문 Figure 2. 가로축은 Index 사전 학습 데이터의 상대적 규모이며, 세로축은 검증 손실입니다.
Figure는 작은 규모 실험만으로 가장 큰 실험의 손실을 학습 전에 소수점 넷째 자리까지 예측할 수 있었다고 보고합니다. 예측 오차는 전체 8배 데이터 범위에서 관찰한 손실 변화량의 0.54%였습니다. 이 수치는 로봇 행동의 오류율이 0.54%라는 뜻이 아니라, 손실 감소 추세를 얼마나 정확하게 예측했는지를 나타냅니다.
여기서 측정한 것은 행동 예측 손실(Action-Prediction Loss) 입니다. 집안일 성공률이 데이터 양에 따라 같은 비율로 올라간다는 결과는 아니며, 모델 크기나 연산량까지 동시에 바꾼 실험도 아닙니다. 그럼에도 사람의 행동 데이터를 늘렸을 때 후속 로봇 학습의 개선을 예측할 수 있었다는 점은, 더 큰 데이터 수집을 계획하는 데 참고할 수 있는 결과입니다.
성과의 범위와 아직 공개되지 않은 부분
이번 발표는 작업별로 학습한 전신 행동이 처음 보는 집과 물체에 적용될 수 있는지를 실제 가정에서 시험했다는 데 의미가 있습니다. 사전 학습 유무를 통제한 비교도 있어, 데모 영상만으로 성능을 판단하는 것보다 학습 방식의 기여를 구체적으로 살펴볼 수 있습니다. 반면 30개 집은 베이 에어리어에 있으며, 작업 역시 세 종류이므로 지역과 생활환경, 가사 종류 전반에 대한 일반화까지 검증한 것은 아닙니다.
Figure는 이 범위의 제로샷 전신 일반화와 휴머노이드에서 측정한 사람-로봇 전이 스케일링 법칙을 최초 사례로 주장합니다. 이는 Figure의 자체 평가이며, 이번 발표만으로 분야 전체의 우선권이 검증되는 것은 아닙니다. 발표 페이지에는 모델 가중치, 재현 코드, 전체 평가 데이터의 공개 링크도 제공되지 않습니다.
발표 시점 기준으로 Figure는 Index가 매초 약 35분 분량의 새로운 사람 행동 경험을 생성하며, Helix 학습을 위해 35억 달러 규모의 연산 자원을 확보하기로 약정했다고 설명합니다. 이는 향후 확장 계획의 배경이며, 이번 Helix 2.5 학습에 실제로 사용한 데이터 총량이나 연산 비용을 뜻하지 않습니다. 구체적인 연산 자원 협약은 Figure와 Nscale의 발표에서 확인할 수 있습니다.
Helix 2.5 소개 블로그
Index 데이터 수집과 처리 과정 소개
이전 모델 Helix 02 소개
더 읽어보기
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일
로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()




