LightNav-0 소개
로봇에게 "앞쪽 왼편 벤치로 가서 멈춰"라고 말하는 일은 사람에게는 한 문장이지만, 로봇 쪽에서는 서로 다른 부품 여러 개를 거쳐야 하는 작업입니다. 지금까지의 내비게이션 시스템은 지시를 따라가는 작업, 이름만 주어진 물체를 찾는 작업, 움직이는 대상을 쫓는 작업마다 별도의 예측 헤드나 전용 모듈을 두었고, 로봇의 몸체가 바뀌면 그 부품을 다시 맞춰야 했습니다. 인식과 추론, 행동이 이렇게 쪼개지면 학습한 장면을 벗어났을 때 일반화가 잘 되지 않습니다. 사전학습된 비전 언어 모델(Vision-Language Model)이 이미 시각적 지시 대상 찾기와 공간 추론, 가리키기 같은 공간 사전지식을 담고 있는데도, 그 능력이 로봇 제어에 곧바로 쓰이는 경우는 드물었습니다.
LightNav-0은 이 문제를 "전용 헤드를 하나 더 만드는" 대신 "이미 있는 비전 언어 모델의 공간 지능을 끌어내 내비게이션에 정렬하는" 방향으로 접근한 모델입니다. Light Origins가 2026년 8월 31일 논문과 함께 공개했고, 백본은 Qwen3-VL (
Qwen3-VL: Alibaba Qwen팀이 공개한 더 선명한 시각, 더 깊은 생각, 더 넓은 행동이 가능한 Multimodal LLM) 계열의 Qwen3-VL-4B-Instruct입니다. 내비게이션 전용 모듈은 하나도 붙이지 않고 어휘(vocabulary)만 확장해서, 공간 추론의 흔적과 행동 코드가 모두 백본의 원래 자기회귀 언어 모델 헤드를 통해 나옵니다. 작업이 무엇인지 알려주는 별도의 토큰도 없고, 작업의 의미는 전부 사람이 준 지시문에서만 옵니다.
학습 데이터는 인터넷에서 모은 실제 장면 2,000개 이상을 시뮬레이션 세계로 되돌린 Real2Sim2Real 데이터 엔진에서 나왔고, 그렇게 만든 시각 언어 행동 경험이 4,000시간을 넘습니다. 이 데이터로 체화 추론(Embodied Reasoning) 중간 학습, 체화 지도 미세조정(fine-tuning), 온라인 강화학습의 3단계를 거쳐 하나의 체크포인트를 만들었습니다. 결과 모델은 지시 따라가기와 물체 목표 내비게이션, 체화 시각 추적을 한 모델 안에서 처리하며, 벤치마크마다 따로 미세조정하지 않은 같은 체크포인트로 공개 시뮬레이션 설정 10종을 모두 측정했습니다.
LightNav-0과 기존 방식 비교
기존 내비게이션 시스템과 LightNav-0의 차이는 성능 수치보다 인터페이스 설계에서 먼저 드러납니다. 저자들이 논문 초록과 저장소에서 밝힌 설계 선택을 항목별로 정리하면 다음과 같습니다:
| 항목 | 기존 내비게이션 시스템 | LightNav-0 |
|---|---|---|
| 작업 구분 | 작업별로 다른 모듈과 예측 헤드 | 지시문 하나로 구분, 작업 식별 토큰 없음 |
| 행동 출력 | 작업, 로봇별 전용 행동 헤드 | 잔차 벡터 양자화 행동 토큰 3개 |
| 로봇 이식 | 몸체마다 전문가 모델이나 재학습 | 같은 체크포인트로 별도 학습 없이 이식 |
| 측정 조건 | 파노라마 장비와 다중 카메라를 쓰는 계열이 함께 존재 | 전방 RGB 스트림 한 줄기, 깊이와 주행거리계 없음 |
측정 조건 항목이 특히 읽어둘 만합니다. Light Origins가 저장소에 올린 모든 LightNav-0 수치는 전방 RGB 영상 한 줄기에서만 나왔고 깊이 센서, 주행거리계(odometry), 파노라마 장비를 쓰지 않았습니다. 비교 대상으로 고른 것도 각 벤치마크에서 가장 강한 단안(monocular) 항목들입니다. 그러면서도 방해물이 섞인 추적 설정에서는 논문에 실린 파노라마와 다중 카메라 시스템까지 앞선다고 밝히고 있어, 센서를 덜 쓰는 쪽이 곧 성능을 포기하는 것은 아니라는 근거로 쓰입니다.
또 하나 눈여겨볼 지점은 스케일링 분석입니다. 백본을 2B에서 4B로 키우면 R2R 성공률과 SPL이 8.6점, 7.4점 올라가지만 8B는 오히려 대체로 조금 나빠집니다. 반면 학습 환경의 다양성을 1/8에서 전체로 늘리면 R2R에서 16.7점, 21.1점이 오릅니다. 파라미터나 학습 시간이 아니라 장면의 다양성이 성능을 끌어올린다는 뜻이고, 이는 4B라는 크지 않은 모델을 고른 이유이기도 합니다.
LightNav-0은 누구에게 맞는가
바퀴형과 4족, 휴머노이드, 비행 로봇 가운데 여러 대를 다루면서 몸체마다 정책을 따로 학습시키기 어려운 팀에게는 LightNav-0이 적절한 출발점입니다. 하나의 GPU 호스트에 모델을 올리고 로봇은 얇은 WebSocket 클라이언트만 실행하는 구조라, 로봇 쪽 계산 자원이 부족해도 시도해 볼 수 있습니다. 카메라 한 대와 저수준 제어기만 있으면 되므로 라이다나 깊이 카메라를 새로 달 필요도 없습니다.
반대로 실내 지도를 미리 만들어 두고 정해진 경로를 반복 주행하는 용도라면 LightNav-0이 적절한 선택지가 아닙니다. 이 모델이 내놓는 것은 지시문에 대응하는 10단계 SE(2) 경유점(waypoint)이고, 그 경유점을 실제 속도 명령으로 바꾸는 일은 각 로봇의 저수준 제어기 몫입니다. 또한 저자들이 공개한 것은 시뮬레이션 벤치마크 하네스와 배포용 코드이며, 자체 벤치마크인 INSIGHT-Bench의 에피소드와 평가 코드는 별도 공개 대상으로 남겨 두었습니다.
LightNav-0의 동작 원리
LightNav-0은 매 결정 시점에 시간 표시가 붙은 1인칭 RGB 영상 기록과 자연어 지시문을 하나의 인과적 시퀀스로 받아들이고, 두 종류의 토큰을 순서대로 내놓습니다:
첫 번째는 두 갈래 가리키기(dual-channel pointing) 토큰입니다. 하나는 지금 갈 수 있는 방향이나 빈 공간을 가리키는 행동가능성(affordance) 점이고, 다른 하나는 지시문이 말한 목표 물체를 가리키는 점입니다. 두 점 모두 이미지 격자 위의 토큰 하나로 표현되며, 행동을 만들기 전에 계획을 픽셀 위에 고정하는 명시적인 공간 추론 흔적 역할을 합니다. 위 구조도에서는 이 단계를 잠재 사고 사슬(Latent CoT)로 표시하고 있습니다.
두 번째는 잔차 벡터 양자화(Residual Vector Quantization, RVQ) 행동 토큰 3개이며, 이 셋이 10단계 SE(2) 경유점으로 풀립니다. 경유점은 로봇 몸체와 무관한 공통 기하 인터페이스라, 바퀴형이든 4족이든 각자의 저수준 제어기에 그대로 건네집니다.
LightNav-0의 시간 인식 히스토리 압축
내비게이션은 최근 장면의 기하학적 세부와 오래 전 맥락을 함께 필요로 하는데, 모든 프레임을 원래 해상도로 넣으면 시각 토큰 수가 끝없이 늘어납니다. LightNav-0은 에빙하우스 망각 곡선의 모양을 따라 최근성 기준으로 기록을 압축합니다. 프레임이 오래될수록 표본 추출 비율은 지수적으로 줄고 공간 풀링 보폭은 지수적으로 커져서, 먼 과거의 관측은 적고 거친 토큰만 남기고 현재 관측이 가장 세밀한 정보를 가져갑니다. 풀링 뒤에도 순서가 유지되도록 시간 표시 토큰을 함께 넣습니다. 압축기는 비전 트랜스포머 뒤에서 동작하며 256K, 576K, 1M의 픽셀 예산 설정을 고를 수 있습니다.
LightNav-0의 RVQ 행동 토크나이저
10단계 SE(2) 궤적은 256개짜리 거친 코드북 하나와 256개짜리 잔차 코드북 두 개로 양자화되며, 각 단계가 대략 0.9m, 7cm, 4cm 수준을 해상합니다. 비어 있지 않은 토큰 앞부분만으로도 실행 가능한 거친 궤적이 나오고, 잔차 단계를 더할수록 기하학적 정밀도가 올라갑니다. 큰 움직임과 센티미터 단위의 경로 모양을 같은 토큰 3개로 표현하는 구조입니다.
LightNav-0 벤치마크
아래 수치는 모두 벤치마크별 미세조정 없이 하나의 체크포인트로 측정한 값이며, 저장소에 실린 것은 요약본이고 NE와 nDTW, CR을 포함한 전체 표는 논문에 있습니다. 지표 가운데 SR은 성공률(Success Rate), SPL은 경로 길이로 가중한 성공률(Success weighted by Path Length), NE는 목표까지 남은 거리(Navigation Error)를 뜻합니다. 먼저 지시 따라가기 계열인 VLN-CE의 R2R과 RxR val-unseen 분할 결과입니다:
| 모델 | R2R SR (%) | R2R SPL (%) | RxR SR (%) | RxR SPL (%) |
|---|---|---|---|---|
| NaVILA | 54.0 | 49.0 | 49.3 | 44.0 |
| StreamVLN | 56.9 | 51.9 | 52.9 | 46.0 |
| DualVLN | 64.3 | 58.5 | 61.4 | 51.8 |
| CorrectNav | 65.1 | 62.3 | 69.3 | 63.3 |
| Qwen-RobotNav-8B | 65.7 | 59.6 | 73.4 | 63.5 |
| LightNav-0 | 68.5 | 62.8 | 73.6 | 64.5 |
물체 목표 내비게이션에서는 MP3D 53.3%, HM3D v1 74.5%, HM3D v2 79.5%를 기록했고, 학습에서 본 적 없는 범주 이름을 다루는 HM3D-OVON에서는 동의어 설정 53.3%, 완전히 새로운 범주 설정 47.0%로 나타났습니다. 다음은 체화 시각 추적을 다루는 EVT-Bench 결과이며, STT는 단일 대상 추적, DT는 목표와 비슷하게 생긴 방해물이 섞인 설정입니다:
| 모델 | STT SR (%) | STT TR (%) | DT SR (%) | DT TR (%) |
|---|---|---|---|---|
| Uni-NaVid | 53.3 | 67.2 | 31.9 | 50.1 |
| TrackVLA | 85.1 | 78.6 | 57.6 | 63.2 |
| VLingNav | 88.4 | 81.2 | 67.6 | 73.5 |
| ReferTrack | 89.4 | 92.5 | 73.3 | 81.8 |
| LightNav-0 | 91.7 | 87.7 | 82.6 | 80.1 |
이 표에서 성공률(SR)은 두 설정 모두 LightNav-0이 가장 높지만, 추적 유지율(TR)은 STT와 DT 모두 ReferTrack이 앞섭니다. 방해물이 섞인 DT 설정에서 성공률 차이가 9.3점으로 벌어지는 것과, 유지율에서는 1.7점 뒤지는 것을 함께 보아야 합니다. 마지막으로 Light Origins가 배포를 염두에 두고 직접 만든 INSIGHT-Bench는 실내외 210개 장면에서 1,097개 에피소드를 돌리며, 모든 정책을 120도 전방 RGB 인터페이스 하나와 300회 행동 예산으로 통일해 측정합니다:
| 모델 | SR (%) | SPL (%) | NE (m) |
|---|---|---|---|
| StreamVLN | 11.6 | 10.8 | 6.56 |
| Uni-NaVid | 24.3 | 22.1 | 4.91 |
| NaVid | 26.9 | 23.0 | 4.25 |
| JanusVLN | 27.4 | 24.0 | 4.89 |
| LightNav-0 | 43.7 | 41.5 | 3.88 |
INSIGHT-Bench는 Light Origins가 자체적으로 설계하고 측정해 공개한 벤치마크이므로, 위 세 공개 벤치마크와는 성격이 다르다는 점을 감안해 읽는 것이 좋습니다. 스케일링 분석은 아래 세 장의 그래프로 정리되어 있습니다:
세 축의 반응이 서로 다릅니다. 모델 크기는 4B에서 포화하고, 데이터 양은 단조롭게 오르지만 마지막 두 배 증량이 R2R 성공률을 0.8점밖에 올리지 못합니다. 학습 환경 비율만 끝까지 선형에 가깝게 오르며, 1/8에서 전체로 갈 때 RxR에서 21.1점과 19.1점이 상승합니다.
LightNav-0 설치와 사용
설치는 저장소를 내려받고 가상 환경을 만든 뒤 Hugging Face에 공개된 체크포인트를 받는 순서입니다. 추론 백엔드로 vLLM을 함께 설치합니다:
git clone https://github.com/lightorigins/LightNav-0.git && cd LightNav-0
python3.11 -m venv .venv && source .venv/bin/activate
pip install -e ".[vllm,video]"
hf download LightOriginsHQ/LightNav-0 --local-dir checkpoints/LightNav-0
공개된 체크포인트는 자기 행동 디코더를 함께 담고 있어서, 영상 클립에 대한 예측은 --model_path 하나만 지정하면 됩니다:
lightnav-predict --model_path checkpoints/LightNav-0 \
--backend vllm_local --video clip.mp4 --fps 4 \
--instruction "follow the person in the red shirt"
서버로 띄워 WebSocket으로 프레임을 흘려보내는 방식도 지원합니다:
PORT=8050 lightnav-serve --task tracking --model_path checkpoints/LightNav-0 --backend vllm_local
lightnav-ws-client --server ws://localhost:8050 --video clip.mp4 --fps 4 \
--instruction "follow the person in the red shirt"
로봇 없이 먼저 확인하고 싶다면 저장소의 mujoco_demo/에 MuJoCo 기반 TurtleBot과 ProcTHOR 장면이 함께 들어 있습니다. ROS나 Habitat 없이 ./run.sh로 띄운 뒤 웹 콘솔을 lightnav-serve 주소로 맞추고 지시문을 입력하면, 실제 로봇과 같은 모델 예측 제어(Model Predictive Control, MPC) 및 클라이언트 프로토콜로 움직입니다:

실제 로봇에 붙일 때는 GPU 호스트에서 lightnav-serve를 실행하고 로봇 쪽에서는 JPEG 프레임과 지시문을 보내고 첫 경유점을 실행하는 얇은 클라이언트만 두면 됩니다. 여러 대가 한 서버를 공유할 수 있도록 세션은 마이크로 배치로 묶입니다. 로봇 쪽 코드를 직접 쓰고 싶지 않다면 저장소의 robot_deploy/에 카메라 드라이버와 WebSocket 클라이언트, MPC 경유점 추종기, 웹 제어판을 갖춘 ROS 2 스택이 있고 Unitree Go2와 LimX TRON 1 어댑터가 함께 들어 있습니다. 프로토콜과 배포 절차는 저장소의 docs/GETTING_STARTED.md에 정리되어 있습니다.
지시문을 어떻게 쓰느냐도 성공률에 영향을 줍니다. 저자들은 동작 동사 하나와 방향, 명확한 물체 표현을 조합하라고 권하면서, 방향과 물체를 함께 주는 방식(Turn left and walk to the red lamppost)을 가장 신뢰할 만한 형태로 꼽습니다. 반대로 순서를 가리키는 표현(first, second)은 세는 방향을 함께 주지 않으면 모호해지므로 가장 약한 방식으로 분류했습니다.
LightNav-0의 라이선스
LightNav-0은 Apache 라이선스 2.0으로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다.
단, 함께 사용하는 EVT-Bench는 CC BY-NC-SA 4.0이며 이 저장소에 재배포되지 않으므로, 추적 성능을 직접 재현하려면 원 배포처의 조건을 따로 확인해야 합니다. 그 밖의 서드파티 코드와 라이선스는 저장소의 THIRD_PARTY_NOTICES.md에 정리되어 있습니다.
LightNav-0 프로젝트 소개 페이지 (Light Origins 공식 블로그)
LightNav-0 시작하기 문서
LightNav-0 논문
LightNav-0 프로젝트 GitHub 저장소
LightNav-0 모델 다운로드
더 읽어보기
-
Qwen3-VL: Alibaba Qwen팀이 공개한 더 선명한 시각, 더 깊은 생각, 더 넓은 행동이 가능한 Multimodal LLM
-
SmolVLA: 커뮤니티 데이터로 학습한 소규모(450M) 오픈소스 시각-언어-행동(Vision-Language-Action) 로봇 모델 (feat. Hugging Face)
-
World Action Model의 부상: 비디오 백본으로 로봇 정책을 학습하는 두 번째 레시피 (feat. NVIDIA)
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
이 글은 파이토치 한국 사용자 모임
이 직접 정리한 글입니다. 새 글을 놓치지 않으시려면 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로 알림을 받으시고, 회원으로 가입하시면 주요 글들을 이메일
로도 보내드립니다! ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()



