기존 로봇에 온디바이스 지능을 붙이는 Physical AI
비드래프트의 Physical AI는 새로운 로봇 하드웨어를 처음부터 만드는 프로젝트가 아닙니다.
이미 현장에 배치된 로봇에 센서, 엣지 컴퓨팅 모듈과 AI 모델을 추가해 자연어를 이해하고 주변 환경을 인식하며 행동할 수 있도록 만드는 것이 핵심입니다.
현재 두 가지 플랫폼에서 이를 실증했습니다.
- Boston Dynamics Spot에 온디바이스 음성·언어 처리 기능을 추가한 사례
- 원격조종 방식의 저가형 사족보행 로봇을 목적지 기반 자율보행 시스템으로 전환한 사례
두 실험 모두 로봇 제조사의 본체와 펌웨어를 다시 설계하지 않고, 외부에 부착하는 지능 모듈을 통해 기능을 확장하는 방식입니다.
왜 로봇에서 온디바이스 AI가 필요한가?
로봇은 일반적인 클라우드 애플리케이션과 다른 조건에서 동작합니다.
1. 지연시간
로봇은 센서 입력을 받은 뒤 짧은 시간 안에 정지하거나 방향을 바꾸고 행동해야 합니다. 매번 클라우드로 데이터를 보내고 응답을 기다리는 구조는 네트워크 상태에 따라 제어 지연이 달라질 수 있습니다.
2. 네트워크 독립성
산업 현장, 전시장, 지하 공간과 보안 시설에서는 외부 네트워크가 불안정하거나 차단될 수 있습니다. 인식과 판단 기능이 로봇 위에서 실행돼야 이러한 환경에서도 동작을 유지할 수 있습니다.
3. 데이터 보호
영상과 음성을 로컬에서 처리하면 카메라 영상과 사용자 음성이 외부 서버로 전송되는 범위를 줄일 수 있습니다.
4. 기존 장비의 재활용
현장에 설치된 로봇 전체를 교체하는 대신, 컴퓨팅 모듈과 센서를 추가하는 방식으로 기존 장비를 지능형 시스템으로 확장할 수 있습니다.
시스템 구성
비드래프트의 Physical AI 구조는 크게 다섯 계층으로 나뉩니다.
| 계층 | 구성 | 역할 |
|---|---|---|
| 입력 계층 | 마이크, 카메라, 3D 깊이 카메라, LiDAR | 음성·영상·거리·공간 정보 수집 |
| 인식 계층 | VLM, 음성 인식, 객체·공간 인식 | 입력 데이터를 로봇이 사용할 수 있는 의미 정보로 변환 |
| 위치 추정 계층 | 저장 지도, LiDAR localization, 목적지 좌표 | 현재 위치와 이동 방향 추정 |
| 의사결정 계층 | 자연어 명령 해석, 상태 관리, 행동 선택 | 사용자의 의도와 현재 상태를 바탕으로 다음 행동 결정 |
| 제어 계층 | 로봇별 제어 하네스 | 고수준 행동을 각 로봇이 이해하는 이동·자세 명령으로 변환 |
음성 · 영상 · LiDAR · 3D 깊이
↓
온디바이스 인식 계층
VLM · 음성 인식 · 공간 인식
↓
위치 추정 · 목적지 · 상태 관리
↓
행동 결정 · 안전 제약
↓
로봇 제어 하네스
↓
이동 · 정지 · 자세 변경 · 응답
여기서 중요한 부분은 AI 모델과 로봇 본체 사이의 제어 하네스입니다.
VLM이 생성한 자유 형식 문장을 그대로 모터 제어에 전달하는 것이 아니라, 허용된 행동 집합으로 변환하고 현재 상태와 안전 조건을 확인한 뒤 로봇별 제어 명령으로 내려보내는 구조가 필요합니다.
사례 1. Boston Dynamics Spot의 한국어 음성 명령 처리
Boston Dynamics Spot은 자체 이동 및 자세 제어 기능을 갖춘 사족보행 로봇입니다. 비드래프트는 Spot 본체의 펌웨어를 수정하지 않고 외부 온디바이스 AI 모듈을 추가했습니다.
목표는 한국어 자연어 명령을 로봇의 행동으로 변환하는 것이었습니다.
처리 과정
사용자의 한국어 음성
↓
로컬 음성 인식
↓
명령 의도 해석
↓
허용된 행동으로 매핑
↓
Spot 제어 인터페이스 호출
↓
이동 또는 자세 동작 수행
예를 들어 사용자가 한국어로 명령하면 장착된 모듈이 음성을 처리하고 명령의 의도를 판별합니다. 이후 결과를 Spot이 실행할 수 있는 동작으로 변환합니다.
이 구조의 핵심은 다음과 같습니다.
- 로봇 제조사의 언어 모델에 의존하지 않음
- 로봇 본체나 펌웨어를 직접 수정하지 않음
- 음성 처리를 로봇에 부착된 장치에서 실행
- 언어 해석 계층과 로봇 제어 계층을 분리
- 동일한 AI 계층을 다른 로봇 플랫폼에도 적용할 수 있음
현재 시스템은 서울로봇인공지능과학관에서 일반 관람객을 대상으로 운영되는 형태로 적용됐습니다.
실제 동작 영상 설명
한국어 음성 입력이 온디바이스 명령 해석 계층을 거쳐 Spot의 동작으로 변환되는 과정입니다. 영상은 언어 입력과 행동 실행의 연결을 보여주며, 임의 환경에서의 완전 자율주행 성능을 의미하지는 않습니다.
사례 2. 원격조종 로봇개의 목적지 기반 자율보행 전환
두 번째 실험에서는 사람이 리모컨으로 조작하던 저가형 사족보행 로봇에 별도의 인식·연산 장치를 추가했습니다.
사용한 주요 구성은 다음과 같습니다.
- NVIDIA Jetson Nano 기반 엣지 컴퓨팅 모듈
- 온디바이스 VLM
- LiDAR
- 3D 깊이 카메라
- 저장 지도 기반 위치 추정
- 로봇 이동 제어 인터페이스
기존 로봇은 사용자가 이동 방향을 계속 입력해야 했습니다. 실험의 목표는 목적지와 이동 방향을 지정한 뒤, 사람이 지속적으로 조종하지 않아도 로봇이 목적지까지 이동하도록 만드는 것이었습니다.
하드웨어 구성
┌──────────────────────────────┐
│ NVIDIA Jetson Nano │
│ On-device VLM · 제어 로직 │
└──────────────┬───────────────┘
│
┌────────┴────────┐
│ │
LiDAR 3D 깊이 카메라
│ │
└────────┬────────┘
│
위치 추정 · 장애물 인식
│
이동 방향 계산
│
사족보행 로봇 제어기
자율보행 처리 과정
1. 지도와 목적지 설정
LiDAR로 취득한 공간 정보 위에 로봇의 현재 위치와 목적지를 표시합니다. 제공된 Localization 화면에서 빨간색 화살표는 이동 방향을, 보라색 마커는 목적지를 나타냅니다.
2. 현재 위치 추정
로봇이 이동하는 동안 LiDAR 관측 결과를 저장된 지도와 비교해 현재 위치를 계속 갱신합니다.
이 단계는 단순히 처음 정한 방향으로 일정 시간 전진하는 것과 다릅니다. 로봇이 지도 안에서 자신의 위치를 추적해야 목적지에 대한 상대적인 방향을 다시 계산할 수 있습니다.
3. 이동 명령 생성
현재 위치와 목적지 사이의 차이를 바탕으로 전진과 방향 보정 명령을 생성합니다. 생성된 고수준 명령은 로봇의 기존 이동 제어 인터페이스가 이해할 수 있는 형태로 변환됩니다.
4. 목적지 도달 판정
로봇이 목표 지점의 허용 범위 안으로 들어오면 이동을 종료합니다.
5. 완료 동작 실행
목적지 도달 여부를 사람이 화면만 보고 추측하지 않도록, 로봇이 엎드림 동작을 수행해 임무 완료를 명시적으로 알립니다.
목적지 입력
↓
현재 위치 추정
↓
이동 방향 계산
↓
전진·방향 보정
↓
목적지 범위 진입 여부 확인
├─ 아니오 → 위치 추정 반복
└─ 예 → 정지 → 엎드림
영상에서 확인할 수 있는 범위
현재 영상과 Localization 기록으로 확인할 수 있는 것은 다음과 같습니다.
- 원격조종 로봇에 외부 컴퓨팅·센서 모듈을 장착
- 저장 지도 위에서 현재 위치와 목적지 표시
- 사전에 지정된 목적지를 향해 이동
- 사람이 이동 방향을 계속 입력하지 않아도 주행 지속
- 목적지 도달 후 엎드림 동작으로 종료 상태 표시
다만 현재 자료만으로 다음 항목까지 입증됐다고 표현해서는 안 됩니다.
- 처음 보는 임의의 환경에서 일반화된 완전 자율주행
- 움직이는 장애물에 대한 정량적 회피 성능
- 장거리·다층 공간 주행
- GPS가 없는 모든 환경에서의 안정성
- 반복 실험 성공률과 평균 위치 오차
- 음성 명령 기반 자율 임무 수행
마지막 항목은 다음 실험 단계입니다.
기술적으로 중요한 지점
1. 로봇과 AI를 분리한 구조
AI 모델을 특정 로봇 펌웨어 안에 직접 넣으면 다른 플랫폼으로 이전하기 어렵습니다. 이번 구성에서는 인식·판단 계층과 로봇 제어 계층을 분리했습니다.
따라서 새로운 로봇을 연결할 때 전체 AI 구조를 다시 만드는 대신, 로봇별 제어 어댑터를 교체하는 방향으로 확장할 수 있습니다.
2. 자유 형식 언어와 제어 명령의 분리
언어 모델의 출력은 확률적이지만 로봇 제어는 결정적이어야 합니다.
따라서 VLM 출력은 다음과 같은 제한된 명령 구조로 변환할 필요가 있습니다.
{
"action": "navigate",
"target": "point_b",
"completion_action": "lie_down",
"requires_confirmation": false
}
이 구조를 사용하면 모델이 생성한 문장을 직접 실행하는 대신, 허용된 행동인지 검사하고 필수 인자가 존재하는지 확인할 수 있습니다.
3. 명시적인 상태 머신
로봇의 상태는 최소한 다음처럼 구분해야 합니다.
IDLE
→ LOCALIZING
→ NAVIGATING
→ ARRIVED
→ COMPLETION_ACTION
→ DONE
위치 추정에 실패하거나 장애물을 처리할 수 없으면 STOPPED 또는 RECOVERY 상태로 전환해야 합니다. 상태를 명확히 구분해야 사용자가 로봇이 이동 중인지, 길을 잃은 것인지, 임무를 완료한 것인지 판단할 수 있습니다.
4. 엣지 장치의 자원 제약
Jetson Nano급 장치에서는 VLM, 센서 처리와 제어 루프가 같은 연산 자원을 사용합니다. 따라서 모델 크기뿐 아니라 다음 항목을 함께 관리해야 합니다.
- 추론 지연시간
- GPU·CPU 메모리 사용량
- 카메라와 LiDAR 처리 주기
- 발열에 따른 성능 저하
- 전력 소비
- 제어 루프 우선순위
언어 모델의 응답 품질이 높더라도 센서 처리와 이동 제어를 지연시키면 로봇 시스템에는 적합하지 않습니다.
다음 실험: 음성 명령에서 행동과 응답까지
다음 단계는 목적지를 화면에서 설정하는 대신 사람이 자연어 음성으로 임무를 지시하는 것입니다.
예를 들면 다음과 같습니다.
“복도 끝 표시 지점까지 이동하고, 도착하면 엎드려.”
예상 처리 과정은 다음과 같습니다.
음성 입력
↓
ASR · 음성 인식
↓
VLM · 명령 의도와 대상 추출
↓
구조화된 임무 계획 생성
↓
안전 조건·필수 인자 검사
↓
위치 추정과 자율 이동
↓
도착 판정과 완료 동작
↓
“목적지에 도착했습니다” 음성 응답
로봇은 명령 수행뿐 아니라 자신의 상태에 대한 질문에도 응답하도록 확장할 수 있습니다.
- “지금 어디에 있어?”
- “목적지까지 얼마나 남았어?”
- “앞에 장애물이 있어?”
- “왜 멈췄어?”
- “임무가 끝났어?”
이때 응답은 VLM이 임의로 추측해서 생성하는 것이 아니라 위치 추정기, 센서와 상태 머신이 제공한 실제 상태값을 근거로 만들어야 합니다.
정리
이번 Physical AI 실험의 핵심은 고가 로봇을 새로 개발한 것이 아닙니다.
서로 다른 두 종류의 사족보행 로봇에 외부 AI 계층을 결합해 다음 가능성을 확인한 것입니다.
- 기존 로봇에 자연어 인터페이스 추가
- 제조사 펌웨어를 수정하지 않는 부착형 구조
- 센서와 AI 추론의 온디바이스 처리
- 원격조종 플랫폼의 목적지 기반 자율보행 전환
- 로봇별 제어부와 공통 AI 계층의 분리
- 음성 명령·행동·상태 응답으로 확장 가능한 구조
