Skip to main content
PromptQuorum
/고급 로컬 LLM/2026년 로봇 탑재형 LLM·VLA 모델: 무엇이 맞고 무엇이 맞지 않는가
Mobile & Edge LLMs

2026년 로봇 탑재형 LLM·VLA 모델: 무엇이 맞고 무엇이 맞지 않는가

·13분 읽기·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

로봇은 단일 모델을 단일 속도로 실행하지 않습니다 — 작업 수준의 의도를 약 1~10Hz로 생성하는 느린 추론 계층(VLM 또는 VLA)과, 100~1,000Hz로 루프를 닫는 빠른 제어 계층(고전적 제어 코드)을 동시에 운용합니다. 70억 파라미터 VLA는 제어 루프 속도에 도달할 수 없으며, 애초에 그것이 요구되지도 않습니다. 목표 자세나 의도를 넘겨주면 결정론적 제어 코드가 이를 실행합니다. 실제 기술적 질문은 그 경계가 어디에 있으며, 눈에 띄게 행동이 저하되기 전까지 느린 계층이 어느 정도의 지연시간을 허용하는가입니다.

"로봇이 온보드에서 LLM을 실행할 수 있는가"는 질문 자체가 잘못되었습니다. 실제 운용되는 로봇 스택은 지능을 두 계층으로 분리합니다 — 계획을 담당하는 느린 추론 계층과, 기체를 안정적으로 유지하는 빠른 제어 계층입니다. 이 둘을 혼동하는 것이 "로보틱스 속 AI"를 다루는 콘텐츠에서 가장 흔한 프레이밍 오류입니다. 이 가이드는 각 계층이 실제로 허용하는 범위, 어떤 VLA 모델이 어떤 하드웨어에 적합한지, 그리고 모델 기반 추론 계층이 어디에서 멈추고 고전적 제어 코드가 넘겨받아야 하는지를 설명합니다.

2026년 로봇 탑재형 LLM·VLA 모델: 무엇이 맞고 무엇이 맞지 않는가

핵심 요점

  • 로봇 지능은 느린 추론 계층(VLM/VLA, 의사 결정 속도 약 1~10Hz)과 빠른 제어 계층(고전적 제어, 100~1,000Hz)으로 나뉩니다 — VLA가 제어 루프를 직접 닫도록 요구받는 일은 없습니다.
  • NVIDIA는 Isaac GR00T N1.5가 Jetson Thor에서 실행된다고 명시적으로 밝히고 있습니다. 또한 Llama, Qwen, DeepSeek(LLM)과 Qwen2.5-VL, Llama 3.2 Vision(VLM)이 언어/장면 설명 계층을 위해 동일한 보드에서 실행된다고 밝히고 있습니다.
  • Google DeepMind는 Gemini Robotics On-Device를 인터넷 연결 없이 로컬로 실행되도록 특별히 설계했습니다 — 온보드 추론이 이제 연구적 호기심이 아니라 1급 배포 목표라는 가장 명확한 신호입니다.
  • VLA로 로봇이 무엇을 할 수 있는지를 결정하는 제약은 사용 중인 카메라 수와 하드웨어에서 모델이 달성 가능한 의사 결정 속도이지, 가속기의 최대 TOPS 수치가 아닙니다.
  • 안전 등급 정지 및 기타 인증된 안전 기능은 결정론적이고 모델을 거치지 않는 로직에 남아 있습니다 — 이는 기술적 필요성(신경망은 형식적으로 검증할 수 없음)이자, 동시에 EU 기계류 규정의 적용 범위에 대한 저희 자체 해석에 따르면 컴플라이언스 부담을 줄이는 선택이기도 합니다. 다만 이는 규제 당국이 발표한 구체적 지침에 근거한 것이 아닙니다.
  • 창고의 자율 이동 로봇(AMR)과 농업 기계는 오늘날 이미 상업적 자율성을 대규모로 운용하고 있습니다. 인간형 로봇은 언론의 주목을 받지만 본 글에서 다루는 클래스 중 가장 적게 도입된 편입니다.
  • SmolVLA(약 4억 5천만 파라미터)는 저전력 대상을 위한 현실적인 오픈 옵션입니다. OpenVLA(70억)는 흔히 쓰이는 학술 기준선이며, 저지연 온보드 선택지는 아닙니다.

"로봇 위의 AI"가 실제로 분해되는 방식

로봇의 소프트웨어 스택에는 최소 다섯 가지 서로 다른 작업이 있으며, 그중 오늘날 LLM이나 VLA에게 현실적인 영역은 단 두 가지뿐입니다. "로보틱스 속 AI"를 하나의 미분화된 덩어리로 취급하는 것은 이 분야를 다루는 콘텐츠에서 가장 흔한 프레이밍 오류입니다 — 이는 잘못된 질문("LLM을 실행할 수 있는가?")으로 이어지며, 유용한 질문("이 다섯 가지 작업 중 모델이 실제로 담당하는 것은 무엇이고, 어떤 속도로 하는가?")을 놓치게 만듭니다.

데이터가 흐르는 순서대로 나열한 다섯 가지 작업: 지각(카메라·라이다·IMU 데이터를 구조화된 세계 표현으로 변환), 상태 추정(그 데이터를 시간에 걸쳐 융합하여 로봇 자신의 자세와 세계 상태에 대한 안정적인 추정치를 얻음), 작업 계획(다음에 *무엇을* 할지 결정 — "파란 컵을 집는다", "적재장으로 이동한다"), 모션 계획(작업을 실행 가능한 궤적으로 번역 — 관절 각도, 경로, 파지 방식), 그리고 제어(계획된 궤적을 교란을 상쇄하면서 순간순간 모터 명령으로 변환).

지각은 VLM과 경량 비전 모델이 이미 실질적인 역할을 하는 영역입니다 — 객체 탐지, 장면 설명, 의미론적 라벨링 등을 보통 카메라 피드가 만들어내는 5~30Hz 범위에서 수행합니다. 작업 계획은 VLA나 LLM이 진정한 가치를 더하는 영역입니다: 자연어나 시각적 목표를 하위 시스템이 실행할 수 있는 상징적 하위 목표로 번역하는 일입니다. 이 두 가지가 이 글이 VLA/LLM의 정당한 영역으로 다루는 작업입니다.

상태 추정, 모션 계획, 제어는 본질적으로 다릅니다. 상태 추정은 보통 칼만 필터나 파티클 필터를 사용합니다 — 신경망이 핵심 추정 문제에서 개선하지 못하는, 결정론적이고 잘 이해된 수학입니다. 모션 계획은 고전적 궤적 최적화기(CHOMP, RRT*, MPC 기반 플래너)가 주도하는데, 이는 정확히 검증 가능한 제약 충족을 제공하기 때문입니다 — 이는 언어 모델의 출력이 갖지 못한 특성입니다. 제어는 그중 가장 빠르고 모델에 가장 부적합한 영역입니다: 트랜스포머의 순전파가 도달할 수 없는 속도로 센서 오차에 대한 피드백 루프를 실행합니다.

📍 한 문장으로

로봇 소프트웨어 스택의 다섯 단계 — 지각, 상태 추정, 작업 계획, 모션 계획, 제어 — 중 오늘날 LLM이나 VLA에게 현실적인 영역은 지각과 작업 계획뿐이다.

💬 쉽게 말하면

지각 = "지금 무엇을 보고 있는가". 상태 추정 = "지금 어디에 있는가". 작업 계획 = "다음에 무엇을 해야 하는가". 모션 계획 = "그곳에 어떻게 도달하는가". 제어 = "지금 당장 모터를 움직여라". VLA는 첫 번째와 세 번째에 존재하며, 나머지는 고전적이고 결정론적인 코드가 담당한다.

로봇 소프트웨어 스택의 어느 부분을 LLM이나 VLA가 실제로 대체할 수 있습니까?

지각(장면 설명, 객체 식별)과 작업 계획(목표를 하위 목표로 변환하는 것)입니다. 상태 추정, 모션 계획, 제어는 각각 칼만/파티클 필터, 궤적 최적화기, 피드백 제어 루프로 고전적인 방식을 유지합니다. 이는 모델의 출력이 제공하지 못하는 결정론적이고 검증 가능한 동작이 필요하기 때문입니다.

제어 속도의 현실 점검

VLA로 로봇이 무엇을 할 수 있는지를 결정하는 제약은 모델이 달성 가능한 초당 의사 결정 수이지, 가속기의 최대 TOPS 등급이 아닙니다. 100 TOPS를 명시한 하드웨어 데이터시트는 20~70억 파라미터 VLA가 초당 몇 번이나 완전한 순전파를 실행하고 사용 가능한 액션을 생성할 수 있는지에 대해 아무것도 말해주지 않습니다. 이 수치는 모델 크기, 양자화, 배치 크기, 카메라 수, 메모리 대역폭이 함께 작용해 결정되며, 단일 스트림·저지연 워크로드에 대해 TOPS 수치가 시사하는 값보다 대개 훨씬 낮습니다.

루프마다 허용하는 지연시간은 크게 다릅니다. 다리형 또는 자체 균형 로봇의 이동 균형 루프는 한 자릿수 밀리초 단위의 보정이 필요합니다 — 이는 100~1,000Hz 제어 루프이며, 이 속도로 동작하는 공개된 VLA 아키텍처는 없습니다. 조작 작업 계획 루프("컵에 손을 뻗을지" "그릇에 손을 뻗을지" 결정)는 눈에 띄게 행동을 저하시키지 않으면서 100~1,000ms의 지연시간을 허용합니다 — 이는 VLA가 현실적으로 동작하는 1~10Hz 범위입니다. 내비게이션 수준의 재계획 루프(장애물을 피해 경로를 다시 계산)는 흔히 수 초를 허용합니다.

바로 이 때문에 모델의 근본적인 FLOPs가 아니라 모델의 출력 속도가 예산을 세워야 할 수치입니다. 파라미터 수가 비슷한 두 VLA라도 파이프라인(비전 인코더, 액션 디코더, 토큰화) 중 얼마나 많은 부분이 결정당 크리티컬 패스에 있는지, 그리고 동일한 순전파에 몇 개의 카메라 스트림이 입력되는지에 따라 달성 가능한 Hz가 크게 달라질 수 있습니다. 대부분의 VLA 아키텍처는 카메라가 추가될 때마다 이를 추가 병렬성이 아니라 추가 컨텍스트로 처리하기 때문입니다.

제어 루프 안의 모델은 성능 문제일 뿐 아니라 안전 부담이기도 합니다. 신경망의 출력은 PID나 MPC 컨트롤러의 안정성 여유처럼 형식적으로 검증할 수 없습니다 — 트랜스포머가 본 적 없는 입력 분포에 대해 결코 안전하지 않은 액션을 생성하지 않는다는 증명은 존재하지 않습니다. 이것이 저희가 알고 있는 모든 실운용 로봇 스택에서, 추론 계층 모델이 아무리 뛰어나더라도 안전 등급 정지, 토크 제한, 충돌 방지 인터록이 결정론적 제어 코드에 남아 있는 근본적인 이유입니다. 인증 가능한 안전 기능은 사전에 철저히 특성화할 수 있는 동작을 필요로 하며, 대형 신경망은 현재 그 보장을 제공할 수 없습니다.

  • 균형/이동 제어 루프: 100~1,000Hz 필요 — 항상 고전적 제어에 남아 있으며 VLA에는 결코 없음
  • 조작 작업 계획 루프: 100~1,000ms의 지연시간 허용 — VLA가 현실적으로 동작하는 범위
  • 내비게이션 재계획 루프: 대개 수 초 허용
  • 카메라 수는 대부분의 VLA 아키텍처에서 결정당 작업량을 배가시킵니다 — 동일한 의사 결정 속도에서 4대 카메라 구성은 1대 카메라 구성 대비 "공짜"가 아닙니다
  • 안전 등급 정지와 토크 제한은 업계 전반에서 결정론적이고 모델을 거치지 않는 로직에 남아 있습니다 — 저희가 인용할 수 있는 구체적인 규제 의무는 아니지만, 인증 가능한 안전 기능 요건의 직접적인 결과입니다(규제 맥락 섹션 참조)

더 크고 더 성능 좋은 VLA가 제어 루프를 직접 실행할 수는 없습니까?

두 가지 독립적인 이유가 있습니다. 첫째, 지연시간: 제어 루프는 100~1,000Hz의 보정이 필요하지만, 수십억 파라미터 모델의 순전파는 — 양자화되었더라도, 전용 가속기에서 실행되더라도 — 그보다 자릿수 단위로 느립니다. 둘째, 검증 가능성: 인증된 안전 기능(비상 정지, 토크 제한)은 사전에 철저히 특성화할 수 있는 동작을 필요로 하지만, 신경망의 출력 공간은 현재 PID 컨트롤러의 안정성 여유처럼 검증할 수 없습니다.

TOPS는 VLA 워크로드를 위한 하드웨어를 비교하는 좋은 방법입니까?

그것만으로는 부족합니다. TOPS는 이론적 최대 처리량을 측정하지만, 특정 의사 결정 속도가 달성 가능한지 결정하는 수치는 사용 중인 특정 모델·양자화·카메라 수에 대한 초당 의사 결정 수입니다. 이는 메모리 대역폭과 파이프라인 중 얼마나 많은 부분이 결정당 크리티컬 패스에 있는지에 크게 좌우되며, 단순한 원시 연산 능력만의 문제가 아닙니다.

로봇의 추론 예산 추정하기

모델이나 보드를 확정하기 전에, 아래 계산기를 사용해 특정 하드웨어/카메라 수 조합이 실제로 달성할 수 있는 의사 결정 속도를 추정해 보세요. 이 추정치는 초기 예산 산정을 위한 공학적 근사치이며 벤더 벤치마크가 아닙니다 — 설계를 확정하기 전에 실제 모델과 하드웨어를 기준으로 검증하세요.

Estimated slow-tier inference budget

Achievable frequency: 15.0 Hz

Headroom: +10.0 Hz — This fits the onboard slow-reasoning tier. The fast control loop (100–1,000 Hz) still needs to run in classical control code, not through this model.

VLA 모델 비교: 무엇이 오픈이고 어디에 적합한가

다섯 가지 VLA 모델이 로보틱스 팀이 2026년에 평가하는 오픈 및 준오픈 환경의 대부분을 아우르며, 여기에 이 분야가 어디로 향하는지 확인하기 위해 지켜볼 가치가 있는 제한된 접근 모델 하나가 더해집니다. 아래에서 "~"로 표시된 파라미터 수는 1차 벤더 스펙 시트가 아닌 2차 보도에서 나온 것입니다 — 정확한 값이 아니라 방향성을 나타내는 값으로 취급하세요.

NVIDIA Isaac GR00T N1과 그 개정판 N1.5는 인간형 로봇 지향 VLA 모델로, 공개적으로 배포되었으며 파라미터 수는 약 ~22억(2차 출처)입니다. NVIDIA는 GR00T N1.5가 자사의 Jetson Thor 보드에서 실행된다고 명시적으로 밝히고 있습니다 — 이는 추론된 것이 아니라 벤더가 확인한 온보드 배포 목표입니다.

Physical Intelligence의 π0(파이제로)는 플로우 매칭 방식의 VLA로 파라미터 수는 약 ~30억(2차 출처)이며, 오픈 가중치로 공개되었고 PaliGemma급 비전-언어 백본 위에 구축되었습니다(이 세부 사항도 2차 출처). 이전 VLA 설계 대비 매끄럽고 고빈도의 액션 생성으로 주목받았습니다.

OpenVLA는 70억 파라미터로 VLA 연구에서 흔히 쓰이는 학술 기준선입니다 — 오픈이며 문서화가 잘 되어 있고 벤치마크 대상으로 널리 사용됩니다. 그 크기 때문에 "유능한 VLA는 얼마나 커야 하는가"의 기준점 역할을 하지만, 촘촘한 온보드 지연시간 예산에서는 보통 첫 번째 선택지가 아닙니다.

Google DeepMind의 Gemini Robotics On-Device는 파라미터 수가 공개되지 않았고 접근이 제한/파트너 전용입니다 — 현재 대부분의 팀이 사용할 수 있는 옵션이 아닙니다. 그럼에도 지켜볼 가치가 있는 이유는: Google DeepMind가 이를 인터넷 연결 없이 로봇에서 로컬로 실행되도록 명시적으로 설계했다고 밝혔기 때문입니다. 이는 온보드 추론이 이제 클라우드 우선 시스템에 덧붙인 연구적 사후 생각이 아니라 1급 배포 목표라는, 대형 연구소가 보내는 가장 명확한 신호입니다.

SmolVLA는 파라미터 수가 약 ~4억 5천만(2차 출처)인 컴팩트한 오픈 VLA입니다 — 대상 하드웨어가 진정으로 저전력일 때(완전한 Jetson급 보드가 아니라 소형 가속기) 현실적인 선택지이며, 여기서는 2~70억 파라미터 모델의 메모리 사용량과 순전파 지연시간이 예산에 단순히 맞지 않습니다.

Octo와 RT-2는 더 이전 세대의 VLA 아키텍처로, 주로 이 분야가 현재의 플로우 매칭과 토큰화된 액션 설계에 어떻게 도달했는지 역사적으로 파악하는 데 유용합니다 — 2026년 배포 결정에 대한 현행 추천 사항은 아닙니다.

VLA 카테고리를 넘어, NVIDIA는 범용 Llama, Qwen, DeepSeek(LLM)과 Qwen2.5-VL, Llama 3.2 Vision(VLM)이 Jetson Thor에서 실행된다고 밝히고 있습니다. 이들은 완전한 VLA가 필요 없는 로봇 스택에서 언어 이해와 장면 설명 계층을 담당합니다 — 구두 질문에 답하는 서비스 로봇이나 텍스트 라벨을 읽는 조작 팔은 액션 출력 모델을 전혀 필요로 하지 않습니다.

모델
파라미터
접근성
온보드 대상
Isaac GR00T N1 / N1.5~22억 (2차)오픈Jetson Thor (NVIDIA 확인)
Physical Intelligence π0~30억 (2차)오픈 가중치Jetson급 보드
OpenVLA70억오픈AGX Orin/Thor급
Gemini Robotics On-Device비공개제한/파트너 전용설계상 로컬 (인터넷 불필요)
SmolVLA~4.5억 (2차)오픈저전력 가속기
Octo / RT-2다양오픈 (연구용)역사적 참고용

하드웨어 등급별 세부 사항(Hailo-10H, Jetson Orin Nano/NX, AGX Orin, AGX Thor — 전력 범위와 가격대)은 여기서 사양을 다시 도출하는 대신 로컬 LLM용 엣지 AI 하드웨어를 참고하세요 — 이 글은 무엇이 어디서 실행되는지에 초점을 맞추며, 실리콘 자체에는 초점을 두지 않습니다.

로보틱스 맥락에서 VLA와 VLM의 차이는 무엇입니까?

VLM(비전-언어 모델)은 이미지와 텍스트를 받아 텍스트를 출력합니다 — 장면 설명, 답변, 라벨 등입니다. VLA(비전-언어-액션 모델)는 동일한 입력을 받지만 로봇 액션을 출력합니다 — 목표 자세, 관절 궤적, 파지점입니다. 로봇 스택은 종종 지각/장면 이해 계층에는 VLM을, 작업 계획 계층에는 VLA를 사용하며, 자율적인 액션이 필요 없는 경우에는 VLM만 필요할 때도 있습니다.

OpenVLA는 지연시간에 민감한 온보드 배포에 좋은 선택입니까?

70억 파라미터의 표준 학술 기준선이며, 이 때문에 촘촘한 온보드 지연시간 예산에서는 Isaac GR00T N1.5(~22억, 2차 출처)나 SmolVLA(~4.5억, 2차 출처) 같은 목적에 맞게 설계된 대안보다 무겁습니다. 더 새롭고 작은 모델을 벤치마킹할 때 문서화가 잘 된 참고 기준점으로는 여전히 유용합니다.

통합 계층: ROS 2, TensorRT, 그리고 인계 과정

ROS 2는 대부분의 실운용 로봇 스택에서 느린 추론 계층과 빠른 제어 계층 사이의 실질적인 경계입니다. VLA 노드는 목표 자세, 하위 목표, 파지점 같은 작업 수준의 의도를 ROS 2 메시지로 발행하고, 별도의 고전적 제어 노드가 그 메시지를 구독하여 제어 루프 속도로 실행합니다. VLA는 모터와 직접 대화하는 일이 결코 없습니다. 토픽에 말할 뿐이며, 결정론적 노드가 그 토픽 이후의 모든 것을 담당합니다.

NVIDIA 하드웨어(Jetson Orin 및 Thor급)에서는 TensorRT와 TensorRT-LLM이 양자화된 VLA나 LLM을 달성 가능한 추론 속도로 끌어올리는 표준 런타임 경로입니다 — 커널 융합, 정밀도 보정(FP8/INT8/INT4), 그리고 단순한 PyTorch 추론 루프가 놓치는 하드웨어별 최적화를 처리합니다. 이 단계를 건너뛰는 것이 이론상 목표 Hz에 "도달해야 할" 모델이 실제로는 도달하지 못하는 가장 흔한 이유입니다.

NVIDIA 기반이 아닌 더 작은 온보드 대상 — Hailo-10H 가속기나 컴팩트한 ARM 기반 보드 — 의 경우, ExecuTorch와 llama.cpp가 언어/지각 구성 요소를 위한 관련 런타임 경로입니다. 둘 다 오늘날 바로 사용할 수 있는 VLA 런타임은 아닙니다. 이런 더 작은 보드를 겨냥하는 팀은 완전한 VLA보다 컴팩트한 VLM(지각/장면 설명용)을 더 자주 실행하며, 작업 계획은 규칙 기반 로직으로 단순화하거나 더 작은 가속기가 감당할 수 있는 빈도로 낮춰 실행합니다.

실제 통합 패턴은 순서대로: (1) VLA/VLM 노드가 달성 가능한 Hz로 비동기적으로 실행되어 의도를 ROS 2 토픽에 발행합니다. (2) 고전적 플래너가 이를 구독하여 의도를 궤적으로 변환합니다. (3) 제어 노드가 자체 센서 피드백 루프를 사용해 100~1,000Hz로 궤적을 실행합니다 — 다음 VLA 출력을 기다렸다가 행동하는 일은 결코 없습니다. VLA 노드가 멈추거나 지연되면 제어 노드는 마지막으로 유효했던 궤적을 계속 실행하거나 안전하게 위치를 유지합니다. 느린 계층을 기다리며 멈추지 않습니다.

  1. 1
    VLA/VLM 노드는 비동기적으로 실행됩니다
    Why it matters: 자체적으로 달성 가능한 속도(1~10Hz)로 작업 수준의 의도를 ROS 2 토픽에 발행합니다 — 제어 루프의 크리티컬 패스에 결코 놓이지 않습니다.
  2. 2
    고전적 플래너가 그 의도를 구독합니다
    Why it matters: 결정론적 모션 계획 코드를 사용해 하위 목표("컵에 손을 뻗는다")를 구체적이고 제약 조건이 검증된 궤적으로 변환합니다.
  3. 3
    제어 노드가 독립적으로 궤적을 실행합니다
    Why it matters: 자체 센서 피드백과 함께 100~1,000Hz로 실행되며, 다음 VLA 출력을 결코 기다리지 않습니다 — 느린 계층이 멈추면 빠른 계층은 위치를 유지하거나 마지막 유효 계획을 이어갑니다.
  4. 4
    NVIDIA 대상에서 TensorRT/TensorRT-LLM으로 양자화하고 컴파일합니다
    Why it matters: 커널 융합과 정밀도 보정(FP8/INT8/INT4)은 모델의 이론적 Hz와 실제 달성 Hz 사이의 차이를 대개 좌우합니다 — 이 단계를 건너뛰는 것이 온보드 추론 저성능의 가장 흔한 원인입니다.
  5. 5
    NVIDIA가 아닌 소형 대상에서는 워크로드를 완전한 VLA가 아닌 VLM으로 한정합니다
    Why it matters: ExecuTorch와 llama.cpp는 컴팩트한 보드에서 언어/지각 런타임 경로를 커버하지만, 오늘날 주류의 저전력 런타임 중 이러한 전력 범위에서 완전한 VLA를 실용적으로 만드는 것은 없습니다.

VLA 모델이 로봇의 모터와 직접 대화합니까?

아니요. 실운용 스택에서 VLA 노드는 작업 수준의 의도(목표 자세, 하위 목표)를 ROS 2 토픽에 발행합니다. 별도의 고전적 제어 노드가 그 토픽을 구독하여 제어 루프 속도로 모터 명령으로 변환합니다. VLA는 모터 명령 경로에 결코 놓이지 않습니다.

VLA 노드가 지연되거나 멈추면 어떻게 됩니까?

빠른 제어 계층은 그것을 기다리지 않습니다. 자체 센서 피드백 루프를 사용해 마지막으로 유효했던 궤적을 계속 실행하거나 안전한 위치를 유지하며, 추론 계층의 속도와 무관하게 동작합니다 — 이러한 분리야말로 애초에 이중 계층 아키텍처가 사용되는 이유입니다.

기계 클래스별 도입 현실

창고의 자율 이동 로봇(AMR)과 농업 기계가 오늘날 로봇 자율성의 실제 도입 현실을 대표합니다 — 인간형 로봇은 언론의 주목을 받지만 본 글에서 다루는 기계 클래스 중 가장 적게 도입된 편입니다. 이러한 격차는 엔지니어링 시간을 어디에 투자할지 결정하는 모든 이에게 중요합니다: 가장 연산 집약적이고 가장 많이 논의되는 로봇 카테고리가 동시에 지금 실제로 생산 환경에서 운용되는 대수가 가장 적은 카테고리이기도 합니다.

인간형 로봇은 가장 연산 집약적이고 가장 적게 도입된 클래스입니다: 가장 많은 센서와 자유도를 갖추고 있고, 그에 따라 가장 무거운 추론 계층 워크로드(다중 카메라 스트림, 전신 작업 계획)를 짊어집니다. 이것이 정확히 최신의 가장 성능 좋은 온보드 실리콘(Jetson Thor)과 최신 VLA 아키텍처(GR00T N1.5)의 주요 대상인 이유입니다. 받는 관심에 비해 오늘날 도입 규모는 작습니다.

창고에서 재고를 이동시키는 바퀴형 로봇인 자율 이동 로봇(AMR)은 수년간 의미 있는 규모로 상업적으로 배포되어, 고전적인 내비게이션과 장애물 회피 스택을 실행해 왔습니다. 2026년에 변화하는 것은 이미 성숙한 자율성 스택 위에 언어/비전 인터페이스 계층을 추가하는 것입니다: 장면 설명을 위한 VLM이나, 사람이 자연어로 지시를 내릴 수 있게 하는 경량 작업 계획 계층이며, 이는 기존 내비게이션 로직을 완전히 대체하는 것이 아닙니다.

고정 제조 셀의 산업용 로봇 팔은 이 양극단 사이에 위치합니다: 모션 계획과 제어는 통상 수십 년째 완전히 고전적인 방식을 유지하고 있으며(용접이나 픽앤플레이스 팔은 학습된 궤적을 반복하는 데 VLA가 필요하지 않습니다), 그러나 지각 계층 — 결함 탐지, 부품 식별 — 은 점점 더 경량 비전 모델을 사용하고 있습니다. 고정된 카메라 위치와 제한된 작업 덕분에 완전한 VLA 없이도 더 작고 목적 특화된 모델로 충분하기 때문입니다.

농업 기계는 "AI 로보틱스" 보도에서 가장 자주 간과되는 도입 클래스입니다. 현재의 VLA 물결이 오기 훨씬 전부터 이미 수년간 GPS 유도 조향, 트랙터·수확기의 장애물 탐지 같은 상업적 자율성이 대규모로 배포되어 왔음에도 그렇습니다. 지금 그 위에 추가되고 있는 것은 AMR과 동일한 패턴을 따릅니다: 작물이나 잡초 식별, 자연어 조작자 명령 같은 언어/비전 인터페이스 계층이 이미 자율적이고 이미 고전적이었던 내비게이션·제어 시스템 위에 얹히는 것입니다.

  • 인간형 로봇: 단위당 최고 연산량, 최신 VLA 아키텍처, 오늘날 가장 작은 도입 규모
  • AMR(창고): 수년간 성숙한 고전적 자율성 스택; VLM/VLA 추가는 인터페이스 계층이지 대체가 아님
  • 산업용 로봇 팔: 모션/제어는 수십 년째 완전히 고전적; 경량 비전 모델이 추가되고 있는 곳은 지각 계층
  • 농업 기계: GPS 조향, 장애물 탐지 같은 상업적 자율성이 현재의 VLA 물결보다 앞서 수년간 대규모로 배포됨

오늘날 어떤 로봇 클래스가 실제로 생산 환경에서 가장 많은 VLA 모델을 운용하고 있습니까?

아직 어느 클래스도 의미 있는 생산 규모에서 VLA를 주된 제어 메커니즘으로 운용하고 있지는 않습니다 — AMR과 농업 기계는 성숙한 고전적 자율성 스택을 운용하며, VLM/VLA 추가는 인터페이스 계층(장면 설명, 자연어 명령)에 국한되어 있습니다. 인간형 로봇은 가장 최신의 VLA 통합 대상이지만, 본 글에서 다룬 클래스 중 도입 규모가 가장 작습니다.

구매 가이드: 실제로 무엇을 찾아야 하는가

세 가지 하드웨어 카테고리가 온보드 추론 구축의 대부분을 아우릅니다: 추론 계층을 위한 Jetson급 개발 키트, 지각 입력을 위한 하나 이상의 깊이/스테레오 카메라, 그리고 모든 것을 탑재할 로봇 개발 플랫폼입니다. 이 섹션은 카테고리만 언급하며 구체적인 제품 코드, 가격, 벤더 주장은 다루지 않습니다 — 구매 전 각 벤더에서 직접 최신 사양과 가격을 확인하세요. 둘 다 어떤 글이 추적할 수 있는 것보다 더 빠르게 바뀝니다.

Jetson Orin과 Jetson Thor 개발 키트는 온보드 VLA나 VLM을 평가하기 위한 표준 출발점입니다 — 전력 범위와 상대적 연산 능력을 다루는 등급별 세부 분류(Orin Nano부터 AGX Thor까지)는 로컬 LLM용 엣지 AI 하드웨어를 참고하세요.

깊이 또는 스테레오 카메라는 VLA를 위한 표준 지각 입력입니다 — 공개된 대부분의 VLA 연구와 벤더 레퍼런스 설계는 단안 RGB만이 아니라 RGB-D나 스테레오 입력을 전제하는데, 깊이 정보가 액션 출력 계층이 의존하는 파지점과 장애물 거리 추정을 단순화하기 때문입니다.

로봇 개발 플랫폼 — 처음부터 기계적으로 제작하기보다 바퀴형 또는 팔 기반 레퍼런스 플랫폼 — 은 커스텀 하드웨어에 투자하기 전에 VLA 통합을 검증하는 팀에게 실용적인 출발점입니다.

  • Jetson Orin/Thor 개발 키트 — 추론 계층의 연산 목표
  • 깊이/스테레오 카메라 — VLA의 표준 지각 입력
  • 로봇 개발 플랫폼(바퀴형 또는 팔 기반 레퍼런스 키트) — 커스텀 하드웨어 전에 통합 검증

오프보드에 남는 것

적극적인 로컬 우선 아키텍처에서도 네 가지 워크로드는 로봇 외부에 남아 있습니다: 플릿 학습, 모델 업데이트, 로봇 간 컨텍스트 공유, 그리고 고비용 시뮬레이션입니다. 이들 중 어느 것도 지각이나 작업 계획처럼 지연시간에 민감하지 않으며, 모두 단일 로봇이 접근할 수 없는 연산과 데이터의 혜택을 받습니다.

플릿 학습 — 배포된 여러 로봇의 경험을 취합해 공유 정책이나 모델을 개선하는 것 — 은 본질적으로 단일 로봇이 가진 것보다 더 많은 유닛의 데이터를 필요로 하며, 여기에 관련된 학습 연산은 온보드 가속기의 예산이나 용도를 훨씬 뛰어넘습니다.

모델 업데이트(새로운 VLA 체크포인트, 미세 조정된 지각 모델)는 로봇에서 학습되는 것이 아니라 로봇으로 밀어 넣어집니다. 오늘날 사용되는 사실상 모든 실운용 배포 패턴에서 로봇은 학습 노드가 아니라 추론 대상입니다.

로봇 간 컨텍스트 — 한 로봇이 같은 플릿의 다른 로봇이 방금 관측한 것으로부터 혜택을 받는 것 — 은 공유 백엔드를 필요로 합니다. 한 로봇이 다른 로봇의 센서 이력에 직접 접근할 수 있는 유용한 온보드 메커니즘은 존재하지 않기 때문입니다.

고비용 시뮬레이션 — 학습 데이터를 생성하거나 배포 전에 정책을 검증하는 데 사용되는 대규모 물리·렌더링 워크로드 — 는 플릿 학습과 같은 이유로 데이터센터급 연산에서 실행됩니다: 그 연산 예산에는 온보드 상응물이 없습니다.

  • 배포된 다수 유닛에 걸친 플릿 학습
  • 로봇으로 밀어 넣어지는 모델/체크포인트 업데이트
  • 로봇 간 컨텍스트와 플릿 공유 상태
  • 학습 데이터 생성과 정책 검증을 위한 고비용 시뮬레이션

규제 맥락: EU AI법과 기계류 규정

EU에서는 기계류의 안전 구성 요소로 기능하는 AI 구성 요소가 EU AI법상 고위험으로 취급되며, EU 기계류 규정(2023/1230) — 2027년 1월부터 적용 — 은 AI 기반 안전 기능을 가진 기계류에 대해 별도로 적합성 평가를 요구합니다. 안전 기능 경로에 모델이 포함된 로봇은 둘 중 하나가 아니라 두 프레임워크 모두를 충족해야 할 수 있습니다.

다음은 저희 자체의 논리적 분석이며, 공식적으로 발표된 규제 지침이 아닙니다: 이 글 전체에서 설명한 이중 계층 아키텍처 — 안전 기능(비상 정지, 토크 제한, 충돌 인터록)을 결정론적이고 고전적인 제어 코드에 유지하고, VLA/LLM 추론 계층을 안전 기능을 직접 좌우하지 않는 자문적 또는 작업 수준 역할로 한정하는 것 — 은 적합성 평가 부담을 줄일 가능성이 있습니다. 인증 가능한 안전 기능은 사전에 철저히 특성화할 수 있는 동작을 필요로 하는데, 결정론적 코드는 이를 제공할 수 있지만 대형 신경망은 현재 그럴 수 없기 때문입니다. 저희는 어떤 규제 당국도 이러한 프레이밍을 확인하는 구체적인 지침을 발표한 것으로 알지 못합니다. 이를 컴플라이언스 보장이 아니라 자신의 법률 고문과 함께 평가해야 할 기술·컴플라이언스적 논거로 취급하시기 바랍니다.

이는 법률 자문이 아닙니다. 적합성 평가의 범위, 적용 가능한 조화 표준, 특정 로봇의 안전 기능에 대한 구체적인 분류는 실제 시스템 설계와 판매되는 법역에 따라 달라집니다 — 특정 제품에 대한 컴플라이언스 판단을 내리기 전에 자격을 갖춘 법률·규제 자문가와 상담하세요.

로봇의 안전 기능을 AI 모델 밖에 두면 EU 컴플라이언스가 보장됩니까?

아니요. 이는 적합성 평가가 일반적으로 결정론적 구성 요소와 비결정론적 구성 요소를 어떻게 다루는지에 근거한 합리적인 기술·컴플라이언스 전략이지만, EU AI법과 기계류 규정(2027년 1월부터 적용)에 따른 공식 적합성 평가를 대체하지 못하며, 저희는 이를 공식 규제 지침으로 인용하고 있지 않습니다. 특정 제품에 대해서는 자격을 갖춘 법률 고문과 상담하세요.

자주 묻는 질문

70억 파라미터 모델이 로봇에서 실시간으로 실행될 수 있습니까?

해당 작업에서 "실시간"이 무엇을 의미하는지에 따라 다릅니다. OpenVLA 같은 70억 파라미터 VLA는 Jetson AGX Orin이나 Thor 같은 성능 좋은 온보드 하드웨어에서 작업 계획 속도(약 1~10Hz)로 실행될 수 있습니다 — 이는 "컵에 손을 뻗는다"를 결정하는 데는 실시간입니다. 균형이나 이동 제어 루프가 필요로 하는 100~1,000Hz로는 실행될 수 없으며, 애초에 그것이 요구되지도 않습니다. 그 루프는 고전적 제어 코드에 남아 있습니다.

VLA와 로봇에서 LLM을 실행하는 것의 차이는 무엇입니까?

LLM(또는 VLM)은 언어와/또는 비전을 처리하여 텍스트를 출력합니다 — 장면 설명이나 구두 명령에 답하는 데 유용합니다. VLA(비전-언어-액션 모델)는 로봇 액션을 직접 출력합니다 — 목표 자세, 궤적, 파지점입니다. 많은 로봇 스택이 둘 다 사용합니다: 언어 이해와 장면 설명에는 LLM/VLM을, 목표를 구체적인 액션으로 바꾸는 데는 VLA를 사용합니다.

어떤 온보드 하드웨어가 Isaac GR00T N1.5를 실행합니까?

NVIDIA는 GR00T N1.5가 자사의 Jetson Thor 보드에서 실행된다고 밝히고 있습니다 — 이는 벤더가 확인한 배포 목표입니다. NVIDIA에 따르면 Jetson Thor는 완전한 VLA가 필요 없는 언어/장면 설명 계층을 위해 범용 LLM(Llama, Qwen, DeepSeek)과 VLM(Qwen2.5-VL, Llama 3.2 Vision)도 실행합니다.

로봇은 왜 모든 것에 단일 모델을 사용하지 않습니까?

작업들이 서로 양립할 수 없는 지연시간과 검증 가능성 요건을 가지고 있기 때문입니다. 작업 계획은 100~1,000ms의 지연시간을 허용하며 크고 유연한 모델의 혜택을 받습니다. 제어는 100~1,000Hz가 필요하며 안전 등급 기능을 위해 형식적으로 특성화 가능한 동작이 필요합니다 — 이는 현재 어떤 대형 신경망도 충족하지 못하는 요건입니다. 스택을 느린 추론 계층과 빠른 제어 계층으로 나누는 것이 실운용 로봇이 두 요구를 동시에 충족하는 방법입니다.

SmolVLA는 실제 제품에 현실적인 선택입니까, 아니면 단순한 연구용 장난감입니까?

이는 2~70억 파라미터 모델의 메모리 사용량과 순전파 지연시간에 비해 너무 제한적인 가속기, 즉 저전력 대상을 위한 현실적인 오픈 옵션으로 자리매김하고 있습니다. 약 ~4억 5천만(2차 출처)이라는 파라미터 수는 Jetson AGX급보다 작은 하드웨어를 겨냥하는 팀에게는 순수한 연구 시연이 아니라 진정한 공학적 트레이드오프입니다.

Gemini Robotics On-Device는 오늘 제 로봇에 라이선스를 받을 수 있다는 뜻입니까?

반드시 그런 것은 아닙니다. Google DeepMind는 이를 제한/파트너 전용 접근으로 설명하며, 파라미터 수는 공개되지 않았습니다. 검증 가능한 것은 설계 의도입니다: Google DeepMind는 이를 인터넷 연결 없이 로봇에서 로컬로 실행되도록 구축했다고 밝히고 있으며, 이는 아직 이 특정 모델에 접근할 수 없는 팀에게도 이 분야가 어디로 향하는지를 시사합니다.

Jetson Orin NX는 VLA급 추론을 위해 현실적으로 몇 개의 카메라 스트림을 지원할 수 있습니까?

모델과 목표 의사 결정 속도에 따라 다릅니다 — 대부분의 VLA 아키텍처는 카메라가 추가될 때마다 이를 개별적으로 병렬화 가능한 스트림이 아니라 순전파당 추가 컨텍스트로 처리하므로, 카메라를 추가하면 달성 가능한 Hz가 대략 비례해서 줄어들며 공짜가 아닙니다. 설계를 확정하기 전에 이 페이지의 추론 예산 계산기를 사용해 특정 하드웨어/카메라/모델 조합에 대해 이를 추정하세요. 이는 공학적 추정치이며 벤더 벤치마크가 아닙니다.

안전 등급 비상 정지가 VLA 모델을 거치는 경우가 있습니까?

저희가 알고 있는 어떤 실운용 로봇 스택에서도 그렇지 않습니다. 안전 등급 정지, 토크 제한, 충돌 방지 인터록은 결정론적이고 인증된 제어 로직에서 실행됩니다 — 신경망의 출력 공간은 현재 고전적 컨트롤러의 안정성 여유처럼 철저하게 검증할 수 없으며, 이것이 추론 계층 모델이 아무리 뛰어나더라도 이러한 분리가 유지되는 근본적인 공학적 이유입니다.

작업 계획에만 VLA를 사용하고 안전 기능에는 결코 사용하지 않는 로봇에도 EU AI법이 적용됩니까?

구체적인 시스템에 따라 여전히 적용될 가능성이 있습니다 — 기계류의 안전 구성 요소로 기능하는 AI에 대한 EU AI법의 고위험 분류는 시스템 내 AI의 역할에 관한 것이며, EU 기계류 규정(2023/1230, 2027년 1월부터 적용)에는 자체적인 적합성 평가 트리거가 있습니다. 이는 법률 자문이 아닙니다. 특정 제품의 분류에 대해서는 자격을 갖춘 자문가와 상담하세요.

관련 자료

← 고급 로컬 LLM으로 돌아가기