핵심 요점
- 프라이버시가 아니라 대역폭과 통신 링크의 한계가 카메라·드론 추론을 온디바이스로 옮기는 이유입니다. 지속적인 4K 스트림은 로컬에서 처리하는 칩보다 전송·저장 비용이 더 듭니다.
- 영상 분석은 고정 클래스 탐지에서 개방 어휘 VLM 검색으로 이동하고 있습니다. 사전 학습된 클래스 목록과 대조하는 대신 자연어로 이벤트를 서술합니다.
- 카메라용 실리콘: Hailo-10H와 Hailo-15는 5W 미만의 카메라 내장 GenAI를 겨냥하며, Ambarella N 시리즈(CES 2026 출시)는 멀티센서 인식을 갖춘 8K 엣지 AI 비전 SoC를 더합니다.
- 엣지 어플라이언스(NVIDIA Jetson Orin/Thor)는 현장에서 다수의 카메라 피드를 취합합니다. Jetson Thor는 최대 32개의 MIPI CSI-2 카메라 입력을 지원합니다.
- 드론은 기체 자체에서 연산을 실행합니다. Qualcomm QRB5165 기반 ModalAI VOXL 2는 자율비행, GPS 없는 시각-관성 오도메트리, 추론을 약 16g 모듈에 결합합니다.
- 대부분의 실제 배치는 하이브리드입니다. 경량 고정 클래스 탐지기가 지속적으로 실행되고, VLM은 트리거된 클립만 처리하며 모든 프레임을 처리하지 않습니다.
- VLM은 고정 클래스 탐지를 대체하지 않습니다. 프레임 단위의 연속적인 선별 작업을 계속 수행하는 탐지기 위에 개방 어휘 검색을 추가하는 것입니다.
프라이버시가 논의되기도 전에 영상 AI가 엣지로 이동하는 이유는 무엇인가?
대역폭과 물리적 통신 링크의 한계가 카메라·드론 추론이 온디바이스로 이동하는 주된 이유이며, 경제적 논거가 프라이버시 논거보다 먼저 등장합니다. 15~30fps로 지속 스트리밍하는 4K 카메라는 지속적인 비트레이트를 생성하며, 이는 다수의 카메라가 있는 현장과 30일의 보존 기간에 걸쳐 카메라 내장 또는 엣지 어플라이언스 가속기의 일회성 비용보다 더 빠르게 전송·저장 비용을 누적시킵니다. 이 페이지 하단의 계산기를 사용하면 본인의 카메라 대수와 보존 기간에 대해 이 계산을 직접 해볼 수 있습니다.
드론은 반대 방향에서 동일한 제약에 직면합니다. 저렴하게 옮기기에는 데이터가 너무 많은 것이 아니라, 의존할 수 있는 신뢰할 만한 링크가 너무 적습니다. 운용 거리에 있는 드론은 간헐적이고 저대역폭이며 때로는 방해받는 무선 링크를 가지고 있으며, 드론이 본 것을 해석하기 위해 지속적인 클라우드 연결에 의존하는 임무는 GPS 교란이나 육안 가시 범위 밖처럼 기체가 자율적으로 행동해야 할 바로 그 순간에 작동을 멈춥니다.
이는 이 사이트의 기존 로컬 LLM 콘텐츠가 소비자·데스크톱 AI에 대해 흔히 사용하는 프라이버시 우선 논거와는 다른 관점입니다. 카메라와 드론의 경우 구매자의 첫 번째 질문은 "이만큼의 영상을 옮길 여유가 있는가, 링크가 계속 유지될 것이라고 믿을 수 있는가"입니다. 프라이버시와 데이터 거주지는 실질적인 부차적 이점이지, 이 아키텍처가 존재하는 이유 자체는 아닙니다.
📍 한 문장으로
영상 AI가 온디바이스로 이동하는 이유는 전송·저장 비용과 신뢰할 수 없는 무선 링크가 프라이버시가 요인이 되기도 전에 클라우드 의존형 추론을 비현실적으로 만들기 때문입니다.
💬 쉽게 말하면
각 카메라의 영상을 서버로 옮기려면 비용이 들고 안정적인 링크가 필요합니다. 촬영된 곳에서 처리하면 두 문제를 모두 피할 수 있습니다.
추론은 카메라 내장, 엣지 어플라이언스, 클라우드 중 어디에서 실행해야 하는가?
오늘날 카메라 영상 AI를 처리하는 아키텍처는 세 가지이며, 대부분의 실제 운영 배치는 그중 최소 두 가지를 결합합니다. 올바른 선택은 현장당 카메라 대수, 보존 요구 사항, 하드웨어 예산이 대당 비용을 얼마나 흡수할 수 있는지에 달려 있습니다.
카메라 내장 추론은 가속기를 카메라 자체에 내장합니다. Hailo-10H와 Hailo-15는 5W 미만의 소비 전력이라는 바로 이 설계 지점을 겨냥합니다. 각 카메라가 자체적으로 판단을 내려야 하고(움직임 감지 녹화, 기기 내 변조 탐지) 카메라의 부품 명세서가 대당 칩 한 개를 흡수할 수 있을 때 이 방식을 사용하십시오.
현장 엣지 어플라이언스는 NVIDIA Jetson Orin 또는 Jetson Thor를 실행하는 한 대의 장비에 다수의 카메라 피드를 취합합니다. 현장의 카메라 대수가 개별적으로 장비를 갖추기에 무리일 만큼 많을 때 이 방식을 사용하십시오. Jetson Thor가 최대 32개의 MIPI CSI-2 카메라 입력을 지원한다는 점은 이 플랫폼이 단일 스트림 추론이 아니라 바로 이러한 다중 카메라 취합 역할을 위해 설계되었다는 강력한 신호입니다.
클라우드 처리는 실시간 요구 사항이 없고 클립 단위 지연 시간보다 수개월에 걸친 전체 아카이브의 소급 검색이 더 중요하며 소수 스트림의 대역폭 비용이 감당할 만한, 카메라 대수가 적은 현장에는 여전히 적합합니다.
실제로는 이 글의 뒷부분에서 설명하는 대부분의 배치가 하이브리드입니다. 고정 클래스 탐지는 카메라 내장 또는 엣지 어플라이언스에서 지속적으로 실행되고, 클라우드 저장소는 소급 검색을 위한 아카이브를 보유하며, VLM 추론은 더 저렴한 탐지기가 이미 표시한 클립에 대해서만 실행됩니다.
영상 분석은 탐지에서 서술로 어떻게 전환되고 있는가?
영상 분석은 고정 클래스 객체 탐지에서 개방 어휘 VLM 검색으로 이동하고 있으며, 이는 이 시장에서 가장 최근에 일어난 전환입니다. 고정 클래스 탐지기는 "이 프레임에 사람, 차량, 또는 약 80개의 사전 학습된 COCO 카테고리 중 하나가 있는가?"에 답합니다. 개방 어휘 VLM은 "누군가 하역장 근처에 가방을 두고 간 클립을 찾아줘"처럼 서술된 질의에 대해, 고정 클래스 탐지기가 카테고리로 인식하도록 학습된 적이 전혀 없는 영상을 대상으로 답합니다.
VLM은 고정 클래스 탐지기를 대체하는 것이 아니라 그 위에서 동작합니다. 비전-언어 모델은 5W 미만의 전력 예산 안에서 스트림당 초당 30프레임으로 동작하지 않습니다. 완전한 VLM 추론의 연산 및 지연 비용은 그 전력 범위 내에서 프레임 단위로 지속 처리하기에는 너무 높습니다. 대신 고정 클래스 탐지기가 움직임, 존재 여부, 기본 분류와 같은 지속적이고 저전력의 선별 작업을 계속 수행하고, 그것이 표시한 클립만 개방 어휘 서술이나 검색을 위해 VLM으로 전달됩니다.
이러한 이중 계층 설계가 바로 Hailo-10H 같은 카메라 내장 실리콘이 전체 프레임 VLM 프로세서가 아니라 "엣지의 GenAI" 가속기로 설명되는 이유입니다. 이 칩은 지속적인 경량 탐지 위에서 트리거되고 간헐적인 VLM 추론을 위해 설계된 것이지, 전체 프레임 속도로 비전-언어 모델을 구동하기 위한 것이 아닙니다.
📍 한 문장으로
개방 어휘 VLM 검색은 고정 클래스 탐지기가 카테고리로 인식하도록 학습된 적이 없는 영상에서 서술된 이벤트를 찾아내지만, 모든 프레임이 아니라 트리거된 클립에서만 동작합니다.
💬 쉽게 말하면
예전 방식: "사람/자동차/개와 일치하는 모든 것을 표시하라." 새로운 방식: "부두 근처에 가방을 두고 간 클립을 찾아줘" — 더 저렴한 탐지기가 이미 클립을 표시한 뒤, 자신의 말로 표현하는 것입니다.
- 고정 클래스 탐지: 지속적, 저전력, "이것이 N개의 사전 학습된 카테고리 중 하나인가?"에 답함
- 개방 어휘 VLM 검색: 트리거 방식, 소비 전력이 더 높음, 특정 클립에 대한 자연어 서술에 답함
- 둘은 경쟁 관계가 아니라 보완 관계입니다. 탐지기가 VLM에 무엇을 보여줄지 결정하며 그 반대는 아닙니다
- 데스크톱·서버급 VLM 구성(LLaVA, Qwen3-VL 등 유사 모델)은 이러한 트리거 방식 클립 분석에 사용되는 것과 동일한 모델 계열을 공유합니다. 임베디드 배치를 평가하기 전에 아래의 데스크톱 VLM 비교를 참고하십시오
카메라 현장에 실제로 필요한 대역폭과 저장 공간은 얼마인가?
아래에 카메라 대수, 해상도, 프레임 속도, 보존 기간을 입력하면 지속적인 대역폭과 저장 비용을 산정할 수 있습니다. 카메라 내장, 엣지 어플라이언스, 클라우드 아키텍처 중 하나를 선택하기 전에 이용하십시오. 산출된 숫자가 대개 그 논쟁을 스스로 해결해 줍니다.
Estimated bandwidth & storage
Continuous bandwidth (all streams): 128 Mbps
Storage for the retention window: 41.5 TB
Estimates from typical H.264 surveillance-quality bitrates, scaled linearly with frame rate. Actual bitrate varies with scene complexity and codec.
카메라 또는 드론 VLM 배치는 어떻게 평가하는가?
여섯 가지 점검이 현장에서 작동하는 배치와 실패하는 배치를 가릅니다. 특정 실리콘 플랫폼에 결정하기 전에 이 순서대로 실행하십시오.
- 1스트림이 아니라 트리거를 정의하라
Why it matters: 하드웨어를 선택하기 전에 어떤 이벤트가 VLM 추론을 촉발하는지(움직임, 고정 클래스 탐지기의 경보, 예약된 간격) 결정하십시오. 모든 스트림의 모든 프레임에 대해 VLM을 실행하는 것은 2026년에 존재하는 전력이나 비용 예산이 아닙니다. - 2실리콘을 선택하기 전에 링크 예산을 측정하라
Why it matters: 드론의 경우, 연산 플랫폼을 선택하기 전에 운용 거리에서 이용 가능한 업링크 대역폭과 최악의 경우 지연 시간을 측정하십시오. 연산 칩이 아니라 기체의 무선 링크가 보통 구속 제약입니다. - 3탐지와 서술을 별개의 단계로 유지하라
Why it matters: 경량 고정 클래스 탐지기를 지속적으로 실행하고 표시된 클립만 VLM으로 전달하십시오. 이것이 VLM 추론을 카메라나 드론의 전력 예산에 맞추는 유일한 방법입니다. - 4전력 예산을 물리적 인클로저에 맞춰라
Why it matters: 팬이 없는 카메라 인클로저는 열 설계 예산을 약 5W로 제한합니다. 드론 페이로드는 소비 전력만이 아니라 무게와 비행 시간의 절충으로 제한됩니다. 실리콘을 인클로저에 맞춰 설계하십시오, 그 반대가 아닙니다. - 5임무가 GPS나 명령 링크를 잃을 수 있다면 GPS 없는 운용을 검증하라
Why it matters: 시각-관성 오도메트리(VIO)는 육안 가시 범위 밖이나 교란된 전자기 환경에서 신뢰하기 전에 작동한다고 가정하지 말고 구체적으로 테스트해야 합니다. - 6확장하기 전에 한 현장이나 한 기체에서 시범 운영하라
Why it matters: 전체 함대 규모의 배치에 예산을 투입하기 전에 단일 배치에서 오탐율, 질의 지연 시간, 배터리·열 거동을 검증하십시오.
드론은 왜 영상을 스트리밍하는 대신 기체 내부에서 처리하는가?
드론이 연산을 기체로 옮기는 데는 세 가지 이유가 있습니다: 링크 여유, 지연 시간, GPS 없는 항법이며, 기체 탑재 연산이 더 저렴해서가 아닙니다. 드론의 무선 링크는 거리, 지형, 간섭에 따라 고정 카메라의 이더넷 케이블은 결코 겪지 않는 방식으로 저하됩니다. 영상을 해석하기 위해 지속적인 클라우드 연결에 의존하는 임무는 기체가 조종자로부터 가장 멀리 있고 자율성이 가장 필요한 바로 그 순간에 실패합니다.
Qualcomm QRB5165를 중심으로 구축된 ModalAI의 VOXL 2는 기체 탑재 연산 설계의 기준 플랫폼입니다. PX4와 호환되며, 위성 측위가 불가능하거나 교란될 때 항법을 위한 GPS 없는 시각-관성 오도메트리(VIO)를 지원하고, 자율비행, 연산, 항법 센서를 약 16g의 자율비행 등급 모듈에 담고 있습니다. 이는 별도의 전원 공급 장치가 아니라 페이로드 및 배터리와 동일한 무게 예산을 두고 경쟁할 만큼 작습니다.
무게와 전력은 벽에 고정된 카메라에는 해당하지 않는 방식으로 기체에는 엄격한 제약입니다. 기체 탑재 연산의 그램 하나하나가 배터리 용량, 센서 페이로드, 비행 지속 시간에 사용할 수 없는 그램입니다. 드론 플랫폼은 현장 카메라 사이트가 엣지 어플라이언스를 추가할 수 있는 것처럼 단순히 랙 유닛을 추가할 수 없습니다.
- 링크 여유: 무선 연결성은 거리, 지형, 간섭받는 스펙트럼에 따라 유선 카메라 인프라가 겪지 않는 방식으로 저하됩니다
- 지연 시간: 실시간 판단(장애물 회피, 표적 추적)은 클라우드 서버로의 왕복을 기다릴 수 없습니다
- GPS 없는 항법: 시각-관성 오도메트리는 위성 측위가 불가능할 때도 기체가 위치와 방향을 유지할 수 있게 합니다
- 무게 예산: 약 16g급의 자율비행 연산 모듈은 고정된 카메라의 인클로저와 달리 배터리 및 페이로드와 직접 경쟁합니다
카메라와 드론 VLM은 이미 어디에서 상업적으로 사용되고 있는가?
네 가지 상업 분야가 오늘날 실제 배치의 대부분을 차지합니다: 인프라·공공설비 점검, 정밀 농업, 측량 및 지도 제작, 공공 안전입니다.
- 인프라·공공설비 점검: 기체 탑재 연산을 갖춘 드론이 송전선, 파이프라인, 통신탑을 점검하며, 검토를 위해 원본 영상을 스트리밍하지 않고도 육안으로 확인 가능한 결함을 표시합니다
- 정밀 농업: 기체 탑재 비전은 필지별로 작물 스트레스, 잡초 압력, 관개 문제를 구분하며, 연결이 취약한 농촌 지역에서 지속적인 클라우드 연결에 의존하지 않고 농장 관리 시스템에 의사 결정을 반영합니다
- 측량 및 지도 제작: 사진측량·점검 드론은 기체 탑재 또는 엣지 어플라이언스에서 이미지를 처리하여 비행마다 전송·저장해야 하는 원본 데이터의 양을 줄입니다
- 공공 안전: 고정 카메라 네트워크는 지속적인 고정 클래스 탐지와 트리거 방식 VLM 검색을 결합합니다. 예를 들어 몇 시간 분량의 영상을 수동으로 검토하는 대신 서술된 사건을 아카이브에서 검색합니다
📌참고: 군사 프로그램도 이 실리콘 시장을 형성하고 있습니다. Shield AI의 자율 소프트웨어 Hivemind는 미 공군의 협업 전투 항공기(CCA) YFQ-44A 프로그램에 선정되었으며, Anduril의 Lattice 소프트웨어도 동일한 기체에서 테스트되었습니다. 자율 시스템 스택에 대한 이러한 프로그램 차원의 수요는 엣지 추론 실리콘 투자를 이끄는 요인 중 하나이지만, 국방 프로그램의 인증 경로, 구매 주체, 요구 사항은 위에서 설명한 상업적 배치와는 완전히 다르며 이 가이드의 범위를 벗어납니다.
비교: 카메라와 드론을 위한 연산 플랫폼
Jetson Orin과 Jetson Thor의 전체 사양은 엣지 실리콘 가이드를 참고하십시오. 이 표는 영상 분석과 가장 관련 있는 카메라·드론 전용 플랫폼에 초점을 맞춥니다.
플랫폼 | 전력 예산 | 최적 용도 | 상태 |
|---|---|---|---|
| Hailo-10H / Hailo-15 | 5W 미만 | 카메라 내장 GenAI, VLM 선별 | ISC West 2026에서 공개 |
| Ambarella N 시리즈 | 엣지 AI 비전 SoC | 8K 멀티센서 인식 | CES 2026에서 출시 |
| NVIDIA Jetson Orin / Thor | 15~130W급 | 다중 카메라 엣지 어플라이언스 | Thor: 최대 32개 MIPI 카메라 |
| Qualcomm QRB5165(VOXL 2) | 드론급 모듈 | 자율비행 + VIO + 추론 | PX4 호환, 약 16g |
시작하려면 어떤 하드웨어가 필요한가?
네 가지 하드웨어 범주가 대부분의 카메라·드론 VLM 프로젝트를 다룹니다. 가격이 자주 변동하므로 현재 판매점과 유통업체의 목록을 확인하십시오.
- 카메라 모듈과 개발 키트: 엣지 가속기와 결합한 레퍼런스 카메라 보드로, 맞춤형 카메라 설계를 확정하기 전에 카메라 내장 파이프라인을 프로토타이핑하는 데 사용
- Hailo M.2 가속기 모듈: M.2 슬롯을 통해 기존 카메라나 임베디드 연산 보드에 5W 미만의 AI 추론을 추가하며, 카메라의 메인보드를 재설계할 필요가 없음
- 엣지 영상 어플라이언스: NVIDIA Jetson Orin과 Jetson Thor 개발 키트로, 현장 어플라이언스 함대를 배치하기 전에 위에서 설명한 다중 카메라 취합 아키텍처를 프로토타이핑하는 데 사용
- 드론 개발 플랫폼: ModalAI VOXL 2 개발 키트로, 양산 기체에 통합하기 전에 PX4 기반 자율비행 및 기체 탑재 추론 파이프라인을 프로토타이핑하는 데 사용
온디바이스에서 아직 불가능한 것은 무엇인가?
세 가지 역량은 2026년 기준으로 여전히 클라우드급이거나 연구 단계에 머물러 있으며, 올해 안에 카메라·드론급 가속기가 이를 바꾸지는 않습니다.
- 장시간 영상 이해: 트리거 방식 클립 분석이 아니라 몇 시간에 걸친 전체 녹화 분량을 한 번에 추론하는 것은 여전히 엣지 가속기의 메모리와 연산 예산을 초과합니다
- 대규모 카메라 간 재식별: 서술된 대상을 다수의 카메라 피드와 현장에 걸쳐 신뢰성 있게 추적하는 것은 여전히 전체 다중 카메라 아카이브에 접근할 수 있는 중앙 집중식 시스템에 더 적합한 작업입니다
- 몇 시간 분량의 영상에 걸친 넓은 컨텍스트: 특정하게 표시된 클립이 아니라 하루 전체 녹화 분량에 걸쳐 추론해야 하는 개방 어휘 질의는 여전히 엣지 가속기의 전력 예산이 지원하는 것보다 더 많은 컨텍스트와 연산을 필요로 합니다
어떤 관할 규정과 조달 규칙이 적용되는가?
한국에서는 국토교통부(MOLIT)가 무인비행장치 신고·등록과 위험도에 따른 비행 등급 및 조종자 자격 체계를 관리합니다. 한국에서 카메라·드론 프로젝트를 진행할 때 MOLIT에 대한 기체 신고와 비행 등급 구분은 단순한 형식 절차가 아닙니다. 이는 추가 승인 없이 운용할 수 있는 자율 기능(예: 자동 탐지·대응 로직)을 결정합니다. 시스템 통합 담당자는 하드웨어와 자율 기능을 사양화하기 전에 예상되는 비행 등급과 필요한 승인·조종자 자격을 MOLIT 기준으로 먼저 확인해야 합니다.
자주 묻는 질문
카메라와 드론 AI 시스템은 왜 클라우드가 아니라 온디바이스에서 추론을 실행하나요?
프라이버시가 아니라 대역폭과 통신 링크의 한계가 주된 이유입니다. 지속적인 4K 카메라 스트림은 보존 기간 전체로 보면 로컬에서 처리하는 가속기보다 전송·저장 비용이 더 들고, 운용 거리에 있는 드론은 클라우드 의존을 견딜 수 없는 간헐적이고 때로는 방해받는 무선 링크를 가지고 있습니다.
고정 클래스 탐지와 개방 어휘 VLM 검색의 차이는 무엇인가요?
고정 클래스 탐지기는 프레임에 사전 학습된 카테고리 집합(일반적인 COCO 학습 모델에서 약 80개) 중 하나가 포함되어 있는지에 답합니다. 개방 어휘 VLM은 "누군가 하역장 근처에 가방을 두고 간 클립을 찾아줘"처럼 서술된 질의에 대해, 고정 클래스 탐지기가 카테고리로 인식하도록 학습된 적이 없는 콘텐츠를 대상으로 답합니다.
비전-언어 모델이 5W 미만의 카메라 가속기에서 실시간으로 동작할 수 있나요?
전체 프레임 속도로는 불가능합니다. VLM은 5W 미만의 전력 예산 안에서 스트림당 초당 30프레임으로 동작하지 않습니다. 실제로는 경량 고정 클래스 탐지기가 저전력으로 지속 실행되고, 표시된 클립만 개방 어휘 서술을 위해 VLM으로 전달됩니다. VLM은 트리거된 클립에서 동작하며 모든 프레임에서 동작하지 않습니다.
상업용 드론은 기체 탑재 AI를 위해 어떤 연산 플랫폼을 사용하나요?
Qualcomm QRB5165를 중심으로 구축된 ModalAI의 VOXL 2는 널리 사용되는 기준 플랫폼입니다. PX4와 호환되며, 항법을 위한 GPS 없는 시각-관성 오도메트리를 지원하고, 자율비행, 연산, 항법 센서를 약 16g 모듈에 담고 있습니다.
단일 4K 보안 카메라는 실제로 얼마나 많은 대역폭이 필요한가요?
프레임 속도, 장면 복잡도, 코덱에 따라 달라집니다. 하나의 대략적인 수치에 의존하기보다는 이 페이지의 대역폭 계산기를 사용해 본인의 카메라 대수, 해상도, 프레임 속도, 보존 기간에 대해 지속적인 대역폭과 저장 비용을 산정하십시오.
새 카메라 설계에는 Hailo-10H와 Ambarella N 시리즈 중 무엇을 선택해야 하나요?
둘은 겹치지만 서로 다른 지점을 겨냥합니다. Hailo-10H와 Hailo-15는 5W 미만의 카메라 내장 GenAI 추론에 초점을 맞추는 반면, Ambarella N 시리즈(CES 2026 출시)는 멀티센서 인식을 갖춘 8K 엣지 AI 비전 SoC로 포지셔닝되어 있습니다. 올바른 선택은 목표 해상도, 전력 예산, 동일 칩 내 멀티센서 융합이 필요한지 여부에 달려 있습니다.
드론에 GPS 없는 항법이 필요한 이유는 무엇이며, VOXL 2는 이를 어떻게 처리하나요?
GPS 신호는 교란되거나 스푸핑되거나 실내 또는 분쟁 환경에서 단순히 이용 불가할 수 있습니다. VOXL 2는 시각-관성 오도메트리(VIO)를 지원하여 카메라와 관성 센서 데이터를 융합해 위성 측위에 의존하지 않고 위치와 방향을 추정합니다.
한국에서 상업용 드론 점검에는 어떤 MOLIT 비행 등급이 적용되나요?
운용 내용에 따라 다릅니다. 국토교통부(MOLIT)는 기체 신고·등록과 위험도 기반 비행 등급 체계를 관리하며, 인프라·산업 시설 점검에는 대개 특정 승인이나 조종자 자격이 요구됩니다. 시스템 통합 담당자는 하드웨어와 자율 기능을 사양화하기 전에 해당하는 등급과 필요한 승인을 MOLIT 기준으로 확인해야 합니다.
엣지 어플라이언스가 필요한가요, 아니면 각 카메라가 단독으로 추론을 실행할 수 있나요?
현장당 카메라 대수에 따라 다릅니다. 소수의 카메라라면 각각 독립적으로 카메라 내장 추론을 실행할 수 있습니다(Hailo-10H/15급 칩). 카메라가 많은 현장은 대개 피드를 중앙에서 취합하는 현장 엣지 어플라이언스(NVIDIA Jetson Orin 또는 Thor)의 혜택을 봅니다. Jetson Thor가 한 대에서 최대 32개의 MIPI CSI-2 카메라 입력을 지원한다는 점은 의도된 다중 카메라 역할을 보여주는 강력한 신호입니다.
온디바이스 VLM은 영상 분석에서 아직 무엇을 할 수 없나요?
세 가지 역량이 2026년 기준으로 여전히 클라우드급이거나 연구 단계입니다: 몇 시간에 걸친 전체 녹화 분량을 한 번에 추론하는 장시간 추론, 대규모로 한 대상을 여러 카메라에 걸쳐 재식별하는 것, 그리고 특정하게 표시된 클립이 아니라 하루 전체 녹화 분량에 걸친 컨텍스트가 필요한 개방 어휘 질의입니다.
