关键要点
- 带宽和链路限制,而非隐私,是摄像头与无人机推理迁移到设备端的原因:一路持续的4K视频流的传输和存储成本,高于在本地处理它的芯片。
- 视频分析正从固定类别检测转向开放词汇VLM搜索——用自然语言描述事件,而不是与预训练的类别列表做匹配。
- 摄像头芯片:Hailo-10H与Hailo-15瞄准低于5W的摄像头内置生成式AI;Ambarella N系列(CES 2026发布)增加了具备多传感器感知能力的8K边缘AI视觉SoC。
- 边缘一体机(NVIDIA Jetson Orin/Thor)在本地聚合大量摄像头视频流;Jetson Thor最多支持32路MIPI CSI-2摄像头输入。
- 无人机在机身上运行算力:基于Qualcomm QRB5165的ModalAI VOXL 2,把自驾仪、无GPS视觉惯性里程计和推理集成在约16克的模块中。
- 大多数实际部署都是混合式——一个轻量的固定类别检测器持续运行;VLM只处理被触发的片段,而非每一帧。
- VLM并不取代固定类别检测——它是在持续做逐帧初筛工作的检测器之上,增加了开放词汇搜索能力。
为什么视频AI在隐私问题被提起之前就已经迁移到边缘?
带宽和物理链路限制,是摄像头与无人机推理迁移到设备端的主要原因——经济账先于隐私论证出现。 一台以15–30 fps持续推流的4K摄像头会产生持续的码率,在一个多摄像头站点和30天保留期内累积起来,其传输和存储成本比摄像头内置或边缘一体机加速器的一次性成本增长得更快。本页下方的计算器可以让你针对自己的摄像头数量和保留期做这项测算。
无人机则从相反的方向面对同样的约束:不是数据太多难以廉价搬运,而是可靠链路太少难以依赖。处于作业距离的无人机拥有间歇、低带宽、有时受干扰的无线链路——一项依赖持续云端连接来解读无人机所见的任务,恰恰会在飞行器最需要自主行动的时刻失效,例如GPS受干扰或超出目视距离时。
这与本站现有本地LLM内容在消费级和桌面AI场景中通常采用的隐私优先论证不同。对摄像头和无人机而言,买家的第一个问题是"我能否负担得起搬运这么多视频,能否指望链路保持稳定"——隐私和数据驻留是真实的次要收益,而不是这种架构存在的理由。
📍 简单一句话
视频AI迁移到设备端,是因为传输和存储成本,加上不可靠的无线链路,在隐私成为因素之前就已经让依赖云端的推理变得不切实际。
💬 简单来说
把每台摄像头的视频搬到服务器要花钱,还需要一条保持稳定的链路;在拍摄的地方直接处理则能同时避开这两个问题。
应该在摄像头内置、边缘一体机还是云端运行推理?
目前有三种架构处理摄像头视频AI,大多数生产环境部署至少结合了其中两种。 正确的选择取决于每个站点的摄像头数量、保留要求,以及硬件预算能承受多少单机成本。
摄像头内置推理把加速器直接嵌入摄像头——Hailo-10H和Hailo-15正是瞄准这个功耗低于5W的设计点。当每台摄像头都需要自行做出判断(运动触发录像、设备端防拆检测),且摄像头的物料清单能承受每台一颗芯片时,适合采用这种方式。
本地边缘一体机把大量摄像头视频流聚合到一台运行NVIDIA Jetson Orin或Jetson Thor的设备中。当一个站点的摄像头数量多到不适合逐一配置时,适合采用这种方式——Jetson Thor支持最多32路MIPI CSI-2摄像头输入,这是一个强烈的信号,表明该平台正是为这种多摄像头聚合角色而设计,而非单路推理。
云端处理仍然适合摄像头数量少、没有实时要求的站点,那里对数月完整档案的回溯搜索比单个片段的延迟更重要,且少量视频流的带宽成本可以接受。
实际上,本文后面描述的大多数部署都是混合式的:固定类别检测在摄像头或边缘一体机上持续运行,云端存储保留一份用于回溯搜索的档案,而VLM推理只针对成本更低的检测器已经标记的片段运行。
视频分析如何从检测转向描述?
视频分析正从固定类别的目标检测转向开放词汇VLM搜索——这是该市场最新的转变。 固定类别检测器回答的是"这一帧里有没有人、车辆,或者约80个预训练COCO类别中的某一个?"开放词汇VLM回答的是一个被描述的查询——"找到有人在装卸区附近放下一个包的片段"——针对的是固定类别检测器从未被训练识别为某个类别的画面。
VLM并不取代固定类别检测器——它是在其之上工作的。 视觉语言模型无法在低于5W的功耗预算内以每流每秒30帧的速度运行;完整VLM推理的算力和延迟成本,对于该功耗范围内的持续逐帧处理来说太高了。取而代之的是,固定类别检测器继续承担运动、存在、基础分类这类持续、低功耗的初筛工作,只有被它标记的片段才会被传给VLM进行开放词汇的描述或搜索。
这种两级设计正是为什么像Hailo-10H这样的摄像头内置芯片被描述为"边缘生成式AI"加速器,而不是全帧VLM处理器:这颗芯片的规格是为在持续轻量检测之上运行触发式、间歇性的VLM推理而设计的,而不是以全帧率运行视觉语言模型。
📍 简单一句话
开放词汇VLM搜索能在固定类别检测器从未学过识别为某个类别的画面中找到被描述的事件,但它只在被触发的片段上运行,而非每一帧。
💬 简单来说
旧方法:"标记所有匹配人/车/狗的内容"。新方法:"找到有人在装卸区放下包的片段"——用自己的话描述,而且是在成本更低的检测器已经标记该片段之后。
- 固定类别检测:持续运行、低功耗,回答"这是N个预训练类别中的哪一个?"
- 开放词汇VLM搜索:触发式运行、功耗更高,针对特定片段回答自然语言描述
- 两者是互补关系,而非竞争关系——由检测器决定给VLM看什么,而不是反过来
- 桌面和服务器级VLM配置(LLaVA、Qwen3-VL等类似模型)与这种触发式片段分析共享相同的模型系列——评估嵌入式部署之前,请参阅下方的桌面VLM对比
你的摄像头站点实际需要多少带宽和存储?
在下方输入摄像头数量、分辨率、帧率和保留期,即可估算持续带宽和存储成本。 请在摄像头内置、边缘一体机或云端架构之间做选择之前使用它——得到的数字通常能自行决定这场争论的结果。
Estimated bandwidth & storage
Continuous bandwidth (all streams): 128 Mbps
Storage for the retention window: 41.5 TB
Estimates from typical H.264 surveillance-quality bitrates, scaled linearly with frame rate. Actual bitrate varies with scene complexity and codec.
如何评估摄像头或无人机的VLM部署?
六项检查能区分一次在现场能正常运作的部署与一次会失败的部署。 在确定具体的芯片平台之前,请按此顺序执行。
- 1先定义触发条件,而非视频流本身
Why it matters: 在选择硬件之前,先决定什么事件会触发VLM推理(运动、固定类别检测器的报警、预定的时间间隔)——让VLM针对每路视频流的每一帧运行,在2026年不是任何现实的功耗或成本预算所能承受的。 - 2在选择芯片之前先测量链路预算
Why it matters: 对于无人机,在选择计算平台之前,先测量作业距离处可用的上行带宽和最坏情况下的延迟——通常是飞行器的无线链路,而不是计算芯片,构成了约束条件。 - 3把检测和描述作为分离的两个阶段
Why it matters: 让轻量的固定类别检测器持续运行,只把被标记的片段发送给VLM——这是让VLM推理适配摄像头或无人机功耗预算的唯一方式。 - 4让功耗预算与物理外壳相匹配
Why it matters: 无风扇的摄像头外壳把热设计预算限制在约5W;无人机载荷的限制来自重量和续航之间的取舍,而不仅仅是功耗——应该为外壳选择合适的芯片,而不是反过来。 - 5如果任务可能失去GPS或指挥链路,就验证无GPS运行能力
Why it matters: 视觉惯性里程计(VIO)需要专门测试,而不能假设它能正常工作,之后才能在超出目视距离或电磁环境受干扰的情况下依赖它。 - 6在扩大规模之前,先在一个站点或一架飞行器上试点
Why it matters: 在为整个机队规模的部署投入预算之前,先在单次部署中验证误报率、查询延迟以及电池/散热表现。
无人机为什么在机载处理视频,而不是把它传输出去?
无人机把算力搬到机身上有三个原因:链路余量、延迟和无GPS导航——而不是因为机载算力更便宜。 无人机的无线链路会随距离、地形和干扰而劣化,这是固定摄像头的以太网线永远不会遇到的情况;一项依赖持续云端连接来解读视频的任务,恰恰会在飞行器离操作者最远、最需要自主能力的时刻失效。
基于Qualcomm QRB5165构建的ModalAI VOXL 2,是机身算力设计的参考平台。 它兼容PX4,在卫星定位不可用或受干扰时支持无GPS视觉惯性里程计(VIO)导航,并把自驾仪、算力和导航传感器打包进一个约16克的自驾仪级模块——小到足以与载荷和电池争夺同一份重量预算,而不是与一个独立电源争夺空间。
重量和功耗在机身上是硬性约束,这一点与固定在墙上的摄像头完全不同。 每一克机载算力,都是一克无法用于电池容量、传感器载荷或飞行续航的重量——无人机平台不能像本地摄像头站点添加边缘一体机那样,简单地加一台机架设备。
- 链路余量:无线连接会随距离、地形和受干扰的频谱而劣化,这是有线摄像头基础设施不会遇到的情况
- 延迟:实时决策(避障、目标跟踪)无法等待与云端服务器的一次往返
- 无GPS导航:视觉惯性里程计让飞行器在卫星定位不可用时仍能保持位置和航向
- 重量预算:约16g级别的自驾仪算力模块直接与电池和载荷争夺重量,这与固定摄像头的外壳不同
摄像头与无人机VLM目前已在哪些领域商用?
四个商用类别占据了当下大多数已投产部署:基础设施与公用事业巡检、精准农业、测绘、以及公共安全。
- 基础设施与公用事业巡检:搭载机载算力的无人机巡检输电线路、管道和通信基站,在不将原始画面回传审核的情况下标记出可见缺陷
- 精准农业:机载视觉逐地块区分作物胁迫、杂草压力和灌溉问题,把决策反馈给农场管理系统,无需在连接较弱的农村地区依赖持续的云端链路
- 测绘:摄影测量和巡检无人机在机载或边缘一体机上处理影像,减少每次飞行需要传输和存储的原始数据量
- 公共安全:固定摄像头网络将持续的固定类别检测与触发式VLM搜索结合起来——例如从档案中检索被描述的事件,而不是人工翻查数小时的画面
📌注: 军事项目也在塑造这一芯片市场。Shield AI的自主软件Hivemind被选定用于美国空军的YFQ-44A协同作战飞机(CCA)项目,Anduril的Lattice软件也曾在同一机身上测试。这种项目层面对自主系统栈的需求,是推动边缘推理芯片投资的因素之一,不过国防项目的认证路径、采购方和要求与上文所述的商用部署完全不同,也不在本指南的范围之内。
对比:面向摄像头和无人机的计算平台
关于Jetson Orin和Jetson Thor的完整规格,请参阅边缘芯片指南——本表只聚焦于与视频分析最相关的摄像头和无人机专用平台。
平台 | 功耗预算 | 最适合 | 状态 |
|---|---|---|---|
| Hailo-10H / Hailo-15 | 低于5W | 摄像头内置生成式AI、VLM初筛 | 于ISC West 2026展示 |
| Ambarella N系列 | 边缘AI视觉SoC | 8K多传感器感知 | 于CES 2026发布 |
| NVIDIA Jetson Orin / Thor | 15–130W级别 | 多摄像头边缘一体机 | Thor:最多32路MIPI摄像头 |
| Qualcomm QRB5165(VOXL 2) | 无人机级模块 | 自驾仪+VIO+推理 | 兼容PX4,约16g |
起步需要哪些硬件?
四类硬件涵盖了大多数摄像头和无人机VLM项目;由于价格变动频繁,请查看经销商和分销商的最新报价。
- 摄像头模块与开发套件:参考摄像头板搭配边缘加速器,用于在投入定制摄像头设计之前,先验证一套摄像头内置流水线的原型
- Hailo M.2加速器模块:通过M.2插槽为现有摄像头或嵌入式计算板增加低于5W的AI推理能力,无需重新设计摄像头的主板
- 边缘视频一体机:NVIDIA Jetson Orin和Jetson Thor开发套件,用于在部署本地一体机机队之前,先验证上文所述的多摄像头聚合架构原型
- 无人机开发平台:ModalAI VOXL 2开发套件,用于在集成到量产机身之前,先验证基于PX4的自驾仪和机载推理流水线原型
设备端目前还做不到什么?
截至2026年,有三项能力仍停留在云端级别或研究阶段,今年内没有任何摄像头或无人机级加速器会改变这一点。
- 长时程视频理解:一次性推理数小时的完整录像,而非触发式的片段分析,仍然超出边缘加速器的内存和算力预算
- 大规模跨摄像头再识别:在众多摄像头视频流和站点中可靠地追踪一个被描述的对象,仍然是更适合由能访问完整多摄像头档案的中心化系统承担的工作负载
- 跨越数小时画面的大上下文:一个需要对完整一天的录像、而非某个被标记的特定片段进行推理的开放词汇查询,所需要的上下文和算力仍然超出边缘加速器的功耗预算所能支持的范围
适用哪些司法管辖与采购规则?
中国是无人机与机器人硬件的主要制造基地,并且正日益成为其中边缘芯片的主要来源之一。 在这一背景下可以观察到一个总体趋势:面对对西方部分先进芯片的受限获取,行业内出现了转向国产NPU与更激进量化方案的动向,以在有限的芯片资源下维持设备端推理性能——但具体到某一供应商或产品的技术路线,仍应以其官方公开信息为准,本文不对此做出未经证实的具体断言。对于在中国大陆开展的摄像头或无人机项目,系统集成商应单独核实民用航空、数据安全等相关领域的现行监管要求,而不是依赖境外的监管框架。
常见问题
为什么摄像头和无人机AI系统在设备端而非云端运行推理?
带宽和链路限制,而非隐私,是主要原因。一路持续的4K摄像头视频流,在其保留期内的传输和存储成本,高于在本地处理它的加速器成本;处于作业距离的无人机拥有间歇、有时受干扰的无线链路,无法承受对云端的依赖。
固定类别检测和开放词汇VLM搜索有什么区别?
固定类别检测器回答的是一帧画面是否包含一组预训练类别中的某一个(典型的COCO训练模型约有80个类别)。开放词汇VLM回答的是一个被描述的查询——例如"找到有人在装卸区附近放下一个包的片段"——针对的是固定类别检测器从未被训练识别为某个类别的内容。
视觉语言模型能否在功耗低于5W的摄像头加速器上实时运行?
无法以全帧率运行。VLM无法在低于5W的功耗预算内以每流每秒30帧的速度运行。实际做法是让轻量的固定类别检测器以低功耗持续运行,只有被它标记的片段才会传给VLM进行开放词汇描述——VLM在被触发的片段上运行,而非每一帧。
商用无人机使用哪种计算平台来实现机载AI?
基于Qualcomm QRB5165构建的ModalAI VOXL 2,是一个被广泛使用的参考平台。它兼容PX4,支持无GPS视觉惯性里程计导航,并把自驾仪、算力和导航传感器打包进一个约16克的模块中。
单台4K安防摄像头实际需要多少带宽?
这取决于帧率、场景复杂度和编解码器——请使用本页的带宽计算器,针对你具体的摄像头数量、分辨率、帧率和保留期估算持续带宽和存储成本,而不是依赖一个笼统的经验数字。
新的摄像头设计应该选择Hailo-10H还是Ambarella N系列?
两者瞄准的定位有所重叠但并不相同:Hailo-10H和Hailo-15专注于功耗低于5W的摄像头内置生成式AI推理,而Ambarella N系列(CES 2026发布)被定位为具备多传感器感知能力的8K边缘AI视觉SoC。正确的选择取决于目标分辨率、功耗预算,以及是否需要在同一颗芯片中完成多传感器融合。
无人机为什么需要无GPS导航,VOXL 2是如何处理的?
GPS信号可能被干扰、欺骗,或者在室内及受争议区域根本不可用。VOXL 2支持视觉惯性里程计(VIO),它融合摄像头和惯性传感器数据,在不依赖卫星定位的情况下估算位置和航向。
中国大陆的无人机巡检项目需要满足哪些监管要求?
这取决于具体运营场景和当地现行的民用航空及数据安全相关规定,系统集成商应直接核实相关主管部门的最新要求,而不是套用欧盟EASA等境外监管框架的分类标准,因为二者的适用范围并不相同。
需要边缘一体机,还是每台摄像头可以单独运行推理?
这取决于每个站点的摄像头数量。少量摄像头可以各自独立运行摄像头内置推理(Hailo-10H/15级别的芯片)。摄像头数量多的站点通常受益于一台集中聚合视频流的本地边缘一体机(NVIDIA Jetson Orin或Thor)——Jetson Thor单机最多支持32路MIPI CSI-2摄像头输入,这是其预期承担多摄像头角色的有力信号。
设备端VLM在视频分析方面目前还做不到什么?
截至2026年,有三项能力仍停留在云端级别或研究阶段:对数小时完整录像进行一次性推理的长时程理解、大规模跨摄像头对同一对象的再识别,以及需要覆盖完整一天录像(而非某个被标记的特定片段)上下文的开放词汇查询。
