宇树科技科创板IPO初步询价,预估发行市值超400亿。智平方赴港在即,估值突破200亿。据Crunchbase统计,2026年上半年全球机器人领域融资达188亿美元,已超过2025年全年总额,其中中国市场占比超43%。平均每天有超过5亿元流向这个赛道。

本文来源于广告门 adquan.com
英伟达的LocateAnything系列、Google的Gemini、OpenAI的GPT-4o,这些模型一个比一个大,一个比一个强。把模型做更大,喂更多数据,期待能力涌现。这条路径在语言模型上被验证了,但在物理世界遇到了一堵墙。
物理世界的决策窗口以毫秒计。一架无人机在追捕嫌疑人,目标闪了0.3秒就消失在楼宇之间——这个时间窗口里,把画面传到云端、调千亿参数模型做识别、再把结果传回来?差得远,光网络延迟就吃掉一半。
机器人要动、摄像头要看、机器狗要跑。这些场景要的不仅是更聪明的模型,而是能在终端上实时跑的模型。但问题在于,把云端大模型压缩后塞进终端,就像给高个子做的衣服裁剪后给小个子穿——尺码对了,版型不对。
云原生从架构层面重新定义了计算资源的组织方式——容器、微服务、弹性伸缩,每一层都是为"云上生存"重新设计的。端侧原生也是同一层级的概念:从模型架构、数据流、推理范式开始,为物理世界重新设计一套AI基础设施。
VLX-Seek 1.5的3B参数版本,在多项核心指标上正面超越英伟达LocateAnything-3B。同参数,正面比较:COCO F1@0.5,75.3 vs 70.1;LVIS F1@0.5,73.6 vs 62.3;无人机极端场景准确率提升62.9%,误报率降低74.8%。

VLX模型系列是Om AI联汇自主研发的端侧原生架构的流式多模态模型——不是在云端大模型上打补丁,而是从物理世界的需求出发,定义AI模型应该怎么感知、怎么思考、怎么决策。
英伟达LocateAnything处理这类场景的方式是:接收一整张图,处理后返回结果,每次推理都是独立的任务。一帧一帧独立处理,30帧就是30次独立的"一问一答"。
想象一个场景:无人机在楼宇间追踪目标,目标突然被遮挡。批处理模型每帧都独立判断——第1帧"看到了",第2帧"没看到",第3帧"没看到"——三次判断,两次"没有",按多数投票就是"目标消失了"。但流式模型会记住"0.1秒前目标还在",在遮挡期间保持追踪状态,等目标重新出现时无缝衔接。
第一个是"怎么定位目标"。传统VLM的定位方式,是让模型像背圆周率一样逐字生成坐标数字"[0.234, 0.567, 0.289, 0.612]"。十个目标念十串数字,少一个括号解析代码就崩了。VLX-Seek 1.5把定位重构为"区域指代"——视觉区域被表示为可寻址实体,模型通过选择和引用区域来回答问题。就像人指东西不说"东经121.47北纬31.23",只说"喏,在那儿"。

第二个是模型能不能承认"我不知道"。传统模型被训练成每次都要输出结果,画面里没有目标,它也倾向于编一个答案。VLX模型把"不确定"设计成显式输出选项——没有就是没有,直接告诉你。VLX-Seek 1.5的误报率仅为LocateAnything-3B的四分之一。
流式多模态、区域指代、原生拒识——这三件事不是独立功能的简单叠加,而是端侧原生架构下的一体设计:从模型怎么"看"、怎么"说"、怎么"判断"三个层面,重新定义了物理世界的AI模型应该是什么样的。
这个问题在当下的具身智能行业尤其尖锐。据中国证券报报道,2026年上半年国内具身智能赛道融资总额已超900亿元,但大多数公司的商业化仍停留在产线试点阶段。"融钱期"和"变现期"之间的裂缝,正在吞噬一批只有技术没有收入的公司。
无人机智飞大脑OttoPlex御行是一个巴掌大小的盒子,搭配任何普通无人机,就能让它从遥控工具变成自主智能体。公安警情联动场景中,监控发现可疑目标,无人机30秒内自动升空,自主规划航线、识别跟踪,全程无需飞手。海事巡逻中,多架无人机沿标准路线协同巡查,发现可疑船只自动抵近确认。

融资到位的根本原因,不是技术故事讲得多好。投资人看到的是已经跑通的变现路径和真实用户数据。Homer AI的10万用户和千万次月调用,是端侧原生范式从理论走向商业的最有力证据。
最直接的好处是降低门槛、扩大生态。越多开发者基于VLX-Seek 1.5做应用,端侧原生范式就越有机会从"一家公司的技术路线"走向行业共识。当然,开源模型不等于范式就能自动成为事实标准——Kubernetes之所以成为标准,不只是因为开源,更因为大量上下游厂商共同参与,形成了难以替代的生态网络。端侧原生要走通同样的路,需要的不仅是一个开源模型,还有时间、场景和足够多的共建者。
宇树IPO询价、智平方赴港,具身智能赛道资本化全面提速。但一个值得注意的分化是:宇树和智平方的估值逻辑建立在出货量上,市场看中的是"卖硬件的闭环";而在部分投资人看来,Om AI联汇的估值逻辑,押注在架构范式的不可替代性上。
硬件成本持续下降、端侧算力快速提升、场景需求集中爆发——这几个变量同时到位了。巨头们还在云端卷参数,千亿模型一个接一个发,参数记录一个月一破。但端侧模型已经在收用户了——10万视障用户、千万次月调用、公安海事场景常态化部署。
2026年下半年,端侧AI赛道大概率会从"技术比拼"逐步切换到"收入验证"。有商业闭环的公司可能率先跑出来,而那些只有技术故事、没有收入支撑的公司,恐怕会迎来更严峻的考验。
云原生重新定义了计算资源的组织方式,催生了万亿级云计算市场。端侧原生正在重新定义AI与物理世界的交互架构——当模型不再是"部署在终端的外来大脑",而是"生长在终端的感知神经系统",物理AI的规模化落地才有了真正的地基。
Om AI联汇是这一范式的最早倡议和实践者,但不一定是唯一赢家。范式定义的价值在于开创赛道,不在于垄断赛道。真正决定胜负的,是谁能率先在范式之上建起不可替代的商业闭环。
云原生时代,没有人记得第一个提出"容器"概念的人是谁,但所有人都运行在Docker和Kubernetes之上。端侧原生的故事可能也会这样——多年以后,人们回头看2026年这个夏天,可能记不清是哪家公司最先开源了一个3B参数的感知模型。但当无人机在追捕中不再需要飞手、视障人群靠一块胸牌走遍城市、机器人终于敢在真实世界里说"我不知道"——所有人都会意识到,有一套新的架构范式,已经悄悄接管了物理世界和AI之间的那道接口。