8月6日,Om AI联汇宣布完成数亿元融资。同一天,该公司旗下全球首款端侧原生模型VLX-Seek 1.5正式开源。这是具身智能圈少见的「融资+开源」同天发布——资本在下注一种新路线,开发者正在获得一个新入口。
全球物理AI图谱:NVIDIA Cosmos押注「云端世界模型」,Physical Intelligence探索「云端通用机器人策略」,Tesla Optimus走「模型+本体闭环」路线,而Om AI联汇填补了一个关键空白——让AI从诞生之初就为端侧而生。这不只是部署方式的不同,而是两种截然不同的技术哲学:前者问「如何让强大AI跑在设备上」,后者问「如果AI生来就在设备上,它应该长成什么样」。

一、流式多模态:以小搏大的技术支点
传统视觉语言模型的工作流程是「摄像头拍照→上传云端→等待推理→返回结果」,这是典型的批处理模式,英伟达、Google等巨头走的都是这条路。延迟高、带宽依赖大、隐私不可控,且把物理世界的连续感知切割成一帧帧静态快照。
VLX-Seek的流式多模态架构完全不同:接收视频流持续输入,在端侧实时理解,动态输出决策。三层心智链路构成完整闭环——Flow(持续注意力)让模型从「看不见」到「看得清」;Seek(精细推理)从「看不准」到「看得准」;Go(执行控制)从「动不了」到「自主行动」。
这一架构使3B参数版本在无人机定位任务中F1指标达到73.2,超越同规模竞品达40%;在复杂长尾目标识别中LVIS Mean指标达57.5,提升13.4%。从「拍照识别」到「视频流理解」的范式变化,验证了同参数级别能赢大厂的关键——不在参数,而在架构。
二、端侧原生:物理AI大规模落地的必经之路
工厂机器人需要全天候工作,巡检无人机在无网络环境执行任务,家庭机器人需要保护用户隐私。这些场景决定了物理AI不能永远依赖云端大脑。业内过去的解决方案是「迁移式部署」——先训练大模型,再通过压缩、蒸馏、量化适配端侧,模型仍离不开云端,只是努力让自己「变轻」。
Om AI联汇彻底打破了这个限制:VLX从模型架构层就把延迟、功耗、算力、部署成本作为设计前提,而非优化目标。模型不是被迫「减肥」的大模型,而是一个天生适合端侧环境的AI。这也解释了为什么3B参数能在无人机、具身设备等场景中超越10B+的大模型——端侧原生带来的价值是直接的:更快响应、更低成本、更强自主性。
三、开源生态与未来方向
Om AI联汇已将VLX-Seek 1.5-10B版本的推理代码与模型权重在GitHub(github.com/om-ai-lab/VLX-Seek)和Hugging Face(huggingface.co/omlab/VLX-Seek-1.5-10B)全面开源,并规划推出0.6B、3B、10B三个参数规模,用户可根据算力预算灵活选择。
在全球物理AI竞争版图中,端侧原生正在成为一个新的关键方向。Om AI联汇率先填补了图谱上的这个缺口,用VLX给出了答案。随着具身智能从实验室走向工厂、家庭、无人机巡检等真实场景,谁能解决「端侧原生」问题,谁就掌握了物理AI大规模落地的钥匙。


