当行业还在争论大模型参数规模是否越大越好时,一家名为Om AI的初创公司给出了不同的答案。该公司近日正式发布端侧原生视觉语言模型VLX,以仅3B(30亿)参数的小体量,在物理世界感知任务上实现了对英伟达和谷歌同类产品的性能超越。这一成果意味着,在通往“万物智能”的道路上,轻量级、高效率的端侧架构正成为新的竞争焦点。
从技术路径来看,VLX模型的核心突破在于“端侧原生”的设计理念。与许多先做大模型再通过蒸馏、剪枝等方式压缩到边缘设备的“降维”思路不同,VLX从架构设计之初就针对移动终端和边缘设备的算力、内存与功耗约束进行优化。在物体识别、空间理解、场景解析等物理世界感知任务中,该模型展现出极高的精度,尤其是在实时性要求严苛的场景下,其推理速度与能效比显著优于云端依赖型方案。这种“生于端、用于端”的架构选择,让模型无需联网即可完成复杂视觉理解,从根本上解决了延迟、隐私和带宽三大痛点。
这一成果的意义不仅限于技术指标的领先。从产业演进的角度看,Om AI的选择呼应了计算范式从“云计算”到“云原生”再到“端原生”的深层跃迁。正如产业真正的跃迁从来不是简单堆砌算力,而是找到更适合新世界的架构,VLX模型证明了小参数模型在特定领域同样可以具备强大的泛化能力。对于智能手机、智能家居、工业视觉、机器人等依赖实时感知的终端设备而言,3B参数级别的模型意味着可以在不牺牲性能的前提下,将AI能力嵌入到更广泛的硬件生态中,从而大幅降低部署门槛和运营成本。
当然,VLX模型的发布也引发了对行业格局的重新审视。英伟达和谷歌长期占据AI基础设施的制高点,其视觉模型往往依托强大的云端算力与庞大的训练数据。Om AI以3B参数实现反超,一方面展示了算法架构创新对算力依赖的替代潜力,另一方面也提醒巨头们,端侧AI市场的竞争逻辑正在发生变化。未来,随着更多应用场景从云端向边缘迁移,谁能提供更高效、更安全的端侧智能方案,谁就有可能在下一轮AI普及浪潮中占据先机。Om AI的这一步,或许正是那个撬动格局变化的支点。
