当具身智能行业仍在“资本热、落地冷”的怪圈中徘徊时,一家成立仅四个月的中国初创公司索塔无界,以一份来自欧洲最大商超集团的战略合作协议,打破了商业落地的僵局。根据规划,双方将在未来三年内,于真实商超场景中部署超过一千台具身智能机器人。索塔无界并不制造硬件,而是专注于为机器人打造“原生物理大脑”,首次将4D世界动作模型部署于真实的货架之间,试图探索一条“场景收敛+通用泛化”的全新落地路径。
长期以来,具身智能领域面临一个尴尬的现状:融资额屡创新高,但机器人进入工厂仍困于“专机专用”的定制化模式,进入家庭做家务则停留在可望而不可及的远期蓝图。许多玩家沉迷于视频生成或仿真训练,这些被业内称为“虚拟温床”的技术路线,对具身操作能力的实质性提升十分有限。索塔无界创始人胡德波给出了截然不同的判断:“跨本体、跨场景的通用大脑路径过长,但让原生物理基模先沉入一类高复杂度场景,垂类跑通通用泛化,再反哺全场景——这是当下最可能走通的路径。”于是,索塔无界直接将实验室搬进了欧洲商超,在真实货架、真实商品、真实人流中训练机器人的“场景智商”。
支撑这一战略的技术底座,来自首席科学家刘哲博士领衔的模型团队。刘哲是华中科技大学博士,师从国家杰青、IEEE/IAPR双料会士白翔教授,并在香港大学完成博士后研究,师从国家优青、MIT TR35榜单入选者赵恒爽教授。他近十年持续深耕3D/4D感知、自动驾驶世界模型与具身智能,已发表顶级会议及期刊论文35余篇,Google Scholar引用超过2380次,代表工作包括多模态3D感知模型EPNet/EPNet++、鲁棒点云检测模型TANet及统一高效3D建模框架LION等。近期,他的团队聚焦4D世界模型与具身智能,推出了物理感知4D世界模型GenieDrive、统一感知—预测—规划的4D多模态模型DrivePI,以及实时流式VLA架构FASTER和通用World-Action Model架构Metis。依托与华为、长安、小米、理想、大晓机器人等头部产业伙伴的深度合作,团队沉淀出覆盖高维场景表征、可解释安全规划与物理一致评测闭环的World-Action技术底座,并在此基础上打造出原生4D物理世界基模,统一4D空间表征、物理约束、时空推理、安全评测与动作输出,端到端“理解并操作”物理世界。
数据是具身智能落地的另一大瓶颈。高质量物理操作数据极度稀缺,互联网数据、仿真数据、第三方开放数据集只能解决数据金字塔的多样性需求,无法支撑真实场景的可靠落地。索塔无界的解法是自研多指多模态UMI与空间感知EGO采集系统,并与欧洲商超客户合作,构建起“10万小时冷启动、百万小时年增量”的数据飞轮。这些真实场景数据将不断反哺模型迭代,形成“部署—采集—训练—再部署”的正向循环。此次合作的意义不仅在于千台机器人的规模,更在于它验证了一条不依赖虚拟仿真、直接面向物理世界的商业化路径。如果这一模式在欧洲商超跑通,将有望为全球具身智能行业提供可复制的范本,推动行业从实验室演示走向大规模商用。
