具身智能的落地瓶颈,往往不在模型参数规模,而在训练数据的质量与密度。近日,大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。该数据集基于全球首创的具身模型信息密度定律与以人为中心的环境式数据采集方案 2.0,依托环境式采集引擎 ACE 构建,包含 200 个任务类别、1700 万帧真实家庭场景视频,深度融入接触压力、犹豫恢复等开放行为变量,旨在为具身模型提供高质量训练底座,推动通用物理智能从实验室验证走向规模化产业落地。
ACE-Data-0 的核心突破在于对真实物理交互过程的高保真采集与多模态因果信号的精准标注。数据集包含 150 小时连续数据、50 名参与者在 2 个真实家庭场景中完成的 7.5 万个交互片段,覆盖原子级人—物交互、长时序家庭场景活动链及人与场景互动。数据同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体六自由度轨迹、多通道音频与触觉信号,并将全部模态对齐至同一时间线和空间坐标系,完整保留人类感知、行动、接触与环境变化的连续过程。这意味着,机器人不仅能“看见”动作,更能理解动作背后的物理因果链——接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的依赖关系。
从数据分级来看,ACE-Data-0 已迈入 L5 级标准。在具身模型信息密度定律下,L1-L2 级数据仅能支撑基础预训练,L3-L4 级数据止步于已知任务的拟合,而 L5 级数据则深度融入接触压力、自然出现的犹豫与恢复过程,以及真实家庭场景中的开放行为变量。通过桌面尺度与房间尺度两套互补采集系统,ACE-Data-0 将真实家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景,让日常生活中的真实交互直接成为机器人学习物理世界的数据来源。这种设计避免了传统数据采集中常见的“实验室理想化”问题——缺少自然遮挡、第一人称视角、音频和触觉信息,也突破了现有数据集多停留在数秒级单步动作的局限。
基于 ACE-Data-0,大晓机器人进一步构建了从底层信号、场景组成要素到具身交互理解的三级评测基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。这一评测体系不仅服务于模型训练,更为行业提供了衡量具身智能水平的可量化标准。ACE-Data-0 因此不只是一批家庭场景活动视频,更是一套面向模仿学习、世界模型、视觉—语言—动作模型(VLA)、机器人策略学习及人类示范向机器人迁移的具身数据基础设施。
此次开源的意义,在于为全球具身智能社区提供了一个高质量、高密度、多模态对齐的训练底座。过去几年,视觉语言模型、VLA 和世界模型快速发展,但机器人真正进入物理世界后,仍面临“从什么数据中学习人类行动能力”的基础问题。打开橱柜、倒水、叠衣服等日常行为,同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉和任务规划,普通视频难以准确呈现这些复杂交互。ACE-Data-0 通过连续记录感知、行动、接触和反馈的完整闭环,为通用物理智能走进真实世界提供了更完整、更可扩展的数据支撑,有望加速具身智能从“看见动作”迈向“理解物理过程”的关键跨越。
