触觉、视觉、动捕全同步!全屋场景下具身数据集的新高度

📅 2026/8/11 14:38:49
触觉、视觉、动捕全同步!全屋场景下具身数据集的新高度
第一人称视觉全身动捕手部精细操作物体6D位姿触觉音频全方位数据对齐——首款真实全屋全模态触觉同步具身数据集目录01 ACE双尺度同步采集引擎完整架构双场景硬件差异化布局毫秒级全局时序同步机制统一空间多设备标定02 ACE-Data-0数据集规模与任务分层设计全套自动化分层标注体系03 三层递进标准化评测基准第一层底层信号推理触觉预测赛道第二层场景组件重建人体全身位姿估计第三层人机交互手部分解第一/第三人称手部重建04 工程落地实际收益与固有局限05 写在最后当下绝大多数数据集往往只能捕捉单一视角或单一模态无法反映真实世界中视觉、运动、触觉、声音等多通道信息如何随人类目标协同演化要么只提供单视角视觉画面缺失触觉、人体动捕真值要么局限于桌面狭小实验室无法还原全屋长时序家务流程各传感器时钟不同步视觉触碰画面和压力信号对不上模型学不到真实物理因果。南洋理工大学与大晓机器人联合推出ACE采集引擎ACE-Data-0大型数据集首次把真实居家公寓改造为全域同步动捕采集空间同时覆盖桌面精细操作、全屋全身活动两大尺度集齐第一/第三人称影像、人体手部动捕、物体6D轨迹、音频、触觉五类对齐信号整套数据集150小时、75000条交互片段配套三层递进式标准化评测基准填补长时序、多模态、真实家居交互数据空白。01 ACE双尺度同步采集引擎完整架构ACE采集系统分为桌面精细采集、全屋房间采集两套可复用硬件配置共用统一时空标定、多传感器同步管线全部设备统一映射至全局世界坐标系所有数据流时序误差控制在毫秒级。双场景硬件差异化布局房间尺度配置整套200㎡完整居家空间包含厨房、客厅、卧室顶部桁架挂载12台OptiTrack动捕相机8台广角外视RGB相机覆盖全屋全部活动区域捕捉行走、搬物、跨房间长时序全身交互。桌面尺度配置小型操作台搭配16台近距离动捕相机、8台近距GoPro密集覆盖桌面毫米级手部操作专门解决餐具、小件工具精细抓取、拆装等近距离交互捕捉。两类场景统一配套采集硬件ACE头戴四目第一人称相机、Manus手部动捕手套、ACE触觉压力手套、多通道收音设备。▲ACE全套采集硬件参数统计表毫秒级全局时序同步机制不同相机、动捕、触觉设备拥有独立时钟轻微时间偏移就会出现“画面手已经握住物体触觉无压力读数”的因果错位问题。ACE以OptiTrack动捕系统全局时钟为基准完成全设备对齐外视相机通过屏幕动态QR时间码读取全局纳秒时间戳批量修正录制偏移头戴设备执行定点时钟对准流程录制前镜头对准计时屏幕完成单目校准同步传导至其余三路鱼眼镜头触觉手套依靠IMU运动模板与头戴设备时序匹配完成压力流与视觉流对齐。▲ACE数据采集、同步、标注全流程整套同步流程完成后所有模态单帧时间偏差小于4ms任意视频帧可精准匹配对应人体、手部、物体姿态与接触压力。统一空间多设备标定▲全模态同步时序样例图多相机无公共重叠视场是传统动捕标定最大难点ACE采用带反光标记点的ArUco标定板作为通用中介动捕红外相机识别标记三维坐标RGB相机识别棋盘图案一次性将所有外视、头戴、动捕设备绑定至同一世界坐标系单台相机重投影误差控制在3像素内。头戴设备通过手眼标定求解相机与头部动捕刚体变换每一帧头显6DoF位姿可直接解算全程无漂移。02 ACE-Data-0数据集规模与任务分层设计依托ACE采集引擎产出ACE-Data-0完整数据集全部任务仅给参与者目标级指令不规定分步动作保留犹豫、绕行、物品替换等自然人类行为规避脚本化僵硬交互。数据集分为三类交互任务原子手部交互Atomic HOI单次短时间单一操作倒水、收纳、切菜等基础动作总计620万帧长链式家务交互Chain HOI数十分钟连贯多步骤家务做饭、全屋整理等跨子任务流程730万帧人-场景交互HSI无小件操作坐卧、走动、拉伸等全身环境交互350万帧。▲ACE数据集任务分类与数据占比统计图整套数据集覆盖50名受试者、50类交互物体、200种任务大类75000条独立交互片段。▲ACE-Data-0与主流同类数据集横向对比表表格指标客观区分各家数据集模态完整度绝大多数数据集缺少触觉、完整第一视角、长时序任务ACE是唯一同时集齐五类同步数据流的居家场景数据集。但指标仅代表采集硬件配置不代表模型训练效果数据集规模大不代表泛化能力更强真实机器人仿真迁移仍受人类与本体形态差异约束。全套自动化分层标注体系ACE绝大多数标注无需人工手绘由动捕测量数据直接导出大幅降低标注成本物体标注每件物品3D扫描网格逐帧6DoF轨迹、2D/3D包围盒、运动轨迹▲物体多视角标注样例图人体标注41关节全身SMPL-X网格、每帧投影至所有相机画面▲人体姿态标注样例图手部标注MANO精细手指关节、双手逐帧三维轨迹▲手部姿态标注样例图触觉标注全手掌压力热力图、左右手握持时序标签▲全手掌压力热力图、左右手握持时序标签音频文本标注多通道环境音Gemini生成同步分段自然语言任务描述▲音频与文本对齐标注样例图所有标注与视频时序严格绑定任意时间戳可一键调取对应视觉、运动、接触、文本信息省去跨模态匹配二次开发成本。03 三层递进标准化评测基准研究基于数据集搭建分层评测赛道模拟机器人从感知到交互的完整能力链路三层难度逐级提升同时测试30余款主流SOTA方法暴露现有模型普遍存在的遮挡、长时序漂移缺陷。第一层底层信号推理触觉预测赛道任务仅输入图像预测同步手掌压力分布指标包含时序准确率、接触交并比CoP压力中心误差。主流TouchAnything方法综合表现最优但遮挡场景IoU依旧偏低。该任务核心价值验证视觉能否反推物理接触解决机器人无触觉硬件时的感知补充需求。指标局限仅桌面近距离有效远距离全身交互无接触预测参考意义。▲触觉预测定量结果对比表第二层场景组件重建人体全身位姿估计分为单目第三人称、单目第一人称、多视角三类测试条件采用MPJPE、全局轨迹WA-MPJPE作为评价指标。实验结果清晰体现两类差距多视角观测精度显著优于头戴第一视角第一人称因身体大面积出画面全局轨迹漂移严重是现有人体重建算法核心痛点。▲多视角/自视人体重建误差对照表第三层人机交互手部分解第一/第三人称手部重建分别从两种视角预测MANO手部关节PA-MPJPE、轨迹误差为核心评判标准。第三人称固定相机视野稳定手部重建误差低至9.1mm第一人称受镜头畸变、手部频繁出框影响全局轨迹误差接近100mm。跨视角对比证明单一相机无法兼顾全身与精细手部感知多模态融合是优化关键。▲第一/第三人称手部重建定量表现有SOTA模型在遮挡、长时序、自运动模糊场景误差爆发即便在ACE高真值标注数据集上真实居家环境下交互重建仍存在巨大性能缺口数据集明确指出未来感知模型优化方向。04 工程落地实际收益与固有局限整套采集方案与数据集产业价值清晰无需自建动捕实验室可直接复用ACE分层数据配比先用海量低成本第一人称视频做预训练搭配少量同步动捕片段微调手部、物体感知统一标注格式降低算法迭代试错成本触觉、长时序家务数据填补现有训练素材空白人形机器人、家用服务机器人研发可大幅缩减真机采集开销三层基准可作为内部算法迭代统一评测标准横向对比自研模型与开源方案。同时存在不可忽视的短板整套采集硬件门槛高中小企业难以复刻采集环境数据仅采集人类交互无机器人本体演示样本人机本体域差仍需额外仿真数据弥补未集成动态物体、大量移动物体标注复杂室内动态场景适配性有限所有评测基于静态家居序列真实持续动态环境下模型性能会出现明显衰减。05 写在最后ACE采集引擎与ACE-Data-0解决了长期以来具身AI数据模态割裂、场景失真、时序错位三大核心行业难题首次把完整全屋居家生活转化为可量化、同步化、全维度多感官训练素材。区别于只堆视频的通用数据集它以动捕、触觉、音频作为物理监督锚点建立起“视觉-运动-接触-声音”完整感知动作闭环三层分层基准也给领域提供统一的模型验证规范。▲房间尺度场景中标定完成的相机布局示意图该数据集不会完全替代仿真、机器人自采集数据但补齐了人类自然长时序交互这块核心数据短板为VLA、触觉感知、4D重建、人形模仿学习提供高质量训练与评测底座后续多模态融合、跨本体迁移、接触推理类研究均可依托该数据集开展完整对照实验。Ref论文标题ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine