具身感知赛道融资纪录背后,触觉与数据闭环成核心壁垒

📅 2026/8/27 2:39:49
具身感知赛道融资纪录背后,触觉与数据闭环成核心壁垒
“帕西尼再融 10 亿元具身感知赛道跑出 35 亿元融资纪录。”看到这个标题时我第一反应不是“又一个大额融资”而是一个更技术化的画面机器人手部的指尖压住一块豆腐触觉阵列在不断回传压力分布控制回路在几十毫秒内决定要不要再收紧一点。具身感知要解决的事情就是让机器人在真实环境里“看得清也摸得准、拿得稳”。这轮融资本身并不能直接证明某家公司的技术已经领先但它传递了一个更值得注意的信号具身感知正在从科研表述变成产业级赛道。真正决定谁能跑出来的不是融资纪录本身而是感知硬件、数据闭环、算法模型与机器人本体之间的耦合能力。这个耦合能力恰恰是过去几年最容易被融资热度掩盖的工程难题。1. 35 亿融资纪录背后是“指尖发力”阶段的真实需求1.1 从“认出物体”到“握住物体”差的是一个感知闭环过去几年机器人视觉已经解决了大量“认出物体”的问题。检测网络、分割模型、位姿估计算法可以在静态图像上实现不错的精度。但真实任务通常不会在“看到”这一步结束。抓一个杯子要先判断杯柄位置碰到杯壁时要感知到接触点抓力太小会滑落太大可能直接捏碎。整个任务是一个“感知-决策-执行-再感知”的循环而不是一次单向识别。具身感知强调的正是这个循环里视觉之外的信息模态。触觉、力觉、本体感在过去要么被工程团队有意忽略要么因为没有可量产的低成本传感器而难以获取。现在传感器硬件成本下降算法模型也具备了多模态处理能力这些数据终于有机会进入产品化阶段。从公开标题的表述来看帕西尼本轮再融 10 亿元同一赛道也跑出了 35 亿元的累计融资纪录。我不确定在更完整的口径下这个数字究竟指具体企业还是指整个赛道的融资总量但一个方向可以确认具身感知赛道的资本密集度已经超过了“纯科研培育”阶段进入了真金白银的产业竞争期。1.2 融资热潮的底层技术动因数据与传感器决定机器人上限资本向来不是盲目起风。这一轮集中关注具身感知背后其实有几个技术节点同时发生了变化。第一个是触觉与力觉传感器从“定制件”走向“准标准件”。高分辨率触觉阵列的通道数越来越高价格虽然依然偏高但已经比实验室定制时代便宜一个量级。低成本的关节力矩传感器也开始进入协作机器人产品线。这为多模态感知提供了硬件基础。第二个是模型带来的感知泛化能力。视觉模型、语言模型、多模态模型让机器人可以理解更复杂的场景语义也让感知从“识别物体”延伸到“理解任务当前状态”。但这种泛化能力必须依赖高质量、真实世界数据来完成对齐而不是只靠互联网图片就能解决。第三个是数据采集方式的成熟。遥操作、仿真生成、自动采集几种方式逐渐组合成一套可执行的数据供应链路。具身感知需要建立的数据闭环比单纯的视觉数据更难获取也更难被复制。所以这轮融资本质上是在为“数据入口”和“物理交互入口”投票。谁拥有更稳定的触觉、力觉数据采集能力谁就有机会在后续模型迭代中跑得更快。这也是我把融资纪录当作技术信号而非财务新闻来读的原因。2. 具身感知到底感知什么一张技术认知地图2.1 视觉之外的四个关键维度具身感知不是某个单一传感器而是一组异构数据的融合。我习惯把整个感知体系拆成视觉、触觉、力觉与本体感四个维度来理解。视觉解决“目标在哪里、位姿如何”。它依赖 RGB-D 相机、工业相机和深度估计模型。挑战主要来自光照变化、遮挡、反光与透明物体。触觉解决“碰没碰到、压力分布如何、有没有滑动”。它依赖阵列式压力传感器、光学式触觉传感器等。触觉数据频率通常远高于视觉很多时候能提供视觉看不到的信息比如接触面的微小形变和滑动趋势。力觉解决“用了多大力、外力来自哪个方向”。常见实现是六维力传感器和关节力矩传感器。在装配、打磨、插拔这类对接触力敏感的任务里力控精度直接决定良率。本体感解决“我的关节现在在哪里、速度是多少”。它来自编码器、IMU 和关节控制器的状态反馈既为控制回路提供基础也是判断环境发生异常的重要信号。感知维度关键问题典型传感器主要难点视觉目标在哪里、位姿如何RGB-D 相机、工业相机光照、遮挡、反光触觉接触状态、压力分布、滑动触觉阵列、光学触觉传感器数据频率高、耐用性、布线力觉用力大小、外力方向六维力传感器、关节力矩传感器标定、温漂、成本本体感关节位置、姿态、速度编码器、IMU噪声、漂移、时间同步这四个维度叠加起来才能让机器人在接触之前、接触瞬间和接触之后都有完整的状态认知。单独依赖任何一维都很难应对真实任务的波动。2.2 多模态融合的难点不在模型而在时间同步与标定很多项目把视觉与触觉数据灌进同一个神经网络就认为自己完成了多模态融合。真正落地时最先出问题的往往是硬件层而不是模型层。时间同步是一个典型例子。相机通常 30 到 60 帧每秒触觉传感器可以达到几百甚至上千赫兹。两路数据如果缺少统一时间戳模型每次看到的是“错位的视觉位置”和“迟到的触觉接触点”结果可能反而不如单模态。实际工程里需要在传感器驱动层打上统一时间戳在系统层面做同步触发而不是等到模型输入时才凑数。空间标定是另一个例子。触觉传感器的坐标系要转换到机械臂基座坐标系视觉相机要做手眼标定。标定误差超过几毫米后续抓取动作就会失真。更何况触觉传感器本身有柔性表面刚性变换模型并不完全适用。这类问题没有捷径只能靠标准标定流程加反复验证。所以我的判断是多模态感知的技术含量一半在算法另一半在“把传感器装到同一台机器人上并让它们正常协同”。后者更琐碎也更容易被低估。融资可以买到先进传感器但买不到稳定的时间同步和多年积累的标定经验。3. 从感知到动作真正难的是数据闭环3.1 机器人需要属于自己的物理数据库具身感知不是离线识别图片而是让机器人在物理世界里做决策。感知结果要能转成动作动作结果又要能反馈到感知模型这个回路就是数据闭环。一个常见误区是先把感知模型调到精准再接控制。但真实系统里控制器会改变观测角度和接触状态导致部署时模型漂移。视觉模型在训练数据里看到的物体来自固定视角机械臂靠近时视角会快速变化模型表现随之下降。因此数据闭环要从一开始就建立而不是等单模块都完美后再拼接。下面是一个最小感知闭环的数据流示例结构循环: 视觉采集 - 目标位姿估计 触觉采集 - 接触状态与压力分布 力矩采集 - 外部力与刚度估计 多模态数据对齐 - 动作指令生成 执行动作 - 更新机器人状态 若检测到滑动、碰撞或误抓 - 触发异常恢复 记录样本与标签 - 进入在线/离线数据池这个结构看起来简单但每个环节都可能成为断点。数据对齐、异常恢复、样本标签都是决定闭环能否长期跑下去的关键。3.2 三种数据来源之间的取舍与组合要训练这样的闭环数据从哪里来真实遥操作是目前质量最高、成本也最高的方式。操作员使用主手或动捕设备远程控制机器人完成任务同时记录视觉、触觉、力觉与关节轨迹。优点是数据高度接近真实物理缺点是效率低复杂动作需要反复录制。仿真合成正好相反。物理引擎与渲染器可以生成大量数据成本低、可自动化。但现实世界与仿真环境之间存在看不见的差异尤其是接触物理与触觉仿真。视觉仿真已经相对成熟触觉和形变仿真仍然很难做到让人放心。真实场景自动采集是中间路线。机器人先按预设策略尝试任务再自动记录成功和失败数据。它的自动化程度高但数据质量参差不齐需要建立筛选与标注流程。换句话说它不是在采集后会自然成为训练数据而是需要经过一层“数据治理”。没有哪一种是银弹。常见做法是混合使用用仿真做大规模预训练用真实遥操作精修关键任务再用自动采集持续补充长尾场景。对具身感知团队来说这条管线本身就是一个壁垒。3.3 Sim-to-Real 是最隐蔽的坑触觉比视觉更难迁移仿真与真实之间的差距是具身感知落地时最隐蔽的坑之一。视觉域差可以通过随机化缓解但触觉和力觉很难仿真得足够真实。物体材质、表面摩擦力、接触形变这些参数在物理引擎里建模精度有限越到细节越容易失真。实际操作中常见现象是仿真抓取成功率很高真机一跑就明显下滑。原因不在控制算法而是仿真里的接触数据与真实传感器数据分布相差太大。针对这个问题我更建议部署后引入“在线数据回流”让模型在真实环境里继续用小样本微调而不是指望仿真器一步到位。这也是整个行业把大量资源投到真实数据采集上的原因。数据闭环不能停留在概念里它必须变成一条每天运转的工程管线。数字融资纪录可以一夜之间刷高但物理数据库只能一次次真实交互慢慢积累。4. 融资能解决一部分问题落地还要补三块拼图4.1 可靠性从“演示成功”走向“连续重复”融资是弹药但它不直接解决“连续运行一千次只允许失败三次”这样的可靠性问题。具身感知产品要进入工厂或服务场景必须回答三个问题重复性如何、稳定性如何、失败后能不能恢复。实验室里的一次演示成功说服力有限。真实场景中同一个动作要面对不同的来料角度、环境光、物体形状波动。系统至少要有能力统计成功率、定位失败原因、设计恢复策略。不具备异常恢复能力的系统偶发一次误抓就可能卡死整条产线。另一个容易被忽略的问题是“感知退化”。触觉传感器用久了会磨损相机镜头会脏污力传感器会产生温漂。系统如果感知不到自己正在退化就会在故障边界附近持续运行。提前建立状态监测指标比出了大问题再维护更划算。这也是为什么我会格外看重团队有没有持续积累运行日志和故障记录而不是只看演示视频。4.2 成本、体积与功耗感知方案必须过产品关很多先进传感器在实验室里表现很好要变成产品时却要面对三座大山。成本是第一位。一台高精度六维力传感器可能比一个入门级协作机械臂末端模块还贵。如果团队做的是消费或准工业产品感知成本必须压缩到合理范围。体积与布线排第二。高通道数触觉阵列意味着几十上百根信号线要装进小巧的夹爪或灵巧手里机械设计与电子设计必须一起优化。功耗与发热排第三。多模态感知需要额外的计算平台发热和耗电会直接影响机器人续航与结构散热。因此评估感知方案不能只看“识别精度”还要同时关心它为机械结构、控制系统和产品成本留了多少余地。感知与本体是一体的不是两个独立模块的简单叠加。融资充裕可以缓解成本压力但不能解决所有工程约束。4.3 场景边界是双刃剑先做深再做宽具身感知有很强的场景属性。电商仓里的无序抓取与 3C 产线上的精密装配虽然都叫“抓取”但传感器选型、算法结构和末端设计完全不同。早期团队最好先围绕一个垂直场景打深形成有效的数据壁垒。反过来想同时覆盖太多场景常常会把每个场景都停在 demo 阶段。定义场景边界也要想清楚“可复制的边界”在哪里。比如第一版模型只做 50 种标准尺寸的螺丝第二版扩展到 200 种相近零件再到更开放的物料集合。边界越清晰数据采集和真机验证就越可控融资带来的资源也越容易形成复利。这里要提醒一句场景边界不是限制想象力而是避免资源过度分散。具身感知产品的核心竞争力正是在有限场景里形成别人难以复制的“感知-数据-动作”飞轮然后才谈得上扩展。4.4 部署不稳定时先按这条链路排查作为工程建议如果你在真实部署中遇到抓取不稳、感知漏判或动作抖动我一般按下面顺序排查。看现象是识别不到目标、抓取后滑脱还是接触力过大导致物体损伤看输入视觉图像是否清晰触觉数据有没有缺通道各路数据的时间戳是否对齐。看环境光照、物体材质、机械臂安装刚度、线缆干扰、地面震动。看参数力控阈值、抓取速度、接触检测延时、异常恢复触发条件。看工具边界传感器的量程、频率、精度与任务要求是否匹配。这个顺序看起来简单但能避免很多“盲目调参”的浪费。大多数不稳定问题根源早于大模型在输入数据和硬件协同阶段就已经决定了。先确认底层链路正常再谈算法优化才是更省时间的路径。5. 给技术人和评估者的几条实战建议5.1 评估一家具身感知公司先看这五个问题面对一笔大额融资技术人容易走两个极端要么觉得风口来了赶紧上车要么觉得资本过热不值得关注。我更建议大家把注意力放回技术工程本身。问题观察点更值得关注的信号有没有真实数据闭环模型是不是只用一次数据集训练完就结束有数据回流机制模型持续更新感知硬件能否快速迭代传感器是自研还是外购迭代周期多长有自研传感器或与硬件团队深度耦合在什么场景验证demo 是固定环境演示还是多地部署有连续运行记录和失败数据多模态融合发生在哪一层是在底层信号对齐还是上层特征拼接有时间同步、空间标定方案团队有没有系统集成能力能否解决机器人本体、控制器、通信问题有完整机器人工程背景的团队这五个问题不能替代商业尽调但可以帮技术人快速建立第一印象。如果一家公司只在 PPT 里讲“多模态大模型”却说不清触觉数据来自哪台传感器、标定误差是多少、失败样本如何回流那融资数字只能说明资本看好方向还不能证明方案已经跑通。5.2 自己动手从最小感知闭环开始如果你是开发者想切入这个方向我的建议是不要一开始就搭“视觉触觉力觉大模型”的全栈系统。从最小感知闭环开始反而更快。一个可执行的起点是用一个带力觉或触觉反馈的末端在固定工位完成最简单的任务。比如何把插头插入插座或者按设定力度拿住一块豆腐。任务虽小但会逼你处理接触检测、力控阈值、异常恢复这些真实工程问题。跑通之后再逐步增加视觉、扩大物体