机器人的“触觉觉醒“:AI模型在不忘记视觉的前提下学会感受材质

📅 2026/7/21 5:02:05
机器人的“触觉觉醒“:AI模型在不忘记视觉的前提下学会感受材质
这项由韩国梨花女子大学人工智能与软件学院主导的研究于2026年7月以预印本形式发布论文编号为arXiv:2607.00302v1发表于计算机视觉领域cs.CV。有兴趣深入研究的读者可通过该编号查询完整论文。当你闭着眼睛用手指摸一块布料时你能轻松判断它是丝滑的缎子还是粗糙的麻布是柔软的棉花还是坚硬的皮革。这种能力对人类来说似乎微不足道却是精密机器人操作中长期缺失的关键环节。工业机器人能看见物体却很难感觉它——当它们试图抓取一个易碎的鸡蛋或拧开一个紧密的瓶盖时仅凭摄像头传来的视觉信息很难判断该施加多大的力该如何调整握持方式。触觉就是那块让机器人从看图猜测升级为真实感知的关键拼图。梨花女子大学的研究团队正是瞄准了这个痛点提出了一套名为**Splash**Mask-isolated tactile alignment learning即掩码隔离触觉对齐学习的全新框架。这套方案的核心野心在于让一个本来只懂得处理图像和文字的紧凑型AI模型在不丢失原有视觉理解能力的前提下额外学会处理触觉信息。这听起来像是一道鱼和熊掌不可兼得的难题而研究团队给出了一个颇为精妙的解题思路。一、触觉信息的载体光学触觉传感器与AI模型的感知鸿沟要理解这项研究首先得知道机器人是如何感受触觉的。现代机器人并不是真的长了皮肤而是依赖一种叫做光学触觉传感器比如DIGIT传感器的装置。这类传感器的工作原理颇为有趣——它的表面覆盖着一层柔软的硅胶当硅胶接触到物体表面时接触面的形变会被内置摄像头拍摄成图像这张图像就是触觉接触图contact image。通俗地说这就好比在你的指尖贴了一层透明果冻当果冻被按压时变形的纹路被拍照记录下来照片里呈现出彩虹般光泽的图案——这就是机器人的触感照片。研究团队面对的核心挑战是现有的多模态大型语言模型Multimodal Large Language Models简称MLLMs——也就是那种既能理解图片又能理解文字的AI——普遍依赖参数量庞大的骨干模型比如拥有70亿参数的LLaMA-7B。这类大模型虽然推理能力强但对于需要实时运算、计算资源受限的边缘机器人而言根本不实用。研究团队因此将目标锁定在参数量不超过30亿的小型多模态语言模型sMLLMs比如Qwen2.5-VL-3B和InternVL2.5-1B。然而这类小模型有个致命弱点它们的参数预算本就捉襟见肘当你试图向它们灌输触觉这种全新感知模态时它们往往会产生所谓的灾难性遗忘catastrophic forgetting——也就是说模型在学会识别触觉信息的同时把之前辛苦学来的视觉理解能力忘得七七八八了。研究团队在论文中提供了一个直观的例子原本能准确描述一个人手持金属罐的Qwen2.5-VL-3B模型在经过触觉训练后开始臆造出橡皮筋被压在罐子顶部这类根本不存在的细节视觉理解评分从9分骤降至5分。这就好比一个原本擅长绘画的学生在学了几节雕塑课之后突然连透视关系都画不准了——新技能的习得以旧技能的崩塌为代价这显然是不可接受的。二、参数空间的地权划分找出大脑里的休眠区域Splash的核心思路可以用城市规划来理解。一座城市的土地资源有限新建一个工厂不能随意占用已有的住宅区而是应该找到那些尚未充分开发的空地来建设。Splash对AI模型参数空间所做的事情本质上就是这样一次土地普查——找出哪些参数是这座城市不可动的核心地标比如市政厅、医院哪些是尚未开发的荒地然后把所有新建设都安排在荒地上绝不碰核心地标。具体来说研究团队受到了一种名为Wanda的语言模型剪枝方法的启发设计了一种视觉相对重要性评分机制。他们从一个视觉-语言校准数据集比如CC12M数据集中随机抽取的128个样本出发对模型内部所有线性层中的每一个参数打分。这个分数的计算方式很直接将该参数的权重绝对值乘以与之对应的输入激活值的L2范数可以理解为这个参数有多重要以及与它相连的信息通道有多活跃的综合度量。得分高的参数被标记为关键参数——它们是维持模型原有视觉语言能力的支柱必须冻结保护。得分低的参数则被标记为休眠参数——它们在处理视觉语言任务时贡献微薄可以被唤醒并重新用于学习触觉信息。研究团队将这种划分的程度称为稀疏率sparsity ratio。当稀疏率设为60%时意味着60%的参数被判定为休眠参数可以在触觉训练中更新而剩余40%的关键参数则被完全冻结。值得一提的是研究团队还额外保护了模型首尾两个Transformer层的所有参数——这两层分别负责原始输入的嵌入和最终语义的输出对模型稳定性极为关键不宜随意改动。三、掩码隔离训练只在荒地上施工有了参数空间的地图之后Splash进入实际训练阶段。整个训练流程被设计成一个统一的单阶段过程这与之前许多方法需要先预对齐触觉编码器再微调大模型这种繁琐的两阶段流程形成了鲜明对比。在模型架构上Splash保留了原有sMLLM中处理自然图像的视觉前端包括视觉编码器和模态适配器同时新增了一个轻量级的触觉前端。这个触觉前端采用的是只有580万参数的ViT-Tiny模型经过ImageNet预训练配合一个两层MLP投射器将触觉接触图的特征映射到语言嵌入空间中。自然图像、触觉接触图和文字提示经过各自的编码器处理后被拼接成一个统一的自回归序列送入大语言模型让模型生成触觉属性描述。训练时研究团队构造了一个二值掩码矩阵M。每个被标记为休眠的参数对应掩码值为1可以接受梯度更新每个关键参数对应掩码值为0梯度被清零等于完全冻结。这个掩码通过Hadamard乘积逐元素相乘作用于梯度上从数学上确保了关键参数绝对不会被触觉训练污染。训练目标是最大化自回归生成触觉描述的对数似然也就是让模型生成的触觉属性词汇比如粗糙的、有弹性的、坚硬的尽可能接近真实标注。这种设计与常见的LoRA低秩适应方法有本质区别。LoRA通过在原有权重矩阵旁边添加一对低秩矩阵来引入新能力这种加法操作会在推理时引入额外计算量并且由于原始权重空间并未被真正隔离仍然存在干扰的可能。Splash则采用原位替换的思路——休眠参数直接在原地被更新没有任何附加模块推理阶段的计算量与原始模型完全一致零额外开销。四、实验验证小身板胜大块头研究团队在三个视觉-触觉-语言VTL基准数据集上对Splash进行了全面评测。第一个是SSVTP数据集包含4500个对齐的视觉-触觉图像对聚焦服装纹理感知任务比如判断某块布料是编织的还是有弹性的。第二个是TVL数据集包含44000个样本附带自然语言描述的触觉属性标注是目前最大规模的VTL对齐训练集之一。第三个是TacQuad数据集中的DIGIT传感器子集包含72000个触觉样本通过手持交互方式采集模拟真实世界中人类的接触动态。这个数据集的描述最初由GPT-4o生成后经人工修订文本质量更高评估也更贴近自然语言理解而非简单的关键词匹配。评测方式分为两类。主要评测采用GPT-4o作为文本裁判给模型生成的触觉描述与真实标注之间的语义相似度打分满分10分。辅助评测则使用客观的关键词F1分数和Top-5准确率——前者衡量预测关键词与真实关键词的重叠程度后者衡量预测出的触觉属性中至少有一个与真实属性集合匹配的比例。对比的基线方法包括使用LLaMA-7B骨干的TVL-LLaMA和UniTouchTouch-LLM以及在相同Qwen2.5-VL-3B骨干上分别应用LoRA和(IA)?一种通过引入可学习缩放向量来微调模型的PEFT方法的变体。结果相当令人瞩目。未经任何触觉训练的原始InternVL2.5-1B和Qwen2.5-VL-3B模型平均得分仅在3.53到3.57之间说明纯视觉模型对触觉属性推理几乎束手无策。使用7B参数LLaMA骨干的UniTouch平均得分也仅为3.74——参数量更大效果却并不突出足以说明单纯堆叠参数量并不是解决触觉感知的正确路径。Splash-3B在相同的Qwen2.5-VL-3B骨干上平均得分达到4.91明显超过同骨干下使用LoRA方法的TVL基线4.50和(IA)?变体4.42。尤其在TacQuad这个分布外测试集上Splash-3B得分4.86远超(IA)?的3.84说明Splash的泛化能力更强能够应对真实世界中各种意想不到的触觉接触场景。体量更小的Splash-1B仅10亿参数的InternVL2.5-1B骨干平均得分甚至达到5.01在SSVTP上高达5.69超过了所有对比方法包括参数量是其7倍的LLaMA-7B系方法。在客观指标上Splash在平均F1分数0.36和0.32和Top-5准确率0.77和0.74上同样全面领先所有基线充分表明其预测的触觉属性更加精准词汇覆盖面更广。五、不忘初心视觉能力的完整保留除了触觉任务的性能之外研究团队还花费大量篇幅验证Splash不会损伤模型原有的视觉语言推理能力这也是整项研究区别于以往工作的核心贡献之一。评测采用了四个权威的通用视觉语言基准MMMU大规模多学科多模态理解基准考察专家级多领域推理、MathVista数学视觉推理基准、MME多模态综合感知与认知评估以及MMBench双语多模态理解基准分英文版和中文版。结果相当有说服力。UniTouch和TVL-LLaMA在这些通用视觉基准上几乎完全崩溃——UniTouch的MMMU得分仅26.6分MathVista仅9.0分MME更是只有可怜的27分意味着这些方法在引入触觉能力的同时基本上摧毁了模型的通用视觉理解能力。Splash-3B则呈现出截然不同的图景。其MMMU得分55.3不仅远超TVL-Qwen基线50.0甚至超过了未经任何触觉训练的原始Qwen2.5-VL-3B零样本基线53.1。MathVista得分65.3同样超过零样本基线的62.3。研究团队认为这种学了新技能反而比原来更强的现象可能源于稀疏性更新本身带来的一种类似剪枝的正则化效果反而帮助稳定了原有的推理流形。相比之下(IA)?在MME、MMBench-EN和MMBench-CN三项上表现最佳但这是以触觉学习能力不足为代价换来的——它的可塑性太低只能通过在触觉任务上划水来保全视觉能力并不是真正意义上的双赢。Splash则在保持视觉能力的同时实现了更充分的触觉学习两者之间并不是此消彼长的零和游戏。六、细节深挖稀疏率、校准数据与触觉前端初始化研究团队还进行了一系列精心设计的消融实验逐一检验Splash各个设计决策的必要性。关于稀疏率的选择他们测试了从30%到100%的多个档位。当稀疏率过高如100%即全参数更新时视觉语言能力急剧崩塌MMMU得分跌至22.0MMBench-EN仅剩10.4这印证了灾难性遗忘的破坏性。当稀疏率过低如30%时触觉学习受到过度限制VTL平均得分从4.91降至4.79。60%被确认为Splash-3B的最佳平衡点在触觉与视觉两端同时取得最优表现。对于更小的Splash-1B由于参数空间本就更紧张模型对稀疏率更为敏感但60%仍提供了合理的整体均衡。关于校准数据的选择研究结果令人颇感惊喜。无论是使用CC3M的图文对、TVL的触觉数据还是用完全随机的噪声图像配上无意义文字提示作为校准输入Splash的性能差异都极小VTL平均得分在4.75到4.91之间微幅浮动。这一发现暗示了一个深刻的结论Splash所识别出的休眠参数并非某个特定数据集激活模式的产物而是模型架构中内在冗余结构的体现——这些荒地无论用什么地图来测绘都大差不差地指向同一片区域。校准样本数量方面64、128和256个样本表现相当研究团队选择128个作为默认值。关于触觉前端初始化研究团队还控制变量对比了使用TVL论文中触觉预训练编码器作为初始化的情况。即使在相同的触觉前端初始化条件下Splash依然在VTL和VL两个维度上全面超越TVL-Qwen证明性能提升的主要来源是掩码隔离训练策略本身而非触觉编码器的质量差异。七、走进模型内部休眠参数被唤醒的证据研究团队还深入分析了Splash训练前后休眠子空间内参数的变化情况。他们从TVL数据集的一个子集出发提取了Qwen2.5-VL-3B与Splash-3B之间约1500万个休眠参数的权重变化情况并将视觉相对重要性分数的变化分解为两个分量权重幅值的变化结构偏移和激活L2范数的变化响应性偏移。结果显示约48.8%的休眠权重幅值有所增加而高达67.1%的对应激活值出现了显著的L2范数提升。换言之休眠通道的响应灵敏度大幅上升——这些原本对视觉语言任务几乎没有反应的通道在经过触觉训练后变得高度敏感开始对触觉输入做出积极响应。综合来看63.0%的休眠参数的整体重要性得分提升进一步印证了唤醒休眠这一设计理念的有效性。八、边界保护与推理效率的双重验证研究团队还通过实验验证了冻结首尾Transformer层这一设计选择的必要性。若解冻这两层边界层VTL平均得分下降0.18分说明这两层对于维持模型的表示稳定性确实至关重要。在推理效率方面研究团队在单块NVIDIA RTX PRO 6000 Blackwell GPU上以批大小为1、生成6个输出词元的标准设置测量了各方法的端对端推理延迟。在50次热身迭代之后运行200次测量取第99百分位延迟P99 latency作为指标。基于LLaMA-7B骨干的TVL-LLaMAP99延迟为202.37毫秒控制频率约为每秒4.97次。而Splash-3B与合并LoRA权重后的TVL-Qwen基线延迟完全相同均为134.55毫秒控制频率7.50次每秒。由于Splash不引入任何附加模块其推理负担与原始模型完全相同这对于需要实时感知的机器人应用场景尤为关键。九、真实案例与失败边界从定性结果来看Splash生成的触觉描述与真实标注的语义贴合度明显更高。当面对一块麻布时Splash-3B能准确输出lined, fabric有纹路的、布料质感而UniTouch给出的是1. Textured 2. Rustic.有纹理、质朴感这样的通用词汇TVL-LLaMA则更是给出了metallic, patterned, rigid金属的、有图案的、坚硬的这类严重偏离实际的描述。当然Splash并非无懈可击。研究团队坦诚地分析了两类典型失败案例。第一类是触觉感知混淆——当一块织物在轻触时变形极小其触觉接触图的几何结构与光滑硬质表面高度相似导致模型误判材质属性将软性布料描述为metallic, smooth。这是触觉感知本身的物理局限而非模型设计缺陷。第二类是微纹理误读与视觉主导——当物体表面具有细微的凸起纹理bumpy, matte但整体外观视觉上较为光洁时所有模型包括Splash都倾向于被视觉外观所误导生成smooth, glossy这类与触觉事实相悖的描述。这提示在视觉与触觉信号存在冲突时模型的触觉感知融合机制仍有改进空间。研究团队同时指出Splash目前的休眠子空间是在训练开始前一次性离线确定的之后固定不变。然而在实际机器人操作中模型的激活模式会随着任务状态、接触条件和操作进度动态变化静态的休眠子空间未必能完全捕捉这种时序变化。此外当前实验仅基于DIGIT单一型号的触觉传感器跨传感器泛化比如同时支持GelSight、DIGIT和自定义传感器仍是未来值得探索的方向。不过由于Splash的设计本身与触觉前端无关理论上可以直接替换不同类型的触觉编码器。说到底Splash做到的事情是在一张已经画满图案的画布上找到那些空白的角落然后只在这些角落里添加新的内容而不破坏任何已有的笔触。这听起来是个朴素的想法但在AI模型这个领域能够严格执行这种只在荒地施工的策略并且在触觉任务和视觉任务两端同时取得优于现有方法的成绩本身就是一件相当不容易的事情。对于关注具身智能和机器人技术的研究者而言这项工作提供了一个清晰的信号赋予机器人新感知能力的道路不一定要以更大的模型或更多的算力为前提合理地利用已有模型的内在冗余同样可以走出一条高效的路。而对于普通读者而言下一次你感受到丝绸的顺滑或砂纸的粗粝时或许可以想一想让机器人也能获得这种感知背后需要多少精妙的工程。对这个话题感兴趣的读者可以通过arXiv编号2607.00302查阅完整论文深入了解所有技术细节。QAQ1Splash框架是如何避免AI模型学会触觉之后忘记视觉能力的ASplash通过一个地权划分机制来解决这个问题。它先用一小批视觉语言数据给模型内部所有参数打分找出那些对视觉语言任务贡献微小的休眠参数。训练触觉能力时只允许这些休眠参数更新对视觉任务重要的关键参数则完全冻结不接受任何梯度更新从数学上保证了视觉能力不被触觉训练破坏。Q2Splash使用的触觉传感器是怎么工作的ASplash实验中使用的是DIGIT光学触觉传感器。它的工作原理是传感器表面覆盖一层柔软硅胶当硅胶接触到物体时接触面的形变会被内置摄像头拍摄成图像。这张图像呈现出彩虹状的光泽纹路记录了物体表面的细微几何特征就是所谓的触觉接触图Splash通过专门的触觉编码器处理这类图像。Q3Splash的推理速度和现有方法相比如何ASplash在推理阶段没有任何额外的计算开销速度与基础模型完全一致。实测中基于Qwen2.5-VL-3B的Splash与合并了LoRA权重的TVL-Qwen延迟相同均为134.55毫秒每秒可处理约7.5次推理。相比使用LLaMA-7B骨干的TVL-LLaMA202.37毫秒每秒4.97次快了约35%更适合实时机器人控制场景。