面壁智能将密度定律带入具身智能 - 科技行者 📅 2026/7/21 8:16:52 作者 | 金旺栏目 | 机器人新纪元在WAIC 2026上具身智能无疑成了最拥挤的赛道。我们在现场听到越来越多具身智能团队开始谈论量产、订单和场景落地面壁智能正是在这时发布了具身智能模型系列MiniCPM-Robot试图让已经进入到手机、汽车、消费硬件的端侧模型进一步走进物理世界。不过面壁智能联合创始人、首席科学家刘知远在接受媒体采访时告诉我们“目前具身智能发展还处于非常早期阶段甚至连ChatGPT时刻还远未到来。”面壁智能学术合伙人、多模态智能首席科学家姚远也指出“目前针对一个固定任务采集上千条数据再训练一个专家模型做出一段表现不错的视频并不困难真正困难的是机器人换一个房间、换一台本体、换一种物体之后能不能继续完成任务。”这也就成了MiniCPM-Robot最值得关注的地方。当面壁智能终于进入具身智能领域后他们首先打造了一个1.5B端侧通用VLA模型并将密度定律带到了具身智能领域。01 密度定律进入具身过去几年里大模型行业相信的是Scaling Law参数、数据和算力持续扩大模型能力随之不断提升。然而面壁智能却发现了另一个现象并在2024年提出了密度定律。所谓密度定律是指模型智能密度会随时间呈指数级增强达到相同智能水平所需要的参数量约每3.5个月缩小一半。刘知远将这一定律类比为“模型制程”的持续进步——“如果摩尔定律提高的是芯片电路密度密度定律提高的就是单位参数所能承载的智能。”这套逻辑支撑了MiniCPM过去几年的发展新一代语言模型MiniCPM5-1B只有约10亿参数可以运行在手机和浏览器MiniCPM-V 4.6则以约1.3B参数继续压缩端侧多模态模型的体积和计算成本。如今面壁智能继续将这条曲线延伸到了具身智能领域。在WAIC 2026期间面壁智能正式对外发布了具身智能模型系列MiniCPM-Robot其中的操作模型的参数约为1.5B。按照姚远的说法“这套模型没有为某一个场景单独设计一套参数而是尝试用一个模型控制不同本体覆盖多种任务和环境在相关评测中它已经可以与过去3-4B、甚至规模更大的专用模型取得相当效果部分指标甚至更好。”不过参数小只是其一具身模型还需要持续处理摄像头输入。传统多模态和具身方案处理一帧图像通常要消耗约256个视觉TokenMiniCPM-RobotManip将其压缩到了64个。如果具身机器人同时接收3-4路摄像头画面即便每路视频每秒只保留一帧一分钟也会积累数百帧图像形成几万甚至十万级Token视觉Token压缩不下来机器人的记忆就无从谈起。因此MiniCPM-RobotManip进一步支持1分钟原生视频上下文通过视觉压缩、流式上下文管理和专门的后训练让历史观测直接进入到模型中机器人由此也就不再只看当前画面还能够利用此前发生的信息作出判断。至于这样的设计有怎样更直观的作用姚远举了两个简单的例子“如果任务要求机器人按照牌子上的数字按几次按钮缺少记忆的模型在按下按钮时其实不知道自己已经按了几次制作三明治也是一样它需要理解任务进行到了哪一步而不是每看到一帧画面就重新作出一次孤立的反应。”与此同时面壁智能还推出了追踪导航模型通过纯视觉和纯本地部署在不增加额外传感器、不提前建图的情况下进行目标追踪在电梯、地下停车场等弱网或断网环境中这一模型仍然可以稳定运行。不难发现泛化、效率、记忆构成了MiniCPM-Robot的三个关键词而它们最终指向的是同一个目标在有限的端侧算力中装进尽可能完整的具身智能。值得注意的是此前面壁智能提出的密度定律主要在语言模型和多模态模型上得到了验证而在进入具身智能领域之后情况变得更复杂。语言模型处理的是数字世界中的Token具身模型还要面对传感器误差、本体差异、控制延迟和真实环境的随机性这样的小模型能否继续保持能力跨本体数据能不能放进同一套参数而不互相干扰仍然需要在更多真机部署中进行验证。不过面壁要验证的不只是模型能不能继续变小还要证明更小的模型是否可以在物理世界中承担更复杂的任务。02 面壁智能为何选择“先通用后专用”在具身智能领域Demo几乎成了衡量技术进度的唯一窗口。普通人手中没有一台可以随时测试的人形机器人只能通过企业发布的视频判断模型能力一台机器人能做三明治、叠衣服或者打乒乓球很容易被理解为具身智能已经取得了实质性突破。但Demo背后却隐藏了数据成本。为了让机器人完成一个固定任务具身智能团队可以提前在同一个场景采集数百甚至上千条数据再对模型进行专门微调只要环境变化不大机器人就可以获得不错的展示效果。不过姚远认为这类结果不能代表具身基础模型的真实进度。他指出“当前不少模型依然缺少基础性、泛化性和通用性场景一旦出现没有见过的物体或者任务步骤发生改变原本流畅的动作就可能失效。”更现实的问题是那些随机性极低、重复度极高的任务传统机械臂和自动化设备已经完成得很好具身智能如果长期停留在固定工位只是用更复杂的模型重新完成一次成熟自动化方案其技术意义和商业收益都需要重新计算。刘知远将这种路线概括为“先专用后通用”它延续的是上一代专用人工智能的思路。2010-2018年上一批人工智能创业团队在做人脸识别时收集了大量人脸数据做自动驾驶也收集了大量驾驶数据然而模型可以把一项任务做得很好却无法把能力迁移到其他领域。今天一些具身智能团队仍在重复这条路径一个任务对应一套数据、一次微调和一个模型。对于这一模式刘知远引用了一个产业界形象的比喻指出“如果你的目标是登上月球却一直通过爬树来训练自己无论树爬得多高多好也到不了月球。”在他看来通用具身智能应该“先通用后专用”。他指出“一个人在学习开车之前就已经通过十几年生活形成了对物理世界的常识他可能没有学习过牛顿定律却知道水泥柱不能撞、地面上的塑料袋通常不需要紧急避让在这些通用认知的基础上人只需要较短的时间就能学会驾驶。”他认为“模型也应该先成为一个足够聪明的‘大学生’再成为司机、程序员、家务机器人或者工厂中的机器人。”实际上过去这几年大语言模型的技术发展走的真是这样一条路。今天Claude的编程模型已经足够出色到用户愿意为之付费但它并非只是靠代码数据堆出来的它首先继承了基础大语言模型的语言、知识和推理能力随后才成长为一个“专业程序员”。具身智能要获得更高的专业能力上限同样需要一个通用基座。这也是为什么面壁智能没有把某一个场景的深度优化作为MiniCPM-Robot的首要目标。按照姚远的说法团队现阶段更关注基础数据、训练方法和工程链路希望让一套参数支持更多任务、场景和本体“真实场景的数据闭环仍然重要但它需要建立在通用基础能力之上。”而面壁智能选择先通用后专用实际上是相信大语言模型已经走过的通用化路径也能够在具身智能领域再次发生。03 具身智能的ChatGPT时刻还远未到来面壁选择在此时进入具身智能并不意味着这个行业已经成熟。恰恰相反刘知远给出的判断是“具身智能的技术路线仍未收敛基础模型、数据体系和商业模式都处在探索阶段。”2018年前后预训练模型领域同时存在BERT、GPT和T5等多条技术路线当时GPT甚至不是最被看好的方向直到GPT-3和ChatGPT相继出现行业才逐渐向生成式架构收敛。如今的具身智能同样存在VLA、世界模型、强化学习等多种技术路线虽然今年很火的世界模型补充了具身智能对未来状态进行预测的重要能力但未来具身基础模型最终以什么形态出现仍然没有明确答案。姚远指出“当下具身智能的关注度远高于2018年的大语言模型路线收敛可能会更快但这仍需要一定的时间。”与此同时数据是另一个尚未解决的问题。大语言模型可以直接利用互联网文本具身智能却没有同等规模、天然存在的动作数据互联网视频数据量巨大却缺少精确动作和关节信息仿真数据容易扩大规模但与真实世界存在一定差距真机数据精度高、任务也更贴合却昂贵而又稀缺。越容易获得的数据数据量越大但精度和场景贴合度越低越接近机器人真实任务的数据成本越高、数量越少这也就成了当下具身数据的现状。此外具身基础模型还需要同时使用文本、图文、视频、人类动作、仿真和真机数据需要回答不同来源的数据怎样进入一套模型、是否相互干扰以及模型如何从观测中形成对物理世界的常识。姚远指出“数据层面的Scaling Law依然成立更多有效数据仍然会带来能力提升但参数规模的Scaling Law尚未形成共识具身模型还要满足实时推理要求不可能简单复制语言模型不断扩大参数的路径。”正是由于这诸多问题的存在刘知远指出“现在大家都还没有找到具身智能的ChatGPT时刻。”ChatGPT之所以成为大语言模型的分水岭不是因为它完成了一次成功演示而是因为任何用户打开网页都可以立即测试它并在不同任务中感受到它的通用能力。具身智能暂时缺少这样的产品和评判方式普通人无法随时测试一台机器人企业发布的Demo也很难完整呈现成功率、数据量和环境约束。这正是具身智能距离ChatGPT时刻最远的地方。就面壁智能而言MiniCPM-Robot是面壁智能进入具身智能的第一步也让面壁智能离AGI又近了一步。接下来我们更期待面壁智能的密度定律能够加速具身智能领域的智能涌现。