Google DeepMind 发布 Gemini Robotics 2:大模型长出“手“和“脚“,AI 正式进入物理世界

📅 2026/8/1 17:30:55
Google DeepMind 发布 Gemini Robotics 2:大模型长出“手“和“脚“,AI 正式进入物理世界
Google DeepMind 推出了 Gemini Robotics 2将 AI 的能力从虚拟屏幕延伸到了现实的物理空间。这个模型能感知、理解并操控真实物体DeepMind 研究者将其称为物理 AGI的开端。技术实现多模态模型加上身体Gemini Robotics 2 基于 Gemini 多模态大模型但针对物理交互做了深度微调。输入包括视觉、触觉、语言等多模态信号输出为动作指令、抓取策略和路径规划。相比前代它在理解三维空间、物体物理属性和实时反馈上的提升显著。通过大规模模拟训练配合少量真实数据模型能快速适应陌生场景——从未见过的工具试几次之后就能学会正确使用。物理 AGI 意味着什么AGI 是否必须在物理世界实现业界一直有争议。文字和图像领域的 AI 已经很强了但一碰到需要真正动手的事就卡壳。Gemini Robotics 2 在这个方向撕开了一道口子模型知道杯子易碎拿起时会轻放能理解把螺丝刀递给旁边的人这种社会性指令。这种对物理属性和人类意图的整合被认为是通往 AGI 的关键一步。WIRED 科技编辑 Will Knight 认为这不只是机器人技术的进步而是 AI 理解世界方式的转向。真实世界的风险AI 进了物理世界出错的代价就变了。模型幻觉不再只是生成错误文字而是可能撞翻东西、误伤人类。滥用风险同步升级——如果这类模型被用于自主武器系统或非法侵入设施后果不是写检讨能解决的。数据隐私也更紧迫机器人摄像头可以360度记录家庭和工厂里的人与物。Google DeepMind 在论文中明确表示Gemini Robotics 2 目前还处于研究阶段部署需要配合安全外壳力矩限制、急停开关和社会监管框架。信任比功能更重要当 AI 真正长出手和脚面对的就不只是技术问题。伦理、法律、就业结构都会受到冲击。在追求 AGI 的路上不能只盯着智力还要给它穿上铠甲。一次失误就可能让公众对 AI 的信任崩塌。未来十年物理与数字的融合会加速到来但风险管控的优先级应该高于功能堆叠。