Palm-E 模型详解Palm-E基本信息项目内容全称Pathways Language to Action with Embodied机构Google DeepMind论文[Palm-E](https://palm-e.github.io/)架构Transformer (PaLM ViT)动作类型离散/连续 Token训练方式模仿学习 语言数据模型架构输入图像 ──→ ViT Encoder ──┐├──→ PaLM LLM ──→ 动作Token文本指令 ──→ Text Embed ────┤机器人状态 ──→ State Embed ──┘动作Token ──→ 映射 ──→ 连续动作核心思想Palm-E 是 Google 的具身多模态大模型•结合 PaLM 大语言模型•融入视觉和机器人状态•输出动作序列数据格式输入字段格式说明多视角图像[N, H, W, 3]多个相机文本指令字符串任务描述机器人状态向量关节角度等输出字段格式说明动作Token离散ID预测的动作核心公式1. 多模态输入融合$$x [\text{ViT}(I_1); ...; \text{ViT}(I_n); \text{Text}; \text{State}]$$2. LLM 生成动作$$P(a_{t1} | I, s, \text{instr}) \text{PaLM-E}(I, s, \text{instr})$$3. 动作解码$$a_{continuous} \text{ActionHead}^{-1}(a_{token})$$与 RT-2 的区别方面Palm-ERT-2LLMPaLMRT-2 自己的状态输入有无视觉编码ViTRT-2 自己优点1.多模态融合视觉 文本 状态2.LLM 能力推理能力强3.具身理解理解物理世界缺点1.动作精度离散 Token 有量化误差2.计算资源PaLM 参数量大3.Google 内部完整模型未公开使用场景核心场景场景说明**具身AI研究**学术研究语言-视觉-动作的融合**复杂推理任务**需要多步推理的操作任务**长期任务规划**复杂的多阶段任务**Google 生态**在 Google 技术栈上开发典型任务1. 复杂推理任务- 如果物体A在物体B上面就把它们一起放到C上面- 先打开盒子再把红色积木放进去- 按照从左到右的顺序排列物体2. 长期任务- 整理厨房先洗碗再擦台面最后归位- 布置餐桌先放盘子再放餐具- 清洁房间先收集杂物再擦拭表面3. 语义理解任务- 把最重的物体放到最低的架子上- 把容易碎的物品放到安全位置- 把所有圆形的东西放到一个组适用条件条件要求硬件高端机械臂 多相机计算TPU / 高端 GPU技术能力熟悉 Google 技术栈研发资源大规模模型训练能力与 RT-2 的选择条件推荐需要机器人状态输入Palm-E强调泛化能力RT-2计算资源有限RT-2学术研究用途两者皆可