MPC 路径规划

📅 2026/8/1 17:16:49
MPC 路径规划
MPC模型预测控制≠ 强化学习RL二者属于完全不同范式但存在大量交叉融合方案。简单归类✅MPC最优控制Optimal Control分支基于模型的开环滚动优化✅强化学习机器学习分支试错学习、策略优化下面分层讲清楚边界、区别、融合方式结合机器人MoveIt2 机械臂控制场景举例。一、核心本质对比1. MPC模型预测控制核心前提拥有系统动力学模型 \(\boldsymbol{x}_{k1}f(\boldsymbol{x}_k,\boldsymbol{u}_k)\)每个控制周期以当前状态为起点在有限预测时域内求解一段有限时域最优控制问题只执行算出的第一个控制量下一周期重新测量状态、重新优化滚动时域 Receding Horizon。目标最小化预先定义的代价函数跟踪误差、控制量代价约束可以显式写入关节限位、速度极限、碰撞约束等不需要试错训练在线实时求解优化问题QP/NLP机械臂例子MoveIt2 规划轨迹作为参考MPC 利用机器人动力学模型实时求解关节指令跟踪轨迹。2. 强化学习 RL核心通过交互试错优化策略 \(\boldsymbol{u}\pi(\boldsymbol{x})\)不一定需要系统模型分为两大类Model-Free RL无模型最常见DQN、PPO、SAC完全不使用动力学模型依靠采样回报迭代更新策略。Model-Based RL基于模型 RL先学习动力学模型再利用模型规划但优化目标是长期累积回报。二、关键区别清单表格维度MPC强化学习 RL依赖模型必须已知动力学模型可精确 / 近似无模型 RL 不需要模型基于模型 RL 学习模型优化时域有限滚动时域每一步重新求解无限 / 极大时域优化长期累积回报代价 / 目标人工设计代价函数 J跟踪误差奖励函数 reward通过采样学习策略求解方式在线数值优化QP、NLP 求解器 OSQP/Acados离线 / 半离线训练在线前向推理神经网络约束处理原生支持显式不等式约束硬件限位原生很难处理硬约束需要额外改造实时性在线求解计算负载随预测时域上升训练成本极高推理阶段极快仅网络前向泛化性模型失配时性能下降环境轻微变化往往鲁棒性更好三、极易混淆的关键点MPC 不是 RL但两者经常融合融合路线 1MPC RL工程非常常用机器人焊接 / 轨迹跟踪RL 优化 MPC 超参数MPC 的权重矩阵 Q、R、预测时域 N 很难手动调参用 PPO/SAC 学习最优 Q/R。MPC 依然是控制器RL 只是调参工具。RL 提供参考轨迹 / 修正项MoveIt 给出基础路径RL 输出补偿信号叠加在 MPC 控制指令上补偿模型误差。融合路线 2MPC 作为 RL 内部规划器Model-based RL学习动力学模型策略不再是神经网络而是每一步运行一次 MPC 这里 MPC 是规划模块整个系统依然归类为基于模型强化学习不能说 MPc 本身是 RL。融合路线 3可以数学等价的特例理论层面当满足MPC 预测时域无限长代价函数和 RL 回报严格对应 理论上无限时域 MPC 等价于确定性最优控制HJB 方程和 RL 的最优值函数框架相通。 ⚠️工程上 MPC 永远是有限时域因此不存在等价。四、结合你的场景MoveIt2 机械臂怎么选如果你有精确机器人动力学模型、需要严格关节限位、实时轨迹跟踪激光焊接 优先 MPC约束友好不需要漫长训练可直接和 MoveIt2 集成。如果模型不准、存在大量未知扰动、需要动态避障且难以建立精确模型 考虑 RL MPC 混合架构MPC 负责基础轨迹跟踪RL 补偿模型失配。不要混淆单纯用神经网络输出控制指令 ≠ MPC单纯滚动时域优化 ≠ RL五、一句话总结MPC 属于最优控制依靠动力学模型在线滚动优化强化学习属于机器学习依靠交互试错优化策略。二者互不包含是两套独立工具大量工业场景会组合使用。