STORM论文阅读笔记

时间:2025/8/12 9:10:04来源：https://blog.csdn.net/weixin_44326452/article/details/139747260 浏览次数:1次

在这里插入图片描述

这是篇NIPS2023的 world model 论文
文章提出，WM的误差会在训练过程中积累从而影响policy的训练，向WM中加噪声可以改善这一点。
其他的流程和IRIS差不多，差别在以下几点：
- image encoder，IRIS用的VQVAE, 本文用的是VAE，用VAE的采样方式来生成zt，从而为zt加噪声。
- sequence model，IRIS用GPT循环输出image的每个token，本文直接用MLP把生成的 $z_t$ 和动作 $a_t$ 输出成一个token，这样GPT只需要在时序上循环而不需要在同一个 t 内的不同 token 上循环。换句话说，IRIS的一个图片是GPT中的16个token，而STORM的一个图片是GPT中的一个token。
- hidden state，IRIS直接从 $z_{1:t}$ 预测 $z_{t+1}$ ，相当于RNN，而 STORM先从 $z_{1:t}$ 预测 $h_{t}$ ，也就是说上面的sequence model输出的不是 z ，而是hidden state h，再用一个MLP从 $h_t$ 来预测 $z_{t+1}$ ，这点是用了Dreamerv3的思路
- loss function，用的也是dreamerv3的loss function
完整公式和损失函数如下：

Agent learning

关键字：STORM论文阅读笔记

本网仅为发布的内容提供存储空间，不对发表、转载的内容提供任何形式的保证。凡本网注明“来源：XXX网络”的作品，均转载自其它媒体，著作权归作者所有，商业转载请联系作者获得授权，非商业转载请注明出处。

我们尊重并感谢每一位作者，均已注明文章来源和作者。如因作品内容、版权或其它问题，请及时与我们联系，联系邮箱：809451989@qq.com，投稿邮箱：809451989@qq.com

责任编辑：