NVIDIA Cosmos 物理世界视频生成从零指南:模型选型、环境搭建与首个示例一次讲清

📅 2026/8/19 18:15:34
NVIDIA Cosmos 物理世界视频生成从零指南:模型选型、环境搭建与首个示例一次讲清
NVIDIA Cosmos 物理世界视频生成从零指南模型选型、环境搭建与首个示例一次讲清【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosNVIDIA Cosmos 是一个开源的物理世界生成平台它把世界基础模型、视频分词器、后训练工具打包在一起让开发者可以从一段文字或一段视频出发批量合成逼真的物理场景模拟视频专门服务机器人、自动驾驶、智能基础设施这类物理 AI应用。如果你正在为训练数据发愁或想低成本搭建仿真测试场景这篇文章就是为你准备的先帮你避开选型陷阱再带你跑通第一个示例。为什么造视频成了物理 AI 的刚需真实世界的数据获取成本太高让一辆车跑一万公里、让机器人反复试错既烧钱又耗时而且极端天气、罕见路况这类长尾场景永远覆盖不全。世界模型的思路是反过来的——与其辛辛苦苦攒数据不如让模型按需造数据。Cosmos 的角色就像一家虚拟训练场供应商你告诉它场景长什么样它就还你一段物理规律基本自洽的视频用来扩充训练集或做测试。这也是它和普通文生视频工具的本质区别前者服务娱乐后者服务物理 AI 研发管线。决策一扩散式还是自回归式先分清两条技术路线Cosmos 同时提供两条技术路线选错方向会直接影响你的效果和等待时间。对比维度扩散式世界模型自回归式世界模型代表模型Diffusion-7B/14BText2World 与 Video2World 两版Autoregressive-4B/12B 基础版5B/13B Video2World 版核心能力从文本凭空造世界或用文本图片/视频生成完整场景沿时间轴续写吃进 1 帧或 9 帧往后补到 33 帧输出规模固定 121 帧固定 33 帧单段耗时参考H1007B 约 380 秒14B 约 590 秒4B 约 62 秒12B 约 119 秒典型用途文本创意驱动、长镜头世界构建视频续写、低延迟仿真、逐帧预测一句话建议想要从零到一的创造力选扩散式想要接着往下演的实时性选自回归式。如果只是验证流程扩散 7B 是门槛最低的起点。决策二24GB 显存能跑吗卸载策略对照表很多人第一反应是7B 模型怎么也要 40GB 显存吧。Cosmos 的解法是给每个模块单独配一个 offload 开关按需把模型从显存挪到内存。官方实测数据7B Text2World是这样的你的 GPU推荐开关组合峰值显存RTX 3090/409024GB五个 offload 全开tokenizer、扩散模型、文本编码器、提示上采样器、安全护栏约 24GBA10040GB卸载上采样器 护栏 T5 编码器约 38GBH10080GB仅卸载提示上采样器约 74GB低显存配置就是把下面命令里的五个--offload_*参数全部带上速度会慢一些但能正常跑完。决策三3 步搭好环境并下载模型第 1 步克隆仓库并构建 Docker 镜像仅支持 Ubuntu 20.04/22.04/24.04需预装 NVIDIA Container Toolkitgit clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container这一步做完你会进入一个装好全部依赖的容器终端后续所有命令都在这里执行。第 2 步登录 Hugging Face 并下载权重。先执行huggingface-cli login填入你的访问令牌权限选 Read然后运行PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World预期结果checkpoints/目录下出现 Diffusion-7B/14B 两套模型的model.pt和config.json外加分词器、提示上采样器、安全护栏等配套文件。注意Video2World 的提示上采样依赖 Mistral 的 Pixtral-12B需要先到其模型页面点击同意协议否则下载会 401 报错。第 3 步验证环境。直接跑一个最短的 Tokenizer 自编码命令或直接进入下一步生成视频——能出结果就说明一切就绪。跑通第一个 Text2World 示例把一句话变成一段 5 秒左右的物理世界视频核心就一条命令PROMPT一个优雅的人形机器人站在巨大的仓库中周围是整齐堆放在工业货架上的纸箱金属身体在明亮均匀的灯光下闪闪发光。 PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name my_first_world白话解释--diffusion_transformer_dir指定用哪个生成模型--prompt是剧本--offload_prompt_upsampler帮显存有限的机器省空间。预期输出outputs/my_first_world.mp4默认 121 帧、1280x704、24fps7B 模型大约需要 6 分钟。用一张图做 Video2World让静止画面动起来如果你手头有一段真实行车记录或机器人操作录像Video2World 更适合你——模型会根据画面内容自动生成描述再续写未来画面。仓库自带的示例输入长这样PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name my_video_world \ --offload_prompt_upsampler--num_input_frames填 1 表示吃一张图填 9 表示吃一段 9 帧的视频。注意默认开启的提示上采样器会忽略你手动写的 prompt想要自己控制文字描述就加--disable_prompt_upsampler并配合--prompt使用。常见报错速查遇到这些提示别慌401/ 无法访问模型仓库大概率是 Hugging Face 令牌权限不足或没去 Pixtral-12B 页面点同意协议。CUDA out of memory按上面的卸载策略表补上对应的--offload_*参数。生成画面里人脸被糊成一团这不是 bug。Cosmos 内置强制启用的安全护栏人脸检测与内容过滤不可关闭生成人脸会被自动模糊。视频看起来跑题提示上采样器有时会擅自加戏加--disable_prompt_upsampler回归原始提示词即可。让效果更稳的提示词心法提示词是你能直接控制的最强旋钮。三个经验只描述单一场景避免镜头切换导致画面跳变控制在 120 词左右太短信息不足、太长容易发散少写相机指令当前版本对运镜控制支持有限。如果追求原汁原味的创作意图就关掉上采样器自己打磨文字。抽丝剥茧视频凭什么能被高效压缩世界模型之所以能跑在单卡上靠的是前置的视频分词器——它先把画面压成潜变量或离散 token生成完成后再解码回视频压缩率最高可达 2048 倍同时画质与速度均优于同类方案如果你打算自建视频数据集或训练自己的生成模型分词器这层是绕不开的基础设施文档里提供了图像/视频的完整编码解码示例。进阶用后训练定制你的专属世界模型预训练模型覆盖的是通用物理场景若你想让模型只生成自家工厂或特定相机视角的视频可以用 NeMo 框架做后训练。目前通用后训练General Post-training对扩散式和自回归式模型都已开放指令控制、动作控制、相机控制、多视角生成等能力也在陆续补齐。一周上手路线图第 1 天完成环境搭建与模型下载跑通 Text2World 示例。第 2 天换不同提示词与宽高比1:1、4:3、16:9 等体会质量差异。第 3 天用 Video2World 喂入自己的图片/视频对比 7B 与 14B 效果。第 4 天尝试批量生成--batch_input_path指向 JSONL 文件一次产出多条视频。第 5 天起按需研究自回归模型与后训练把 Cosmos 接入你的物理 AI 数据管线。更多资料Cosmos 安装指南Docker 环境搭建细节扩散式世界模型推理文档Text2World 与 Video2World 全部参数自回归式世界模型推理文档视频续写用法与失败率数据视频分词器文档压缩原理与编码解码示例后训练文档定制专属世界模型的路线图安全护栏文档理解强制安全机制动手永远比围观快。挑一个示例跑通它再按你的场景改造提示词——物理 AI 的下一个突破口可能就藏在你生成的这段视频里。【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考