NVIDIA Cosmos 世界模型快速上手:从安装到生成第一条物理AI视频

📅 2026/8/24 2:09:56
NVIDIA Cosmos 世界模型快速上手:从安装到生成第一条物理AI视频
NVIDIA Cosmos 世界模型快速上手从安装到生成第一条物理AI视频【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmosNVIDIA Cosmos 是一个面向物理AI的世界模型开源平台覆盖机器人、自动驾驶和智能基础设施等场景的数据生成需求。对使用者的核心能力只有两条路用一段文字直接生成视频Text2World或者拿一张图片、一段已有视频让模型把接下来的世界续出来Video2World。本文按这个思路走一遍完整流程从确认机器能否跑到调出第一条像样的视频。️ 先确认机器能不能跑动手装之前对一遍这张表。任何一项不满足后面的步骤都会卡住项目要求操作系统Ubuntu 20.04 / 22.04 / 24.04官方只支持 UbuntuGPUNVIDIA 显卡建议显存 24GB 起步容器环境Docker且已安装 NVIDIA Container Toolkit磁盘至少预留 50GB 用于存放模型权重软件栈本身不需要你手动装官方 Docker 镜像会把 Python 依赖全部带进容器这也是后文所有命令都在容器里执行的原因。安装、拿权限、拉模型四步出第一条视频第一步克隆仓库并构建镜像。git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos docker build -t cosmos .第二步启动容器并进入。docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container第三步解决模型权限。Cosmos 的权重托管在 Hugging Face 上到 Hugging Face 的 Token 页面创建一个权限为 Read 的访问令牌然后执行huggingface-cli login登录。另外去 Mistral AI 的 Pixtral-12B 模型页面点击 Agree and access repository 同意授权——Video2World 的提示上采样器依赖这个模型不点头下载脚本会在转换它的权重这一步失败。第四步下载预训练权重。PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World下载内容落到checkpoints/目录。这个脚本不止拉 DiT 主干还会一并取回 Guardrail 护栏模型和 CV8x8x8 视频分词器如果下载了 Text2World会额外带上 12B 的提示上采样器下载了 Video2World则会转换并保存 Pixtral-12B 权重。显存或磁盘紧张时把--model_sizes 7B 14B缩成--model_sizes 7B即可后面的示例都用 7B。用法一文字生成视频Text2WorldPYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt 一个机器人站在大型仓库中货架整齐灯光均匀镜头固定 \ --video_save_name my_first_video \ --offload_prompt_upsampler跑完在输出目录里找my_first_video命名的视频文件。需要换 14B 模型时把--diffusion_transformer_dir改成Cosmos-1.0-Diffusion-14B-Text2World步数、guidance 等参数默认即可想调优见调质量一节。用法二从图片 / 已有视频续写世界Video2World这条路的输入是一张图片或一段视频模型基于它生成后续画面PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --video_save_name v2w_demo \ --offload_prompt_upsampler--num_input_frames决定取输入的前几帧作为条件默认 1 帧即单图也支持 9 帧。仓库cosmos1/models/diffusion/assets/v1p0/里备有现成的示例图片和视频可以直接拿来试。四个模型、两类结构怎么选模型结构输入适合场景Cosmos-1.0-Diffusion-7B-Text2World扩散纯文本快速迭代、显存受限约 24GB 可跑Cosmos-1.0-Diffusion-14B-Text2World扩散纯文本追求更高画面质量Cosmos-1.0-Diffusion-7B-Video2World扩散图片/视频 文本基于真实素材续写未来Cosmos-1.0-Diffusion-14B-Video2World扩散图片/视频 文本高质量视频续写Cosmos-1.0-Autoregressive-4B自回归图像 文本世界模型研究方向、NeMo 微调Cosmos-1.0-Autoregressive-12B自回归图像 文本同上质量更高选择逻辑很简单做生成演示或批量产数据选扩散系列要接 NeMo 做后训练、研究世界建模本身再看自回归系列4B / 12B。扩散系列内部 7B 和 14B 的差别只在质量与耗时的权衡接口完全一致。让输出更好看提示词和三个旋钮提示词方面四个建议来自官方实践一段提示只描述一个连续场景不要写镜头切换长度控制在 120 词左右太长反而拖慢上采样且容易跑偏少写相机运动指令当前版本对这类控制的支持有限多用具体名词和形容词堆视觉细节比如材质、光线、空间布局。上采样器默认开启负责把你的短提示扩写成细节更丰富的长提示提示超过 250 词时脚本会自动跳过它用--disable_prompt_upsampler可以强制关闭保持原始意图。三个质量旋钮都是推理脚本的通用参数默认值见括号--num_steps扩散采样步数默认 35步数越多质量越好、耗时越长--guidanceguidance 尺度默认 7控制画面跟随提示词的强度--height/--width输出分辨率默认 704 x 1280可换成 1:1、4:3、16:9 等比例。显存不够怎么办五个组件可以按需逐个从 GPU 挪到 CPU对应五个开关--offload_prompt_upsampler、--offload_text_encoder_model、--offload_diffusion_transformer、--offload_tokenizer、--offload_guardrail_models。官方给出的三档配置显卡组合开关峰值显存参考RTX 3090 / 409024GB全部五个约 24GBA10040GB--offload_prompt_upsampler --offload_guardrail_models约 57GBH10080GB--offload_prompt_upsampler约 74GB24GB 机器的完整写法在核心命令后追加四个开关即可--offload_tokenizer \ --offload_diffusion_transformer \ --offload_text_encoder_model \ --offload_guardrail_models批量生成走 JSONL每行一条提示词仓库cosmos1/models/diffusion/assets/v1p0/batch_inputs/text2world.jsonl有现成格式。在 text2world 脚本上加--batch_input_path jsonl路径 --video_save_folder outputs/结果会按批次落盘到指定目录。边界、时长与下一步先把限制说清楚免得踩坑输出帧数固定 121 帧--num_video_frames只有这一个选项采样帧率默认 24fps可用--fps按需调整单视频推理耗时参考7B 约 380 秒14B 约 590 秒。安全护栏是强制启用的没有关闭入口生成内容会过内容安全过滤检测到的自动模糊处理人脸。做发布前的内容审核时把它算进流程而不是当作可选项。往深处走的两条路针对自有数据做后训练看 cosmos1/models/POST_TRAINING.md多 GPU 推理看 cosmos1/models/diffusion/nemo/inference/README.md。下一步怎么做先在 24GB 级别的机器上用 7B Text2World 跑通全链路卸载开关全开确认流程没断再用 14B 或 Video2World 对比同一场景的输出质量决定日常用哪个规格稳定之后切到 JSONL 批量模式把单条 380 秒的耗时摊到批量生产里。参考文档与源码后训练指南 cosmos1/models/POST_TRAINING.md、多GPU推理 cosmos1/models/diffusion/nemo/inference/README.md、扩散模型推理源码目录 cosmos1/models/diffusion/inference/【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考