24GB显存也能跑物理世界视频生成:Cosmos安装到出片实战指南 📅 发布时间:2026/9/14 1:49:38 👁 浏览次数: 24GB显存也能跑物理世界视频生成Cosmos安装到出片实战指南【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos如果你在做机器人操作、自动驾驶感知这类物理AI方向最缺的往往不是算法而是足量、可控、成本低的场景视频。NVIDIA Cosmos 就是一个开源的世界基础模型World Foundation Model平台它把预训练的扩散模型、自回归模型和视频分词器打包在一起让你用文本或一段已有素材就能生成符合物理直觉的模拟视频用于机器人、自动驾驶汽车、智能基础设施的训练数据供给。本文按跑通—出片—调优—踩坑的顺序带你从零走到能批量产出物理世界视频。谁需要用它造训练视频一句话你需要可控的合成视频生产线而不是更多真实拍摄时。典型场景有两类。一类是机器人公司想覆盖仓库取货、货架抓取等长尾场景实拍成本高、事故风险大用 Text2World 按描述批量出片更划算。另一类是自动驾驶团队已有某路口的一段行车视频想让它在不同天气、车流下续写更多分支这正是 Video2World 的输入输出模式。平台本身包含三块资产预训练世界模型权重可商用、基于 NeMo 的训练脚本Apache 2.0以及把视频压缩成连续/离散 token 的视频分词器。两条能力线各自生成什么先分清两条线后面所有命令都建立在这个区分上Text2World输入是一段文本描述输出是 121 帧视频。对应模型为 Cosmos-1.0-Diffusion-7B-Text2World 和 14B 版本推理入口是 cosmos1/models/diffusion/inference/text2world.py。Video2World输入是一张图片或一段视频可再加文本输出是把这段视觉起点续写成完整视频。对应 7B/14B Video2World 模型入口是 cosmos1/models/diffusion/inference/video2world.py。两条线共用同一个 8x8x8 压缩的视频分词器和一套强制启用的安全护栏。默认输出为 1280x704、24fps、35 步扩散采样、guidance 7.0这些参数在推理脚本里都有对应命令行开关。从一台干净机器到出片要几步这节把系统要求、Docker 环境和模型下载合并成一条跑通路径全部四步走完你才有资格执行推理命令。环境基线Ubuntu 20.04/22.04/24.04官方只测过这三个版本NVIDIA GPU24GB 起步已装 NVIDIA Container Toolkit 的 Docker预留至少 50GB 磁盘。第 1 步克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/cosmos7/cosmos cd cosmos第 2 步构建镜像并启动容器仓库自带的 Dockerfile 已经配好运行依赖挂载当前目录到/workspace后 attach 进去docker build -t cosmos . docker run -d --name cosmos_container --gpus all --ipchost -it -v $(pwd):/workspace cosmos docker attach cosmos_container完成后你的 shell 已经在容器内后续所有命令都在这里面执行。详细步骤可对照 INSTALL.md。第 3 步拿 Hugging Face 权限。两件事缺一不可在 Hugging Face 的 token 设置页生成一个权限级别为 Read 的访问令牌默认是 Fine-grained要手动改掉然后在 Mistral AI 的 Pixtral-12B 模型页点击 Agree and access repository——Video2World 的提示上采样器依赖这个权重不授权下载脚本会卡住。第 4 步登录并下载权重huggingface-cli login PYTHONPATH$(pwd) python cosmos1/scripts/download_diffusion.py \ --model_sizes 7B 14B \ --model_types Text2World Video2World这一步会顺带拉下 Guardrail、8x8x8 分词器和 Text2World 提示上采样器若选了 Video2World还会自动转换 Pixtral-12B 权重。跑完后checkpoints/目录下应能看到各模型子目录每个模型目录下有model.pt和config.json目录结构以 cosmos1/models/diffusion/README.md 为准。第一次生成两个用例各一条命令权重就位后先用 7B 跑通两条线各留一条最小命令。用例一文本生成世界。提示词建议直接写仓库里的示例风格单一场景、静态机位、带材质和光照描述PROMPTA sleek, humanoid robot stands in a vast warehouse filled with neatly stacked cardboard boxes on industrial shelves. The robots metallic body gleams under the bright, even lighting. A glowing blue light emanates from its chest. The camera remains static. PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/text2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Text2World \ --prompt $PROMPT \ --offload_prompt_upsampler \ --video_save_name first_text2world跑完后outputs/下会出现first_text2world.mp4和一个同名.txt记录上采样后的实际提示词对比它和你写的原文很有参考价值。注意--offload_prompt_upsampler在 H100 上是必选项24GB 卡上则建议加满所有 offload见后文表格。用例二从一张图续写视频。仓库自带了一张公路场景示例图输入帧数支持 1 或 9PYTHONPATH$(pwd) python cosmos1/models/diffusion/inference/video2world.py \ --checkpoint_dir checkpoints \ --diffusion_transformer_dir Cosmos-1.0-Diffusion-7B-Video2World \ --input_image_or_video_path cosmos1/models/diffusion/assets/v1p0/video2world_input0.jpg \ --num_input_frames 1 \ --offload_prompt_upsampler \ --video_save_name first_video2world这条线里提示上采样器默认开启且由 Pixtral 看图写提示词你给的--prompt在默认配置下不参与想完全自己控制描述就加--disable_prompt_upsampler。需要一次出多条时把--prompt换成--batch_input_path指向一个 JSONL 文件Text2World 每行一个{prompt: ...}Video2World 每行一个{visual_input: path}再用--video_save_folder指定输出目录即可示例文件在cosmos1/models/diffusion/assets/v1p0/batch_inputs/下。产出质量靠什么调这节把提示词写法、模型选型、显存策略三件事收拢到一处都是直接影响成片观感的旋钮。提示词怎么写才稳。官方给出的三条建议一次只描述一个场景多场景会诱发不必要的镜头切换少写运镜指令相机控制仍在开发中长度以 120 词左右为甜区形容词要落到可见的细节上。另外提示超过 250 词时脚本会自动跳过上采样器以保证稳健性上采样器偶尔会加戏偏题遇到这种情况就用--disable_prompt_upsampler关掉改手动扩写。7B 还是 14BDiffusion 还是 Autoregressive。7B 和 14B 的区别是质量与速度单张 H100 上 7B 约 380 秒/条14B 约 590 秒/条追求单条精细度选 14B追求吞吐选 7B。Diffusion 系四条模型7B/14B × Text2World/Video2World是主力的生成新内容路线Autoregressive 4B/12B 只吃视觉输入可选文本定位是把已有画面往未来推演适合你有真实素材但缺少接下来发生了什么的场景。入门先 7B流程熟了再上 14B 是最省时间的路径。显存不足怎么办。五个可独立开关的 offload 参数分别对应扩散主网络、分词器、T5 文本编码器、提示上采样器和护栏模型按需叠加即可。以下是官方实测峰值显存的取舍表Text2World 场景参考值你的显卡推荐规模建议开启的卸载参数大致峰值显存RTX 3090/409024GB7B五项全开tokenizer、diffusion transformer、T5、prompt upsampler、guardrail~24.4GBA10040GB7B--offload_prompt_upsampler --offload_guardrail_models~57.1GBH10080GB7B 或 14B7B 仅--offload_prompt_upsampler14B 再加--offload_guardrail_models7B ~74GB / 14B ~70.5GB全部卸载的代价是速度变慢批量出片时尤其明显能不开就不开。它有哪些硬限制提前知道边界比出片后被护栏拦截再排查要快。安全护栏不可关输入侧有 blocklist 关键词检查和基于 LLM 的 Aegis 过滤输出侧有视频内容安全分类器和人脸模糊模块人脸一律会被模糊违规内容会被整条拦截日志里会打印 Guardrail blocked。细节见 cosmos1/models/guardrail/README.md。时长锁死在 121 帧--num_video_frames目前只有 121 一个选项想拉长只能靠 Video2World 滚动续写。分辨率是离散档位1:1960x960、4:3960x704、3:4704x960、16:91280x704、9:16704x1280帧率可在 12–40fps 间调。耗时要有预期单条 380–590 秒H100 端到端、不含初始化做批量任务时按小时排期。相机控制不可靠写入提示词的运镜指令大概率被忽略机位最好写成 static。想训自己的或上多卡怎么办两条进阶路线都走 NeMo 框架。后训练post-training用于把预训练模型往你的下游任务上靠diffusion 和 autoregressive 各有一套通用后训练脚本与数据集准备流程入口在 cosmos1/models/POST_TRAINING.md目前通用后训练已支持指令控制、动作控制、相机控制等还在路上。多 GPU 推理只覆盖了 Diffusion Text2World 系列四个模型7B/14B 均可推荐 H100-80GB 或 A100-80GB用法见 cosmos1/models/diffusion/nemo/inference/README.md。下一步清单今天就跑用 7B Text2World 出 3 条不同场景的视频逐条对比输出的.txt上采样提示词感受上采样器改写了什么。显存达标再升级同一提示词换 14B 跑一条肉眼对比细节与物理合理性决定你的主力规格。把单条流程改成 JSONL 批处理先小批量5–10 条验证再放量按 7B 约 6.5 分钟/条排产能。有真实素材就试 Video2World 的--num_input_frames 9对比 1 帧与 9 帧输入下续写的连贯度再决定是否投入后训练。【免费下载链接】cosmosNVIDIA Cosmos is an open platform of world models, datasets, and tools that enables developers to build Physical AI for robots, autonomous vehicles, smart infrastructure, and more.项目地址: https://gitcode.com/GitHub_Trending/cosmos7/cosmos创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考