Open-Sora

★★★★★ 4.3 分

以 Sora 为目标的开源复现项目,全流程开放(训练+推理),支持 16 秒长视频生成。

文生视频开源科研复现
参数量Open-Sora 2.0(3B / 11B)
模型类型文生视频(Sora 开源复现路线)
许可证Apache 2.0
开发者HPC-AI Tech(上海AI实验室)
★★★★★ 4.4

上海AI实验室开源全栈视频方案,STDiT 架构引领长视频探索

视频生成开源DiT研究友好

模型介绍

Open-Sora 是上海AI实验室 HPC-AI Tech(Colossal-AI 团队)开源的全栈视频生成项目。2024 年 3 月起持续迭代:v1 提出 STDiT(时空 DiT)架构并开源训练代码、数据集与推理工具;2025 年 3 月发布 Open-Sora 2.0,用约 20 万美元成本训练出 11B 大模型,在 VBench 与人工评测上与 11B HunyuanVideo 相当。全套代码、checkpoint 与训练配方 Apache-2.0 开放,覆盖文生、图生与长视频。

模型基本信息

开发机构HPC-AI Tech(上海AI实验室 / Colossal-AI)
模型版本Open-Sora 1.0 / 1.2 / 2.0 系列(STDiT)
参数规模1.1B(1.2)/ 11B(2.0)
模型类型文生视频 / 图生视频扩散模型
许可证Apache-2.0
上下文长度N/A(视频)
发布日期2024-03(v1);2025-03(2.0)
模型架构STDiT(时空 DiT)+ 3D VAE(2.0 复用 Flux-AE)

模型能力

中文能力一般至强(取决于收敛训练数据,英文更稳)
英文能力强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力文生视频 + 图生视频 + 长视频
工具调用N/A

模型版本

Open-Sora 1.2(STDiT-v2/v3)1.1BOpen-Sora 2.011B(T2V + I2V 一体)Open-Sora VAE 1.2/1.3配套视频自编码器

模型获取

部署方式

官方仓库(训练/推理一体)Diffusers(社区)ComfyUI(社区)

显存需求

1.1B约5GB
11B BF16约22GB
11B 量化约13GB

硬件推荐

RTX 3060可跑 1.1B
RTX 3090可跑 11B 量化
RTX 409011B 低分辨率可行
RTX 509011B 更流畅
MacM 系列可跑 1.1B

推荐配置

入门RTX 3060 + 1.1B
进阶RTX 4090 + 11B 低分辨率
专业多卡 A100 复现 2.0 训练 / 长视频

为什么选择这个模型

  • 全栈开源:训练代码 + 数据集工具 + 推理
  • 20 万美元低成本复现商业级模型的标杆案例
  • 2.0 在 VBench 与 11B HunyuanVideo 打平
  • STDiT 架构是研究长视频与时序建模的蓝图

模型优点

  • Apache-2.0 彻底开放,可复现实验
  • 从 1.1B 到 11B 覆盖消费级到专业级
  • 支持文生视频、图生视频与长视频拼接
  • 学术社区活跃,论文与教程丰富

模型缺点

  • 开箱即用程度不如 Wan/CogVideo 成熟
  • 11B 权重与推理开销较大
  • 官方主推自训练,端着跑需一定动手能力
  • 默认可视效果与商业级(可灵/Sora)有差距

适合场景

  • 视频生成方向的研究与复现
  • 在自有数据上训练定制模型的团队
  • 长视频拼接实验
  • 技术向开发者、教学课堂

不适合场景

  • 希望下载即用的普通内容创作者
  • 追求顶级画质的商用出片
  • 低显存又要大模型参数的场景

部署教程

vLLM
视频模型一般不走 vLLM。推荐官方仓库:按文档安装依赖并下载 checkpoint,用 scripts/inference.py 生成视频;2.0 需下载 T5-XXL 与 CLIP 文本编码器。想做图生视频/长视频可参考官方 config 与示例,社区在 ComfyUI 中也有集成

智算工坊实验室

实测速度5秒片段约2-5分钟(RTX 4090,11B 低分辨率)
显存占用约13-22GB(11B)
功耗整机约400W
不同 GPU 对比1.1B 适合入门卡;11B 需 4090 级
→ 查看实验室数据

常见问题 FAQ

Open-Sora 2.0 的 11B 模型怎么下载?

在 Hugging Face(hpcai-tech/Open-Sora-v2)或 ModelScope 获取 checkpoint,同时下载 T5-XXL 与 CLIP 文本编码器,按官方 README 的推理脚本运行即可。

2.0 真的只要 20 万美元训练?

官方论文称训练成本约 20 万美元,通过层级式训练(先在低分辨率,再用 Flux 初始化、蒸馏与数据优化)大幅降低算力消耗,代价是需要自行跑流程。

跟 Wan/可灵比怎么样?

开源队伍里居前列(论文称与 11B HunyuanVideo 相当),但开箱质量、生态与中文支持不如 Wan,更弱于商业级可灵,定位偏研究与训练。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/hpcai-tech/Open-Sora-v2
  • https://github.com/hpcaitech/Open-Sora
  • https://arxiv.org/abs/2503.09642