Genmo 开源 10B 大参数视频模型,提示遵循度强但吃显存
模型介绍
Mochi 1 是 Genmo 2024 年 10 月开源的 10B 文生视频模型,采用自研非对称架构 AsymmDiT——视觉流参数约为文本流的 4 倍,配合 AsymmVAE 高效压缩,用单个 T5-XXL 编码提示,提示遵循度与动作质量在开源模型中名列前茅。模型 Apache-2.0 发布,官方提供含上下文并行的推理脚本。不过 10B 参数与 480P/5.5 秒规格对显存要求苛刻,一般需 40GB 以上流畅原生运行,消费级体验需 GGUF 量化 + offload。
模型基本信息
开发机构Genmo
模型版本Mochi 1(Preview)
参数规模10B(AsymmDiT)+ AsymmVAE
模型类型文生视频扩散模型(Flow Matching)
许可证Apache-2.0
上下文长度N/A(视频)
发布日期2024-10
模型架构Asymmetric DiT + AsymmVAE(T5-XXL 文本编码)
模型能力
中文能力一般(提示词以英文为主)
英文能力很强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力文生视频(官方)
工具调用N/A
模型版本
Mochi-1 Preview10B(480P,5.5秒,30fps)
模型获取
部署方式
Diffusers官方推理脚本(context parallel)ComfyUI(社区支持)
显存需求
FP16 权重约25GB(实际生成需40GB+)
GGUF 量化约14GB(RTX 4090 可跑但较慢)
硬件推荐
RTX 3060不建议,显存远不足
RTX 3090需 GGUF 量化 + offload,仍吃力
RTX 4090GGUF 量化可跑,速度偏慢
RTX 5090流畅运行量化版
Mac不建议,显存架构不适配
推荐配置
入门RTX 4090 + GGUF 量化
进阶RTX 5090 / 40GB+ 单卡
专业多卡 A100 / 官方云 API
为什么选择这个模型
- 10B 大参数 + 非对称架构,提示遵循度开源顶尖
- Apache-2.0 完全开放可商用
- 官方开源含上下文并行的推理管线
- 动作连贯性与文本-视频一致性平衡好
模型优点
- 提示词细节还原度高
- 动作自然、鬼影少
- 完全开放协议,下载即用
- 架构简洁,二次开发友好
模型缺点
- 显存需求极高,消费级体验差
- 仅 480P,分辨率和时长有限
- 中文明提示理解一般
- 生态与 LoRA 远少于 Wan/CogVideo
- 推理速度慢,社区集成少
适合场景
- 高显存(40GB+)用户研究大参数视频模型
- 对提示遵循度敏感的中英文学术试验
- 愿意接受量化折损的进阶玩家
不适合场景
- 低/中端显卡用户
- 中文提示词为主的内容创作
- 追求快速出片与丰富滤镜的工作流
部署教程
vLLM
视频模型一般不走 vLLM。推荐官方仓库:安装依赖后 python 推理脚本下载 safetensors(dit/encoder/decoder)生成视频;低显存可用 GGUF 量化版并在 ComfyUI 中加载。RTX 4090 用 GGUF Q8 大约可运行但单段耗时较长
智算工坊实验室
实测速度5.5秒片段约10-20分钟(RTX 4090,GGUF 量化)
显存占用约14GB(GGUF Q8)
功耗整机约400W
不同 GPU 对比需大显存;4090 量化勉强,A100 级流畅
常见问题 FAQ
Mochi 1 显存要求很高?
是,FP16 下生成过程需要 40GB+ 显存。RTX 4090 用 GGUF 量化(Q8~Q4)+ offload 可以运行,但耗时明显增加,建议有 40GB+ 大显存再原生体验。
Mochi 和 Wan 谁更强?
提示遵循度 Mochi 强势,但分辨率(480P)、中文支持、生态与硬件友好度都远不如 Wan,本地日常创作推荐 Wan。
可以商用吗?
Apache-2.0,可自由商用。注意模型分辨率与 5.5 秒时长限制,商业上线需自行评测质量。
相关模型
相关工具
相关硬件
数据来源
- https://huggingface.co/genmo/mochi-1-preview
- https://github.com/genmoai/mochi
- https://www.genmo.ai/