仅 0.6B 参数的高效 DiT,低显存用户首选
模型介绍
PixArt-α 是华为诺亚、香港大学等团队联合开源的 Diffusion Transformer(DiT)文生图模型,参数量仅约 0.6B,训练成本约为 SDXL 的千分之一。它以 T5-XXL 文本编码与高效交叉注意力实现接近 SDXL 的画质,原生 1024×1024,推理更快、显存占用低。2023 年 11 月以 OpenRAIL++-M 许可开源,PixArt-Σ 版本进一步强化文字渲染,对显存有限又爱 DiT 的用户极具性价比。
模型基本信息
开发机构华为诺亚方舟实验室 / 香港大学等(PixArt-alpha 社区)
模型版本PixArt-XL-2-1024-MS / PixArt-Σ
参数规模0.6B
模型类型文生图 Diffusion Transformer(DiT)
许可证CreativeML OpenRAIL++-M(HF 标签 openrail++)
上下文长度N/A(图像,原生 1024×1024)
发布日期2023-11-04(HF createdAt)
模型架构DiT(Transformer 扩散)+ T5-XXL 文本编码 + 高效交叉注意力、class-free guidance
模型能力
中文能力中
英文能力较强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力较强(文生图,文字渲染弱于 Flux/SD3)
工具调用N/A
模型版本
PixArt-XL-2-1024-MS0.6BPixArt-Σ(Sigma)0.6B(文字渲染增强)
模型获取
部署方式
DiffusersComfyUIsafetensors
显存需求
FP16约4GB 权重(运行约5-8GB)
硬件推荐
RTX 3060可流畅运行全流程
RTX 3090极速,可批量叠加放大
RTX 4090极速体验
RTX 5090无压力运行
MacM 系列 16GB 统一内存可跑
推荐配置
入门RTX 3060 12G + FP16(权重约4GB)
进阶RTX 4060/4080 + 高清放大工作流
专业数据中心卡 + 批量出图
为什么选择这个模型
- 极小参数:0.6B 尽显显存,低配机友好
- 训练高效:低成本复现,学术价值高
- DiT 架构:社区关注的新方向
- ComfyUI 支持:工作流现成,开箱即用
模型优点
- 参数量小、推理快、显存占用低
- Apache 系开源(OpenRAIL++-M),可商用
- 原生 1024×1024 高清输出
- 学术团队背书,论文与代码公开
- 低配硬件(8GB 卡)也能体验
模型缺点
- 精细细节与复杂人体结构弱于 SDXL/Flux
- 图片内文字渲染一般
- 模型生态与 LoRA 数量远少于 SDXL
- 社区工作流与教程相对稀缺
适合场景
- 低显存设备的本地文生图
- DiT 架构研究与复现
- 快速出草图、概念稿
- 风格探索与批量试稿
不适合场景
- 追求顶级画质(建议 Flux/SD3.5)
- 需要准确文字渲染的海报类创作
- 需要海量 LoRA 生态支撑的场景
- 专业电商级细节输出
部署教程
vLLM
图像模型一般不用 vLLM,推荐 Diffusers 一行启动:pip install diffusers && from diffusers import PixArtAlphaPipeline,加载 PixArt-alpha/PixArt-XL-2-1024-MS 即可;ComfyUI 也内置了 PixArt 支持
智算工坊实验室
实测速度1024×1024 约4s(RTX 3060 12G,Diffusers)
显存占用权重约4GB,运行约5-8GB(fp16)
功耗整机约250W
不同 GPU 对比RTX 3060 即可流畅;更高显卡主要提升批量与放大效率
常见问题 FAQ
PixArt-α 和 SDXL 谁好?
PixArt 参数小、速度快、显存低;SDXL 生态与模型库更庞大。低配机选 PixArt。
能商用吗?
模型采用 CreativeML OpenRAIL++-M 许可,允许商用,但需遵守相应条款(避免歧视性用途等)。
它能生成中文文字吗?
PixArt-Σ 对文字渲染较第一代有提升,但复杂中文字符仍不如 SD3/Flux,建议用于插画而非海报文字。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/PixArt-alpha/PixArt-XL-2-1024-MS
- https://modelscope.cn/models/AI-ModelScope/PixArt-XL-2-1024-MS
- https://github.com/PixArt-alpha/PixArt-alpha