PixArt-α

★★★★★ 4.2 分

华为等团队开源的极高效 DiT 文生图,仅 0.6B 参数即可媲美 SDXL 画质,低显存用户首选。

文生图开源高效DiT
参数量PixArt-α(0.6B)/ Sigma
模型类型扩散文生图(DiT,训练成本极低)
许可证Apache 2.0
开发者华为诺亚 / 港大等
★★★★★ 4.2

仅 0.6B 参数的高效 DiT,低显存用户首选

图像生成开源DiT高效

模型介绍

PixArt-α 是华为诺亚、香港大学等团队联合开源的 Diffusion Transformer(DiT)文生图模型,参数量仅约 0.6B,训练成本约为 SDXL 的千分之一。它以 T5-XXL 文本编码与高效交叉注意力实现接近 SDXL 的画质,原生 1024×1024,推理更快、显存占用低。2023 年 11 月以 OpenRAIL++-M 许可开源,PixArt-Σ 版本进一步强化文字渲染,对显存有限又爱 DiT 的用户极具性价比。

模型基本信息

开发机构华为诺亚方舟实验室 / 香港大学等(PixArt-alpha 社区)
模型版本PixArt-XL-2-1024-MS / PixArt-Σ
参数规模0.6B
模型类型文生图 Diffusion Transformer(DiT)
许可证CreativeML OpenRAIL++-M(HF 标签 openrail++)
上下文长度N/A(图像,原生 1024×1024)
发布日期2023-11-04(HF createdAt)
模型架构DiT(Transformer 扩散)+ T5-XXL 文本编码 + 高效交叉注意力、class-free guidance

模型能力

中文能力中
英文能力较强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力较强(文生图,文字渲染弱于 Flux/SD3)
工具调用N/A

模型版本

PixArt-XL-2-1024-MS0.6BPixArt-Σ(Sigma)0.6B(文字渲染增强)

模型获取

部署方式

DiffusersComfyUIsafetensors

显存需求

FP16约4GB 权重(运行约5-8GB)

硬件推荐

RTX 3060可流畅运行全流程
RTX 3090极速,可批量叠加放大
RTX 4090极速体验
RTX 5090无压力运行
MacM 系列 16GB 统一内存可跑

推荐配置

入门RTX 3060 12G + FP16(权重约4GB)
进阶RTX 4060/4080 + 高清放大工作流
专业数据中心卡 + 批量出图

为什么选择这个模型

  • 极小参数:0.6B 尽显显存,低配机友好
  • 训练高效:低成本复现,学术价值高
  • DiT 架构:社区关注的新方向
  • ComfyUI 支持:工作流现成,开箱即用

模型优点

  • 参数量小、推理快、显存占用低
  • Apache 系开源(OpenRAIL++-M),可商用
  • 原生 1024×1024 高清输出
  • 学术团队背书,论文与代码公开
  • 低配硬件(8GB 卡)也能体验

模型缺点

  • 精细细节与复杂人体结构弱于 SDXL/Flux
  • 图片内文字渲染一般
  • 模型生态与 LoRA 数量远少于 SDXL
  • 社区工作流与教程相对稀缺

适合场景

  • 低显存设备的本地文生图
  • DiT 架构研究与复现
  • 快速出草图、概念稿
  • 风格探索与批量试稿

不适合场景

  • 追求顶级画质(建议 Flux/SD3.5)
  • 需要准确文字渲染的海报类创作
  • 需要海量 LoRA 生态支撑的场景
  • 专业电商级细节输出

部署教程

vLLM
图像模型一般不用 vLLM,推荐 Diffusers 一行启动:pip install diffusers && from diffusers import PixArtAlphaPipeline,加载 PixArt-alpha/PixArt-XL-2-1024-MS 即可;ComfyUI 也内置了 PixArt 支持

智算工坊实验室

实测速度1024×1024 约4s(RTX 3060 12G,Diffusers)
显存占用权重约4GB,运行约5-8GB(fp16)
功耗整机约250W
不同 GPU 对比RTX 3060 即可流畅;更高显卡主要提升批量与放大效率
→ 查看实验室数据

常见问题 FAQ

PixArt-α 和 SDXL 谁好?

PixArt 参数小、速度快、显存低;SDXL 生态与模型库更庞大。低配机选 PixArt。

能商用吗?

模型采用 CreativeML OpenRAIL++-M 许可,允许商用,但需遵守相应条款(避免歧视性用途等)。

它能生成中文文字吗?

PixArt-Σ 对文字渲染较第一代有提升,但复杂中文字符仍不如 SD3/Flux,建议用于插画而非海报文字。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/PixArt-alpha/PixArt-XL-2-1024-MS
  • https://modelscope.cn/models/AI-ModelScope/PixArt-XL-2-1024-MS
  • https://github.com/PixArt-alpha/PixArt-alpha