模型中心

Qwen 系列(通义千问)

全球最受欢迎的国产开源模型系列,从 0.6B 到 235B 全尺寸覆盖,中文与多语言能力一流,支持 O 系列思维链推理与 MoE 架构,一张 RTX 3060 就能本地跑起来。

中文通用开源全尺寸
★★★★★ 阿里巴巴 / 通义实验室

DeepSeek 系列

以 R1 系列引爆全球的国产推理模型,MIT 协议、数学与代码能力顶级,本地部署资料丰富,7B 蒸馏版在笔记本上即可体验「慢思考」。

中文推理MoE开源
★★★★★ 深度求索(DeepSeek)

Llama 系列

Meta 的开源旗舰系列,业界微调生态最庞大,8B 单卡可跑、70B 双卡可跑,是全球本地部署教程的「业界标准」。

英文通用旗舰开源
★★★★★ Meta AI(原 Facebook AI)

Gemma 系列

Google 的轻量开源系列,尺寸小、效率高,Gemma 3 号称「一张 RTX 3090 跑 27B」,还支持多模态与超长上下文。

多语言轻量官方开源
★★★★★ Google DeepMind

Mistral 系列

欧洲最强开源模型厂牌,8x7B/8x22B MoE 架构在 24GB 级别用稀疏算力吊打同尺寸稠密模型,Apache 许可适合商用。

欧洲MoE指令微调开源
★★★★★ Mistral AI(法国)

Stable Diffusion

开源文生图的事实标准,生态与模型库极其庞大,ComfyUI + SDXL 是本地绘画最稳定的组合。

文生图图生图开源ComfyUI
★★★★★ Stability AI

Flux

Stable Diffusion 核心团队出走后的最新旗舰,细节与文字渲染大幅超越 SDXL,dev 版开源可本地部署。

文生图高质量开源新技术
★★★★★ Black Forest Labs(黑森林工作室)

SDXL

Stable Diffusion 的 2.0 时代大版本,原生 1024 分辨率 + 两阶段模型,社区模型库最成熟、风格覆盖最广。

文生图大模型开源1024
★★★★★ Stability AI

Wan(通义万相)

阿里开源的文生视频模型,中文指令友好、可本地运行,1.3B 轻量版 12GB 显卡就能玩,14B 高清版 4090 可跑。

文生视频图生视频中文开源
★★★★★ 阿里巴巴 / 通义实验室

Hunyuan Video

腾讯开源的 13B 文生视频模型,人物一致性与中文场景表现好,4090 显卡即可本地生成短视频。

文生视频腾讯开源多模态
★★★★★ 腾讯

CogVideo

智谱开源的文生视频模型,2B 轻量版 12GB 显卡可跑,支持首尾帧控制,是入门本地视频生成的低门槛选择。

文生视频图生视频开源智谱
★★★★★ 智谱AI / 清华

Whisper

OpenAI 开源的多语言语音识别模型,准确率高、本地运行免费,视频/会议/播客转写首选,几行命令即可部署。

语音识别转写OpenAI开源
★★★★★ OpenAI

F5-TTS

轻量级开源语音合成模型,几行代码克隆任意音色、输出自然语音,RTX 3060 即可流畅本地运行。

语音合成克隆音色开源TTS
★★★★★ F5-TTS 社区项目(上海 AI 实验室等)

CosyVoice

阿里的强情感 TTS,支持音色克隆+情感+口播风格控制,中文效果极佳,Apache 协议完全免费商用。

语音合成情感克隆阿里
★★★★★ 阿里巴巴 / FunAudioLLM

GPT-Vision

OpenAI 的闭源视觉问答模型,图像理解与文档解析能力顶级,API 接入即用,适合无需本地部署的团队。

视觉问答多模态GPTAPI
★★★★★ OpenAI

Qwen-VL

阿里的开源视觉语言模型,中文 OCR 与截图理解能力突出,一张 12GB 显卡即可本地部署,替代闭源视觉 API。

视觉中文开源OCR
★★★★★ 阿里巴巴 / 通义实验室

LLaVA

经典开源视觉助手模型,架构简洁、微调门槛低,搭配 llama.cpp 生态可在消费级显卡本地看图会话。

视觉开源轻量学术
★★★★★ Open-VCLab / 微软研究与高校合作

GLM 系列(智谱)

智谱开源的对话模型系列,ChatGLM 进化到 GLM-4,Agent 工具调用能力突出,9B 开源版在消费级显卡即可本地部署,中文能力稳居第一梯队。

中文通用开源全尺寸
★★★★★ 智谱AI(Zhipu AI)

Kimi 系列(月之暗面)

月之暗面开源的 MoE 大模型,以超长上下文与深度推理著称,K2 蒸馏版支持本地部署,是国产推理模型新势力。

中文长文本推理MoE
★★★★★ 月之暗面(Moonshot AI)

MiniMax 系列

MiniMax 开源的 456B MoE 大模型,拥有超长上下文,Agent 与代码能力突出,适合企业级长文本与智能体场景。

中文MoE开源长文本
★★★★★ MiniMax(稀宇科技)

Yi 系列(零一万物)

零一万物李开复团队的开源大模型,中文质量扎实、尺寸覆盖全,Apache 2.0 许可适合商用部署。

中文通用开源全尺寸
★★★★★ 零一万物(01.AI)

Baichuan 系列(百川智能)

百川智能开源的国产中文大模型,7B/13B 两个经典尺寸在学术与轻部署场景仍被广泛使用。

中文通用开源学术
★★★★★ 百川智能(Baichuan)

InternLM 系列(书生)

上海AI实验室开源的「书生」大模型,中文评测强、工具调用稳定,1.8B 轻量版手机级显存可跑。

中文通用开源学术
★★★★★ 上海人工智能实验室

Phi 系列(微软)

微软的「小而强」小语言模型,用高质量合成数据训练,3.8B 在手机级显存达到大模型级推理能力。

英文轻量小模型微软
★★★★★ Microsoft Research

OLMo 系列(AI2)

AI2 推出的「真正开放」大模型,不仅权重开源,连训练数据与训练代码全部公开,是科研与复现首选。

英文开放开源科研
★★★★★ Allen Institute for AI(AI2)

Stable Diffusion 3 / 3.5

Stability AI 新一代文生图,采用多模态 DiT 架构,文字渲染与指令跟随大幅提升,是 SD 生态的下一代底座。

文生图开源新架构高质量
★★★★★ Stability AI

PixArt-α

华为等团队开源的极高效 DiT 文生图,仅 0.6B 参数即可媲美 SDXL 画质,低显存用户首选。

文生图开源高效DiT
★★★★★ 华为诺亚 / 港大等

Kolors 可图

快手开源的 5B 文生图大模型,对中文提示词理解优秀、画质细腻,支持文字渲染与真实感风格。

文生图中文开源快手
★★★★★ 快手(Kuaishou)

DALL·E 3

OpenAI 的旗舰文生图模型,提示词理解力天花板,无需部署即可通过 API 生成高质量图片。

文生图闭源APIOpenAI
★★★★★ OpenAI

Midjourney

目前视觉风格最受欢迎的文生图服务,艺术质感与美学无可替代,订阅即可使用。

文生图闭源订阅艺术风格
★★★★★ Midjourney, Inc.

Kling 可灵

快手的旗舰视频生成模型,中文场景与物理运动表现优秀,效果位居全球第一梯队。

文生视频图生视频快手闭源
★★★★★ 快手(Kuaishou)

Mochi 1

Genmo 开源的 10B 视频生成模型,运动质量与提示词遵循能力突出,开源视频模型中的高质量之选。

文生视频开源DiT运动控制
★★★★★ Genmo

LTX-Video

Lightricks 开源的轻量视频生成模型,2B 参数、速度快、显存友好,低配显卡也能玩文生视频。

文生视频开源高效Lightricks
★★★★★ Lightricks

Open-Sora

以 Sora 为目标的开源复现项目,全流程开放(训练+推理),支持 16 秒长视频生成。

文生视频开源科研复现
★★★★★ HPC-AI Tech(上海AI实验室)

Sora

OpenAI 的视频生成旗舰,复杂物理与镜头叙事能力强,定义了 2024 年文生视频的标杆。

文生视频闭源OpenAI旗舰
★★★★★ OpenAI

Veo

Google 的视频生成旗舰,最高支持 4K 输出与音频生成,物理真实度与画质顶级。

文生视频闭源Google高清
★★★★★ Google DeepMind

Runway Gen-3

Runway 的旗舰视频生成与转绘工具,支持文生视频、图生视频与视频风格转绘,影视后期常用。

文生视频闭源Runway转绘
★★★★★ Runway

Vidu

清华系生数科技的旗舰视频模型,多主体一致性与图生视频表现出色,国产闭源视频生成代表。

文生视频闭源生数科技图生视频
★★★★★ 生数科技(ShengShu)

PixVerse

全球用户量领先的免费文生视频平台,效果出色、上手简单,适合大众短视频创作。

文生视频闭源免费社区
★★★★★ PixVerse(爱诗科技)

GPT-SoVITS

现象级中文语音克隆模型,零样本克隆音色、效果惊艳,是中文 TTS 克隆的事实标准。

语音合成克隆音色开源中文
★★★★★ GPT-SoVITS 开源社区

Bark

Suno 开源的全能语音模型,不仅能说话,还能生成笑声、哭声、背景音效甚至简单音乐。

语音合成声音效果开源Suno
★★★★★ Suno(原 TTS 团队)

XTTS

Coqui 开源的跨语言语音克隆,一段音频即可克隆音色并用其他语言朗读,多语言场景首选。

语音合成克隆音色开源多语言
★★★★★ Coqui AI

VITS

经典端到端 TTS 里程碑,单模型合成自然语音,是众多二次元声库与语音助手的底层引擎。

语音合成开源经典端到端
★★★★★ LINE / 学术社区

Fish-Speech

Fish Audio 的开源语音引擎,支持音色克隆、多语言与实时全双工对话,速度与效果俱佳。

语音合成克隆开源多语言
★★★★★ Fish Audio(子墨科技)

Tortoise-TTS

老牌高质量 TTS,音色克隆自然、支持语音风格调节,是研究 TTS 的上好开源样本。

语音合成克隆开源高质量
★★★★★ James Betker / 社区

InternVL

上海AI实验室的开源视觉语言模型,OCR 与图表理解能力国际领先,多尺寸可选,本地部署首选之一。

视觉中文开源OCR
★★★★★ 上海人工智能实验室

MiniCPM-V

面壁智能的端侧多模态模型,8B 小尺寸实现强视觉能力,可部署到手机与边缘设备。

视觉轻量开源端侧
★★★★★ 面壁智能(ModelBest)

CogVLM

清华系的开源视觉语言基础模型,视觉能力与对话能力并重,适合高阶视觉应用与研究。

视觉开源智谱基础模型
★★★★★ 智谱AI / 清华

Gemini

Google 的原生多模态旗舰,文本、图像、视频、音频一体理解,超长上下文是最大杀手锏。

多模态闭源GoogleAPI
★★★★★ Google DeepMind

Yi-VL

零一万物基于 Yi 的中文视觉模型,轻量可本地部署,中文图文理解均衡。

视觉中文开源轻量
★★★★★ 零一万物(01.AI)