模型中心

Qwen 系列(通义千问)
全球最受欢迎的国产开源模型系列,从 0.6B 到 235B 全尺寸覆盖,中文与多语言能力一流,支持 O 系列思维链推理与 MoE 架构,一张 RTX 3060 就能本地跑起来。

DeepSeek 系列
以 R1 系列引爆全球的国产推理模型,MIT 协议、数学与代码能力顶级,本地部署资料丰富,7B 蒸馏版在笔记本上即可体验「慢思考」。

Llama 系列
Meta 的开源旗舰系列,业界微调生态最庞大,8B 单卡可跑、70B 双卡可跑,是全球本地部署教程的「业界标准」。

Gemma 系列
Google 的轻量开源系列,尺寸小、效率高,Gemma 3 号称「一张 RTX 3090 跑 27B」,还支持多模态与超长上下文。

Mistral 系列
欧洲最强开源模型厂牌,8x7B/8x22B MoE 架构在 24GB 级别用稀疏算力吊打同尺寸稠密模型,Apache 许可适合商用。

Stable Diffusion
开源文生图的事实标准,生态与模型库极其庞大,ComfyUI + SDXL 是本地绘画最稳定的组合。

Flux
Stable Diffusion 核心团队出走后的最新旗舰,细节与文字渲染大幅超越 SDXL,dev 版开源可本地部署。

SDXL
Stable Diffusion 的 2.0 时代大版本,原生 1024 分辨率 + 两阶段模型,社区模型库最成熟、风格覆盖最广。

Wan(通义万相)
阿里开源的文生视频模型,中文指令友好、可本地运行,1.3B 轻量版 12GB 显卡就能玩,14B 高清版 4090 可跑。

Hunyuan Video
腾讯开源的 13B 文生视频模型,人物一致性与中文场景表现好,4090 显卡即可本地生成短视频。

CogVideo
智谱开源的文生视频模型,2B 轻量版 12GB 显卡可跑,支持首尾帧控制,是入门本地视频生成的低门槛选择。

Whisper
OpenAI 开源的多语言语音识别模型,准确率高、本地运行免费,视频/会议/播客转写首选,几行命令即可部署。

F5-TTS
轻量级开源语音合成模型,几行代码克隆任意音色、输出自然语音,RTX 3060 即可流畅本地运行。

CosyVoice
阿里的强情感 TTS,支持音色克隆+情感+口播风格控制,中文效果极佳,Apache 协议完全免费商用。

GPT-Vision
OpenAI 的闭源视觉问答模型,图像理解与文档解析能力顶级,API 接入即用,适合无需本地部署的团队。

Qwen-VL
阿里的开源视觉语言模型,中文 OCR 与截图理解能力突出,一张 12GB 显卡即可本地部署,替代闭源视觉 API。

LLaVA
经典开源视觉助手模型,架构简洁、微调门槛低,搭配 llama.cpp 生态可在消费级显卡本地看图会话。

GLM 系列(智谱)
智谱开源的对话模型系列,ChatGLM 进化到 GLM-4,Agent 工具调用能力突出,9B 开源版在消费级显卡即可本地部署,中文能力稳居第一梯队。

Kimi 系列(月之暗面)
月之暗面开源的 MoE 大模型,以超长上下文与深度推理著称,K2 蒸馏版支持本地部署,是国产推理模型新势力。

MiniMax 系列
MiniMax 开源的 456B MoE 大模型,拥有超长上下文,Agent 与代码能力突出,适合企业级长文本与智能体场景。

Yi 系列(零一万物)
零一万物李开复团队的开源大模型,中文质量扎实、尺寸覆盖全,Apache 2.0 许可适合商用部署。

Baichuan 系列(百川智能)
百川智能开源的国产中文大模型,7B/13B 两个经典尺寸在学术与轻部署场景仍被广泛使用。

InternLM 系列(书生)
上海AI实验室开源的「书生」大模型,中文评测强、工具调用稳定,1.8B 轻量版手机级显存可跑。

Phi 系列(微软)
微软的「小而强」小语言模型,用高质量合成数据训练,3.8B 在手机级显存达到大模型级推理能力。

OLMo 系列(AI2)
AI2 推出的「真正开放」大模型,不仅权重开源,连训练数据与训练代码全部公开,是科研与复现首选。

Stable Diffusion 3 / 3.5
Stability AI 新一代文生图,采用多模态 DiT 架构,文字渲染与指令跟随大幅提升,是 SD 生态的下一代底座。

PixArt-α
华为等团队开源的极高效 DiT 文生图,仅 0.6B 参数即可媲美 SDXL 画质,低显存用户首选。

Kolors 可图
快手开源的 5B 文生图大模型,对中文提示词理解优秀、画质细腻,支持文字渲染与真实感风格。

DALL·E 3
OpenAI 的旗舰文生图模型,提示词理解力天花板,无需部署即可通过 API 生成高质量图片。

Midjourney
目前视觉风格最受欢迎的文生图服务,艺术质感与美学无可替代,订阅即可使用。

Kling 可灵
快手的旗舰视频生成模型,中文场景与物理运动表现优秀,效果位居全球第一梯队。

Mochi 1
Genmo 开源的 10B 视频生成模型,运动质量与提示词遵循能力突出,开源视频模型中的高质量之选。

LTX-Video
Lightricks 开源的轻量视频生成模型,2B 参数、速度快、显存友好,低配显卡也能玩文生视频。

Open-Sora
以 Sora 为目标的开源复现项目,全流程开放(训练+推理),支持 16 秒长视频生成。

Sora
OpenAI 的视频生成旗舰,复杂物理与镜头叙事能力强,定义了 2024 年文生视频的标杆。

Veo
Google 的视频生成旗舰,最高支持 4K 输出与音频生成,物理真实度与画质顶级。

Runway Gen-3
Runway 的旗舰视频生成与转绘工具,支持文生视频、图生视频与视频风格转绘,影视后期常用。

Vidu
清华系生数科技的旗舰视频模型,多主体一致性与图生视频表现出色,国产闭源视频生成代表。

PixVerse
全球用户量领先的免费文生视频平台,效果出色、上手简单,适合大众短视频创作。

GPT-SoVITS
现象级中文语音克隆模型,零样本克隆音色、效果惊艳,是中文 TTS 克隆的事实标准。

Bark
Suno 开源的全能语音模型,不仅能说话,还能生成笑声、哭声、背景音效甚至简单音乐。

XTTS
Coqui 开源的跨语言语音克隆,一段音频即可克隆音色并用其他语言朗读,多语言场景首选。

VITS
经典端到端 TTS 里程碑,单模型合成自然语音,是众多二次元声库与语音助手的底层引擎。

Fish-Speech
Fish Audio 的开源语音引擎,支持音色克隆、多语言与实时全双工对话,速度与效果俱佳。

Tortoise-TTS
老牌高质量 TTS,音色克隆自然、支持语音风格调节,是研究 TTS 的上好开源样本。

InternVL
上海AI实验室的开源视觉语言模型,OCR 与图表理解能力国际领先,多尺寸可选,本地部署首选之一。

MiniCPM-V
面壁智能的端侧多模态模型,8B 小尺寸实现强视觉能力,可部署到手机与边缘设备。

CogVLM
清华系的开源视觉语言基础模型,视觉能力与对话能力并重,适合高阶视觉应用与研究。

Gemini
Google 的原生多模态旗舰,文本、图像、视频、音频一体理解,超长上下文是最大杀手锏。

Yi-VL
零一万物基于 Yi 的中文视觉模型,轻量可本地部署,中文图文理解均衡。