Llama 系列

★★★★★ 4.8 分

Meta 的开源旗舰系列,业界微调生态最庞大,8B 单卡可跑、70B 双卡可跑,是全球本地部署教程的「业界标准」。

英文通用旗舰开源
参数量3B / 8B / 13B / 70B / 405B
模型类型通用大语言模型(官方含指令微调版)
许可证Llama 3.1 社区许可(免费商用需附要求)
开发者Meta AI(原 Facebook AI)
★★★★★ 4.9

生态最庞大的开源模型业界标准

英文全能开源生态

模型介绍

Llama 是 Meta 的开源大模型旗舰系列,自 2023 年推出以来定义了开源模型的标准:从 3B 小模型到 405B 超大模型一应俱全,全球微调、量化与部署生态无出其右。2024 年的 Llama 3.1 把上下文拉到 128K,2025 年的 Llama 4 采用 MoE 架构并将上下文进一步扩展至 1M,同时原生支持多模态。标注「llama3.1」的社区许可允许开放商用,是全世界本地部署教程的首选参考对象,8B 在 RTX 3060 单卡即可流畅运行。

模型基本信息

开发机构Meta AI(Meta Platforms)
模型版本Llama 4(2025)/ Llama 3.3
参数规模1B/3B/8B/70B 稠密;405B(3.1);Llama 4 Scout 17B-A1B、Maverick 17B-128E(MoE)
模型类型文本对话 / 多模态(Llama 4/3.2 视觉)
许可证Llama 社区许可(自定义,支持商用)
上下文长度128K(3.1/3.3);1M(Llama 4 Scout)
发布日期2024-07-14(Llama-3.1-8B);2025-04-04(Llama-4)
模型架构Decoder-only Transformer + GQA;Llama 4 采用 MoE + 交错注意力(LlamaForCausalLM 扩展)

模型能力

中文能力中(弱于国产)
英文能力很强
代码能力很强
推理能力强
长文本能力很强(128K~1M)
视觉能力强(Llama 4/3.2 支持视觉)
工具调用强

模型版本

Llama-4-Maverick-17B-128E17B-A? MoE(128 专家)Llama-4-Scout-17B-16E17B-A1B MoE(1M 上下文)Llama-3.3-70B70B 稠密Llama-3.1-8B8B 稠密(单卡首选)Llama-3.2-3B3B 稠密(轻量)

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

Llama-3.2-3B Q4约2GB
Llama-3.1-8B Q4约6GB
Llama-4-Scout Q4约10GB
Llama-3.3-70B Q4约40GB

硬件推荐

RTX 3060Llama 1B~8B(Q4)
RTX 30908B 舒适,Llama 4 Scout Q4 约10GB
RTX 409014B~32B,Scout 满载
RTX 509032B~70B(Q4)
MacApple Silicon 8B~27B 流畅

推荐配置

入门RTX 3060 12G + Llama-3.2-3B Q4 约2GB 或 8B Q4 约6GB
进阶RTX 4090 24G + Llama-3.3-70B 需多卡,单卡以 8B/Scout 为主
专业H100/A100 集群 + Llama-3.3-70B / 405B

为什么选择这个模型

  • 全球最庞大的微调与部署生态
  • 从 1B 到 405B 规格最全
  • 业界最丰富的教程与工具链支持
  • 1M 上下文与多模态新一轮竞争力

模型优点

  • 生态与社区贡献量最大
  • 尺寸覆盖 1B~405B
  • 128K~1M 长上下文
  • 8B 单卡轻松跑
  • 与各大云厂商深度集成

模型缺点

  • 社区许可非 OSI 开源协议
  • 中文能力明显弱于 Qwen/DeepSeek
  • 大版本对显存要求高
  • 405B 对个人基本不可行

适合场景

  • 英文任务与 RAG
  • 微调生态实验与 LoRA
  • Agent 工具调用
  • 向量/端侧轻量部署
  • 国内外模型对照实验

不适合场景

  • 中文优先的产品
  • 有严格 OSI 开源合规要求的项目
  • 单卡想跑 70B+ 大模型
  • 需要多模态但偏好国产生态

部署教程

Ollama
ollama run llama3.1:8b(或 llama3.2:3b 轻量)
LM Studio
LM Studio 搜索 meta-llama 下载 GGUF → 加载 → 可开启长上下文(-c 32768)
llama.cpp
./llama-cli -m llama-3.1-8b-instruct-q4_k_m.gguf -p 提示词 -c 32768 -ngl 999
vLLM
pip install vllm && vllm serve meta-llama/Llama-3.1-8B-Instruct

智算工坊实验室

实测速度Llama-3.1-8B Q4 实测 ≈35-45 token/s(RTX 3060/3090)
显存占用8B Q4 约6GB;3B Q4 约2GB
功耗单卡 RTX 3060 满载约170W
不同 GPU 对比8B 在 RTX 3060/3090 差距约 20-30%;70B 需双卡及以上
→ 查看实验室数据

常见问题 FAQ

Llama 是否完全开源?

权重开放下载并可商用,但采用 Meta 自有的 Llama 社区许可(含注册索取),不属于 OSI 认可的 MIT/Apache 类协议。

Llama 4 的 MoE 值得本地用吗?

Scout(17B-A1B)Q4 约 10GB 适合 3090/4090 并享受大上下文;Maverick(128E)总参数大,需 24GB+ 显存。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/meta-llama/Llama-3.1-8B
  • https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Instruct
  • https://ai.meta.com/blog/llama-4-multimodal-intelligence/
  • https://www.llama.com/