生态最庞大的开源模型业界标准
模型介绍
Llama 是 Meta 的开源大模型旗舰系列,自 2023 年推出以来定义了开源模型的标准:从 3B 小模型到 405B 超大模型一应俱全,全球微调、量化与部署生态无出其右。2024 年的 Llama 3.1 把上下文拉到 128K,2025 年的 Llama 4 采用 MoE 架构并将上下文进一步扩展至 1M,同时原生支持多模态。标注「llama3.1」的社区许可允许开放商用,是全世界本地部署教程的首选参考对象,8B 在 RTX 3060 单卡即可流畅运行。
模型基本信息
开发机构Meta AI(Meta Platforms)
模型版本Llama 4(2025)/ Llama 3.3
参数规模1B/3B/8B/70B 稠密;405B(3.1);Llama 4 Scout 17B-A1B、Maverick 17B-128E(MoE)
模型类型文本对话 / 多模态(Llama 4/3.2 视觉)
许可证Llama 社区许可(自定义,支持商用)
上下文长度128K(3.1/3.3);1M(Llama 4 Scout)
发布日期2024-07-14(Llama-3.1-8B);2025-04-04(Llama-4)
模型架构Decoder-only Transformer + GQA;Llama 4 采用 MoE + 交错注意力(LlamaForCausalLM 扩展)
模型能力
中文能力中(弱于国产)
英文能力很强
代码能力很强
推理能力强
长文本能力很强(128K~1M)
视觉能力强(Llama 4/3.2 支持视觉)
工具调用强
模型版本
Llama-4-Maverick-17B-128E17B-A? MoE(128 专家)Llama-4-Scout-17B-16E17B-A1B MoE(1M 上下文)Llama-3.3-70B70B 稠密Llama-3.1-8B8B 稠密(单卡首选)Llama-3.2-3B3B 稠密(轻量)
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
Llama-3.2-3B Q4约2GB
Llama-3.1-8B Q4约6GB
Llama-4-Scout Q4约10GB
Llama-3.3-70B Q4约40GB
硬件推荐
RTX 3060Llama 1B~8B(Q4)
RTX 30908B 舒适,Llama 4 Scout Q4 约10GB
RTX 409014B~32B,Scout 满载
RTX 509032B~70B(Q4)
MacApple Silicon 8B~27B 流畅
推荐配置
入门RTX 3060 12G + Llama-3.2-3B Q4 约2GB 或 8B Q4 约6GB
进阶RTX 4090 24G + Llama-3.3-70B 需多卡,单卡以 8B/Scout 为主
专业H100/A100 集群 + Llama-3.3-70B / 405B
为什么选择这个模型
- 全球最庞大的微调与部署生态
- 从 1B 到 405B 规格最全
- 业界最丰富的教程与工具链支持
- 1M 上下文与多模态新一轮竞争力
模型优点
- 生态与社区贡献量最大
- 尺寸覆盖 1B~405B
- 128K~1M 长上下文
- 8B 单卡轻松跑
- 与各大云厂商深度集成
模型缺点
- 社区许可非 OSI 开源协议
- 中文能力明显弱于 Qwen/DeepSeek
- 大版本对显存要求高
- 405B 对个人基本不可行
适合场景
- 英文任务与 RAG
- 微调生态实验与 LoRA
- Agent 工具调用
- 向量/端侧轻量部署
- 国内外模型对照实验
不适合场景
- 中文优先的产品
- 有严格 OSI 开源合规要求的项目
- 单卡想跑 70B+ 大模型
- 需要多模态但偏好国产生态
部署教程
Ollama
ollama run llama3.1:8b(或 llama3.2:3b 轻量)
LM Studio
LM Studio 搜索 meta-llama 下载 GGUF → 加载 → 可开启长上下文(-c 32768)
llama.cpp
./llama-cli -m llama-3.1-8b-instruct-q4_k_m.gguf -p 提示词 -c 32768 -ngl 999
vLLM
pip install vllm && vllm serve meta-llama/Llama-3.1-8B-Instruct
智算工坊实验室
实测速度Llama-3.1-8B Q4 实测 ≈35-45 token/s(RTX 3060/3090)
显存占用8B Q4 约6GB;3B Q4 约2GB
功耗单卡 RTX 3060 满载约170W
不同 GPU 对比8B 在 RTX 3060/3090 差距约 20-30%;70B 需双卡及以上
常见问题 FAQ
Llama 是否完全开源?
权重开放下载并可商用,但采用 Meta 自有的 Llama 社区许可(含注册索取),不属于 OSI 认可的 MIT/Apache 类协议。
Llama 4 的 MoE 值得本地用吗?
Scout(17B-A1B)Q4 约 10GB 适合 3090/4090 并享受大上下文;Maverick(128E)总参数大,需 24GB+ 显存。
相关模型
相关工具
相关硬件
相关文章
数据来源
- https://huggingface.co/meta-llama/Llama-3.1-8B
- https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Instruct
- https://ai.meta.com/blog/llama-4-multimodal-intelligence/
- https://www.llama.com/