Gemma 系列

★★★★★ 4.7 分

Google 的轻量开源系列,尺寸小、效率高,Gemma 3 号称「一张 RTX 3090 跑 27B」,还支持多模态与超长上下文。

多语言轻量官方开源
参数量1B / 2B / 4B / 9B / 12B / 27B
模型类型轻量开源大语言模型(含 Instruct、多模态变体)
许可证Gemma 许可(允许商用与改写)
开发者Google DeepMind
★★★★★ 4.6

Google 的高效轻量级开源多模态系列

多模态开源轻量效率

模型介绍

Gemma 是 Google DeepMind 的开源轻量级大模型系列,主打「小尺寸、高效率」:2024 年的 Gemma 1/2 验证了 7B/9B 级模型可通过更多数据达到大模型级能力,2025 年的 Gemma 3 则一口气把上下文拉长并原生支持图像输入,官方甚至宣称「一张 RTX 3090 可跑 27B」。2026 年的 Gemma 4 更大规模采用 Apache-2.0 协议开放,覆盖 2B~31B 的稠密与 MoE 版本,并强化多模态统一理解,非常适合端侧、低显存与高吞吐场景。

模型基本信息

开发机构Google DeepMind
模型版本Gemma 4(2026)/ Gemma 3
参数规模2.3B/4.5B/9B/12B/27B 稠密 + 26B-A4B MoE;Gemma 4 系列 12B/31B
模型类型文本对话 / 多模态(图像→文本)
许可证apache-2.0(Gemma 4);Gemma 3 为 Gemma 许可
上下文长度128K(Gemma 4);32K~128K(Gemma 3)
发布日期2025-03-01(gemma-3-27b-it);2026-03-11(gemma-4-31B-it);2026-05-23(gemma-4-12B-it)
模型架构Decoder-only Transformer + GQA;多模态项目在注意力输出上做融合(Gemma3ForConditionalGeneration / Gemma4Unified)

模型能力

中文能力中
英文能力很强
代码能力强
推理能力强
长文本能力强(128K)
视觉能力很强(原生多模态)
工具调用强

模型版本

Gemma-4-31B-it30.7B 稠密Gemma-4-12B-it12B 稠密Gemma-3-27B-it27B 稠密Gemma-3-12B-it12B 稠密Gemma-3-4B-it4B 稠密

模型获取

部署方式

OllamaLM Studiollama.cppvLLMSGLangtransformers

显存需求

Gemma-3-4B Q4约3GB
Gemma-4-12B Q4约8GB
Gemma-3-27B Q4约17GB
Gemma-4-31B Q4约20GB

硬件推荐

RTX 3060Gemma 2B~9B(Q4)
RTX 309012B~27B(Q4),官方宣传 27B 可跑
RTX 409027B~31B Q4 舒适
RTX 509031B Q4 满载
MacM 系列跑 12B~27B 流畅

推荐配置

入门RTX 3060 12G + Gemma-3-4B Q4 约3GB
进阶RTX 3090/4090 24G + Gemma-4-12B Q4 约8GB
专业RTX 5090 或 A100 + Gemma-4-31B(Q4/FP16)

为什么选择这个模型

  • Google 官方出品,稳定性与安全治理完善
  • 小模型效率极高,12B 与 27B 在同尺寸占优
  • 原生多模态统一理解
  • Gemma 4 起 Apache-2.0 完全可商用

模型优点

  • 效率/性能比在同尺寸名列前茅
  • 原生多模态(图像)
  • 官方宣称单张 3090 可跑 27B
  • Apache-2.0(Gemma 4)
  • 端侧与移动部署友好

模型缺点

  • 中文能力弱于 Qwen/GLM
  • 小尺寸生态与社区不如 Llama
  • 图像描述偏保守
  • 31B 需 24GB+ 显存

适合场景

  • 端侧 / 移动端推理
  • 低显存多模态应用
  • 研究与教学实验
  • 成本敏感的多语言产品
  • Google AI Studio 生态接入

不适合场景

  • 中文深度内容产品
  • 超长文档(>128K)
  • 需要最大参数量的旗舰任务
  • 复杂 Agent 生产

部署教程

Ollama
ollama run gemma4:12b(或 gemma3:27b)
LM Studio
LM Studio 搜索 google/gemma 下载 GGUF → 加载设备选 GPU → 可传图聊天
llama.cpp
./llama-cli -m gemma-4-12b-it-q4_k_m.gguf --image 图片路径 -p 描述一下 -ngl 999(多模态命令因后端而异)
vLLM
pip install vllm && vllm serve google/gemma-4-12B-it

智算工坊实验室

实测速度Gemma-4-12B Q4 实测 ≈30-38 token/s(RTX 4090)
显存占用12B Q4 约8GB;27B Q4 约17GB
功耗RTX 4090 满载约450W
不同 GPU 对比27B 在 3090 上约 20 token/s(官方宣称可跑);12B 在 3060~4090 均流畅
→ 查看实验室数据

常见问题 FAQ

Gemma 与 Gemini 什么关系?

同为 Google DeepMind 出品,Gemini 是闭源旗舰,Gemma 是基于 Gemini 技术蒸馏/教学产物开源系列,尺寸小、可本地部署。

Gemma 4 许可证说明?

Gemma 4 系列采用 Apache-2.0,可自由商用;Gemma 3 及更早版本采用 Gemma 许可(同样允许商用,但协议自有)。

相关模型

相关工具

相关硬件

相关文章

数据来源

  • https://huggingface.co/google/gemma-3-27b-it
  • https://huggingface.co/google/gemma-4-12B-it
  • https://blog.google/technology/developers/gemma-family-2026/
  • https://ai.google.dev/gemma