Google 的高效轻量级开源多模态系列
模型介绍
Gemma 是 Google DeepMind 的开源轻量级大模型系列,主打「小尺寸、高效率」:2024 年的 Gemma 1/2 验证了 7B/9B 级模型可通过更多数据达到大模型级能力,2025 年的 Gemma 3 则一口气把上下文拉长并原生支持图像输入,官方甚至宣称「一张 RTX 3090 可跑 27B」。2026 年的 Gemma 4 更大规模采用 Apache-2.0 协议开放,覆盖 2B~31B 的稠密与 MoE 版本,并强化多模态统一理解,非常适合端侧、低显存与高吞吐场景。
模型基本信息
开发机构Google DeepMind
模型版本Gemma 4(2026)/ Gemma 3
参数规模2.3B/4.5B/9B/12B/27B 稠密 + 26B-A4B MoE;Gemma 4 系列 12B/31B
模型类型文本对话 / 多模态(图像→文本)
许可证apache-2.0(Gemma 4);Gemma 3 为 Gemma 许可
上下文长度128K(Gemma 4);32K~128K(Gemma 3)
发布日期2025-03-01(gemma-3-27b-it);2026-03-11(gemma-4-31B-it);2026-05-23(gemma-4-12B-it)
模型架构Decoder-only Transformer + GQA;多模态项目在注意力输出上做融合(Gemma3ForConditionalGeneration / Gemma4Unified)
模型能力
中文能力中
英文能力很强
代码能力强
推理能力强
长文本能力强(128K)
视觉能力很强(原生多模态)
工具调用强
模型版本
Gemma-4-31B-it30.7B 稠密Gemma-4-12B-it12B 稠密Gemma-3-27B-it27B 稠密Gemma-3-12B-it12B 稠密Gemma-3-4B-it4B 稠密
模型获取
部署方式
OllamaLM Studiollama.cppvLLMSGLangtransformers
显存需求
Gemma-3-4B Q4约3GB
Gemma-4-12B Q4约8GB
Gemma-3-27B Q4约17GB
Gemma-4-31B Q4约20GB
硬件推荐
RTX 3060Gemma 2B~9B(Q4)
RTX 309012B~27B(Q4),官方宣传 27B 可跑
RTX 409027B~31B Q4 舒适
RTX 509031B Q4 满载
MacM 系列跑 12B~27B 流畅
推荐配置
入门RTX 3060 12G + Gemma-3-4B Q4 约3GB
进阶RTX 3090/4090 24G + Gemma-4-12B Q4 约8GB
专业RTX 5090 或 A100 + Gemma-4-31B(Q4/FP16)
为什么选择这个模型
- Google 官方出品,稳定性与安全治理完善
- 小模型效率极高,12B 与 27B 在同尺寸占优
- 原生多模态统一理解
- Gemma 4 起 Apache-2.0 完全可商用
模型优点
- 效率/性能比在同尺寸名列前茅
- 原生多模态(图像)
- 官方宣称单张 3090 可跑 27B
- Apache-2.0(Gemma 4)
- 端侧与移动部署友好
模型缺点
- 中文能力弱于 Qwen/GLM
- 小尺寸生态与社区不如 Llama
- 图像描述偏保守
- 31B 需 24GB+ 显存
适合场景
- 端侧 / 移动端推理
- 低显存多模态应用
- 研究与教学实验
- 成本敏感的多语言产品
- Google AI Studio 生态接入
不适合场景
- 中文深度内容产品
- 超长文档(>128K)
- 需要最大参数量的旗舰任务
- 复杂 Agent 生产
部署教程
Ollama
ollama run gemma4:12b(或 gemma3:27b)
LM Studio
LM Studio 搜索 google/gemma 下载 GGUF → 加载设备选 GPU → 可传图聊天
llama.cpp
./llama-cli -m gemma-4-12b-it-q4_k_m.gguf --image 图片路径 -p 描述一下 -ngl 999(多模态命令因后端而异)
vLLM
pip install vllm && vllm serve google/gemma-4-12B-it
智算工坊实验室
实测速度Gemma-4-12B Q4 实测 ≈30-38 token/s(RTX 4090)
显存占用12B Q4 约8GB;27B Q4 约17GB
功耗RTX 4090 满载约450W
不同 GPU 对比27B 在 3090 上约 20 token/s(官方宣称可跑);12B 在 3060~4090 均流畅
常见问题 FAQ
Gemma 与 Gemini 什么关系?
同为 Google DeepMind 出品,Gemini 是闭源旗舰,Gemma 是基于 Gemini 技术蒸馏/教学产物开源系列,尺寸小、可本地部署。
Gemma 4 许可证说明?
Gemma 4 系列采用 Apache-2.0,可自由商用;Gemma 3 及更早版本采用 Gemma 许可(同样允许商用,但协议自有)。
相关模型
相关工具
相关硬件
NVIDIA GeForce RTX 3060 12GBNVIDIA GeForce RTX 3090NVIDIA GeForce RTX 4090Apple Mac Studio (M4 Ultra)NVIDIA GeForce RTX 5090
相关文章
数据来源
- https://huggingface.co/google/gemma-3-27b-it
- https://huggingface.co/google/gemma-4-12B-it
- https://blog.google/technology/developers/gemma-family-2026/
- https://ai.google.dev/gemma