#Gemma 4:字节对字节,最强大的开源模型#
发布日期:2026 年 4 月 2 日
作者:Clement Farabet(Google DeepMind 研究副总裁)、Olivier Lacombe(Google DeepMind 产品组经理)
Google DeepMind 今日正式发布 Gemma 4,这是迄今为止最强大的开源模型家族。Gemma 4 以“字节对字节”(byte for byte)的方式定义了开源模型的新基准,专为高级推理(reasoning)和代理式工作流(agentic workflows)而构建。它在保持轻量级和高效率的同时,实现了前沿级别的智能表现,适用于从移动设备到服务器的各种部署场景。
Gemma 4 系列模型在 Arena.ai 的聊天竞技场(chat arena)中展现出领先的开放模型性能-vs-大小表现(数据截至 2026 年 4 月 1 日)。这些模型经过大量不同数据集和指标的全面评估,涵盖文本生成的各个方面。更多详细基准测试请参阅官方模型卡。
Gemma 4 以 Apache 2.0 许可发布是一个巨大的里程碑。我们非常兴奋能在首日就在 Hugging Face 上全面支持 Gemma 4 系列模型。
——Clément Delangue,Hugging Face 联合创始人兼 CEO
#Gemma 4 的核心亮点与架构创新#
Gemma 4 是 Google DeepMind 构建的开源模型家族,采用多模态设计,支持文本和图像输入(小型模型还原生支持音频),并生成文本输出。本次发布包括预训练和指令微调(instruction-tuned)两种变体,上下文窗口最高可达 256K tokens,并支持超过 140 种语言的多语言能力。
Gemma 4 同时提供 Dense(密集)和 Mixture-of-Experts(MoE,混合专家)两种架构,特别适合文本生成、编程和复杂推理任务。模型共有四种尺寸:E2B、E4B、26B A4B 和 31B,可灵活部署于高端手机、笔记本电脑乃至服务器环境,真正实现 AI 的普惠。
#关键能力与架构升级#
- 强大推理能力:全系列模型均设计为高性能推理器,支持可配置的“思考模式”(thinking mode)。
- 扩展多模态支持:处理文本、图像(支持可变宽高比和分辨率,所有模型均支持)、视频,以及音频(E2B 和 E4B 模型原生支持)。
- 多样化高效架构:提供 Dense 和 MoE 变体,不同尺寸可根据部署需求灵活选择。
- 设备端优化:小型模型专为笔记本和移动设备本地高效执行而设计。
- 超长上下文窗口:小型模型支持 128K tokens,中型模型支持 256K tokens。
- 增强编程与代理能力:编程基准显著提升,并原生支持函数调用(function-calling),可驱动高度自主的 AI 代理。
- 原生系统提示支持:引入系统角色(system role)支持,实现更结构化、可控的对话。
Gemma 4 采用混合注意力机制(hybrid attention),在局部滑动窗口注意力(local sliding window attention)和全局注意力(full global attention)之间交替,确保最后一层始终为全局注意力。这种设计在保持轻量级模型的速度和低内存占用同时,保留了处理复杂长上下文任务所需的深度感知能力。为优化长上下文内存,全局层使用统一的 Key-Value,并应用比例 RoPE(Proportional RoPE,p-RoPE)。
#模型概览#
Gemma 4 针对从移动/边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)的部署场景,均提供前沿级性能,特别适用于推理、代理工作流、编程和多模态理解。
#Dense 模型规格#
属性 E2B E4B 31B Dense
总参数量 2.3B 有效(含嵌入 5.1B) 4.5B 有效(含嵌入 8B) 30.7B
层数 35 42 60
滑动窗口 512 tokens 512 tokens 1024 tokens
上下文长度 128K tokens 128K tokens 256K tokens
词汇表大小 262K 262K 262K
支持模态 文本、图像、音频 文本、图像、音频 文本、图像
视觉编码器参数 \~150M \~150M \~550M
音频编码器参数 \~300M \~300M 无音频
说明:E2B 和 E4B 中的“E”代表“Effective”(有效)参数。小型模型采用 Per-Layer Embeddings(PLE,每层嵌入)技术,通过为每个解码器层提供独立的微型嵌入表实现参数高效利用。这些嵌入表虽大,但仅用于快速查找,因此有效参数量远小于总参数量,特别适合设备端部署。
#Mixture-of-Experts(MoE)模型规格#
属性 26B A4B MoE
总参数量 25.2B
激活参数量 3.8B
层数 30
滑动窗口 1024 tokens
上下文长度 256K tokens
词汇表大小 262K
专家数量 8 激活 / 128 总 + 1 共享
支持模态 文本、图像
视觉编码器参数 \~550M
说明:26B A4B 中的“A”代表“Active”(激活)参数。在推理时仅激活约 4B 参数子集,使 MoE 模型的运行速度远高于其 26B 总参数暗示的速度,几乎相当于 4B 参数模型的速度,适合追求快速推理的场景。
#基准测试结果#
Gemma 4 在多个权威基准上展现出卓越性能(以下为指令微调模型结果,与前代 Gemma 3 27B 对比):
基准测试 Gemma 4 31B Gemma 4 26B A4B Gemma 4 E4B Gemma 4 E2B Gemma 3 27B(无思考模式)
MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%
AIME 2026(无工具) 89.2% 88.3% 42.5% 37.5% 20.8%
LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%
Codeforces ELO 2150 1718 940 633 110
GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%
Tau2(3 次平均) 76.9% 68.2% 42.2% 24.5% 16.2%
HLE(无工具) 19.5% 8.7% - - -
HLE(带搜索) 26.5% 17.2% - - -
BigBench Extra Hard 74.4% 64.8% 33.1% 21.9% 19.3%
MMMLU 88.4% 86.3% - - -
(完整基准详见官方模型卡。Gemma 4 在编程、数学推理、通用知识等多个维度全面领先,尤其在长上下文和多模态任务上表现出色。)
#使用指南与最佳实践##1. 采样参数(Sampling Parameters)#
根据任务需求调整温度(temperature)、top-p 等参数,以平衡创造性和确定性。
#2. 思考模式配置(Thinking Mode Configuration)#
Gemma 4 支持显式思考模式,可显著提升复杂推理任务的表现。
#3. 多轮对话(Multi-Turn Conversations)#
利用长上下文窗口,支持更自然的持续对话。
#4. 模态顺序(Modality Order)#
图像/音频输入顺序会影响模型理解,建议按逻辑顺序提供。
#5. 可变图像分辨率(Variable Image Resolution)#
所有模型均支持动态分辨率,优化视觉理解效率。
#6. 音频处理(Audio)#
E2B/E4B 模型原生支持音频输入,适用于语音相关任务。
#7. 音频与视频长度(Audio and Video Length)#
建议控制输入长度以保持最佳性能和效率。
#获取与部署#
Gemma 4 采用 Apache 2.0 许可,完全开放商用。开发者可立即通过以下渠道获取:
- Hugging Face:http://t.cn/AXIY3RmR(首日完整支持)
- GitHub:http://t.cn/AXIHLECH
- 官方文档:http://t.cn/AXIHLECE
- Google AI Studio / Vertex AI:快速原型开发与生产部署
- Google Cloud:已原生集成,支持大规模应用
Gemma 4 还获得 vLLM、Google TPU、AMD GPU、Intel XPU 等主流推理引擎的首日支持,极大降低了部署门槛。
#结语:开源 AI 的新纪元#
Gemma 4 不仅是 Google DeepMind 开放模型战略的最新里程碑,更是整个开源 AI 生态的一次重大跃升。它证明了“智能 per 参数”的极致优化可以在不牺牲性能的前提下实现真正的普惠——从手机到云端,从个人开发者到企业团队,都能轻松触达前沿多模态推理能力。
无论你是构建智能代理、开发代码助手、还是探索多模态应用,Gemma 4 都将为你提供强大、可靠且完全开放的基石。立即前往 Hugging Face 或官方文档,开始你的 Gemma 4 之旅吧!
更多资源:
- 官方模型卡:http://t.cn/AXIHLEC8
- 发布博客:https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/
- 许可协议:http://t.cn/AXIHLECQ
本文基于 Google 官方博客及 Gemma 4 模型卡完整内容翻译与整理,确保信息零损耗、无遗漏。所有技术细节、表格与基准数据均忠实还原自官方来源。 http://t.cn/AXIHLDEB
发布于 上海
