Gemma 4:字节级别上最强大的开放模型
今天,我们推出了 [Gemma 4](https://aistudio.google.com/prompts/new_chat?model=gemma-4-31b-it)——迄今为止我们最智能的开放模型。Gemma 4 专为高级推理和智能工作流程而设计,提供了前所未有的智能参数比。这一突破基于庞大的社区反响:自从首代模型推出以来,开发者们已下载超过 4 亿次,构建出了一个超过 10 万种变体的 [Gemmaverse](https://deepmind.google/models/gemma/gemmaverse/)。我们认真听取了创新者的反馈,并以此为基础开发出了 Gemma 4:使得突破性的能力在 [Apache 2.0 许可协议](https://goo.gle/gemma-4-apache-2) 下广泛可用。

### 行业领先的能力与移动优先的人工智能
我们推出 Gemma 4 的四种灵活规格:[有效 2B (E2B)](https://huggingface.co/gg-hf-gg/gemma-4-E2B-it),[有效 4B (E4B)](https://huggingface.co/gg-hf-gg/gemma-4-E4B-it),[26B 专家混合模型 (MoE)](https://huggingface.co/gg-hf-gg/gemma-4-26B-A4B-it) 和 [31B 密集模型](https://huggingface.co/gg-hf-gg/gemma-4-31B-it)。整个系列超越了简单对话,可以处理复杂的逻辑与智能工作流程。我们的更大模型在同类中提供了最先进的性能,目前 31B 模型在行业标准的 [Arena AI 文本排行榜](https://arena.ai/leaderboard/text?license=open-source) 中排名第三,而 26B 模型排名第六。Gemma 4 在竞争中超越了 20 倍大小的模型。对于开发者来说,这种新的智能参数比意味着可以以更少的硬件成本实现前沿能力。
我们 E2B 和 E4B 模型在设备端重新定义了实用性,优先考虑多模态能力、低延迟处理和无缝生态集成,而不仅仅是参数数量。
### 强大、可用、开放
为了支持下一代前沿研究和产品,我们特别设计了 Gemma 4 模型,确保它们能在各种硬件上高效运行和微调——从全球数十亿 Android 设备,到笔记本 GPU,再到开发者工作站和加速器。
使用这些高度优化的模型,你可以微调 Gemma 4,以在特定任务上实现最先进的性能。我们已经看到这种方法的成功示例;例如,INSAIT 创建了第一款保加利亚本土语言模型 ([BgGPT](https://deepmind.google/models/gemma/gemmaverse/insait/)),我们还与耶鲁大学合作开发了 [Cell2Sentence-Scale](https://blog.google/innovation-and-ai/products/google-gemma-ai-cancer-therapy-discovery/),发现新的癌症治疗途径。
让我们看看使 Gemma 4 成为我们迄今为止最强大的开放模型系列的几个亮点:
* **高级推理:** 能够进行多步规划和深度逻辑,Gemma 4 在数学和遵循指令的基准测试中表现出显著提升。
* **智能工作流程:** 原生支持函数调用、结构化 JSON 输出和系统指令,使您能够构建能够与不同工具和 API 交互、可靠执行工作流程的自主代理。
* **代码生成:** Gemma 4 支持高质量离线代码,将您的工作站转变为本地优先的 AI 代码助手。
* **视觉与音频:** 所有模型原生处理视频和图像,支持可变分辨率,擅长 OCR 和图表理解等视觉任务。此外,E2B 和 E4B 模型具有原生音频输入,用于语音识别和理解。
* **更长上下文:** 无缝处理长篇内容。边缘模型具有 128K 的上下文窗口,而更大模型的上下文窗口可扩展至 256K,允许您在一次提示中传递仓库或长文档。
* **支持 140 多种语言:** Gemma 4 原生训练于超过 140 种语言,帮助开发者为全球用户构建包容性高效的应用。
### 适用于多种硬件的多样化模型
我们将 Gemma 4 模型权重按特定硬件和使用场景进行大小调整,确保您在所需地点获得前沿智能:
#### 26B 和 31B 模型:前沿智能,离线运行于个人计算机
经过优化,提供最先进的推理能力,适合可接入硬件。我们未量化的 bfloat16 权重能够高效地适配单个 80GB 的 NVIDIA H100 GPU。在本地设置中,量化版本能够原生运行于消费者 GPU,以支持您的 IDE、代码助手和智能工作流程。我们的 26B 专家混合模型 (MoE) 关注延迟,在推断期间仅激活其中的 3.8 亿个参数,以提供异常快速的每秒 token 数,而我们的 31B 密集模型则最大化原始质量,为微调提供强大基础。
#### E2B 和 E4B 模型:为移动与 IoT 设备带来智能的新水平
这些模型从根本上优化,最大化计算和内存效率,在推断期间激活分别有效的 20 亿和 40 亿参数,节省 RAM 和电池寿命。与我们的 Google Pixel 团队和 Qualcomm Technologies、MediaTek 等移动硬件领导者紧密合作,这些多模态模型可以在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,且延迟几乎为零。Android 开发者现在可以立即在 [AICore 开发者预览](https://android-developers.googleblog.com/2026/03/AI-Core-Developer-Preview) 中原型智能流程,以便与 Gemini Nano 4 兼容。
### 开放源代码许可
我们听取了您的反馈,并采取了行动。构建 AI 的未来需要协作的方式,我们相信赋能开发者生态而不设置限制性障碍。这就是为什么 Gemma 4 在商业上宽松的 [Apache 2.0 许可协议](https://goo.gle/gemma-4-apache-2) 下发布。
这一开放源代码许可证为完整的开发者灵活性和数字主权奠定了基础;使您完全掌控数据、基础设施和模型。它允许您在任何环境中自由构建和安全部署,无论是在本地还是在云端。
选择 Gemma 4,企业和主权组织将获得一种受信任、透明的基础,提供最先进的能力,且符合最高的安全和可靠性标准。
---
原文链接:[点击查看](https://deepmind.google/blog/gemma-4-byte-for-byte-the-most-capable-open-models/)

### 行业领先的能力与移动优先的人工智能
我们推出 Gemma 4 的四种灵活规格:[有效 2B (E2B)](https://huggingface.co/gg-hf-gg/gemma-4-E2B-it),[有效 4B (E4B)](https://huggingface.co/gg-hf-gg/gemma-4-E4B-it),[26B 专家混合模型 (MoE)](https://huggingface.co/gg-hf-gg/gemma-4-26B-A4B-it) 和 [31B 密集模型](https://huggingface.co/gg-hf-gg/gemma-4-31B-it)。整个系列超越了简单对话,可以处理复杂的逻辑与智能工作流程。我们的更大模型在同类中提供了最先进的性能,目前 31B 模型在行业标准的 [Arena AI 文本排行榜](https://arena.ai/leaderboard/text?license=open-source) 中排名第三,而 26B 模型排名第六。Gemma 4 在竞争中超越了 20 倍大小的模型。对于开发者来说,这种新的智能参数比意味着可以以更少的硬件成本实现前沿能力。
我们 E2B 和 E4B 模型在设备端重新定义了实用性,优先考虑多模态能力、低延迟处理和无缝生态集成,而不仅仅是参数数量。
### 强大、可用、开放
为了支持下一代前沿研究和产品,我们特别设计了 Gemma 4 模型,确保它们能在各种硬件上高效运行和微调——从全球数十亿 Android 设备,到笔记本 GPU,再到开发者工作站和加速器。
使用这些高度优化的模型,你可以微调 Gemma 4,以在特定任务上实现最先进的性能。我们已经看到这种方法的成功示例;例如,INSAIT 创建了第一款保加利亚本土语言模型 ([BgGPT](https://deepmind.google/models/gemma/gemmaverse/insait/)),我们还与耶鲁大学合作开发了 [Cell2Sentence-Scale](https://blog.google/innovation-and-ai/products/google-gemma-ai-cancer-therapy-discovery/),发现新的癌症治疗途径。
让我们看看使 Gemma 4 成为我们迄今为止最强大的开放模型系列的几个亮点:
* **高级推理:** 能够进行多步规划和深度逻辑,Gemma 4 在数学和遵循指令的基准测试中表现出显著提升。
* **智能工作流程:** 原生支持函数调用、结构化 JSON 输出和系统指令,使您能够构建能够与不同工具和 API 交互、可靠执行工作流程的自主代理。
* **代码生成:** Gemma 4 支持高质量离线代码,将您的工作站转变为本地优先的 AI 代码助手。
* **视觉与音频:** 所有模型原生处理视频和图像,支持可变分辨率,擅长 OCR 和图表理解等视觉任务。此外,E2B 和 E4B 模型具有原生音频输入,用于语音识别和理解。
* **更长上下文:** 无缝处理长篇内容。边缘模型具有 128K 的上下文窗口,而更大模型的上下文窗口可扩展至 256K,允许您在一次提示中传递仓库或长文档。
* **支持 140 多种语言:** Gemma 4 原生训练于超过 140 种语言,帮助开发者为全球用户构建包容性高效的应用。
### 适用于多种硬件的多样化模型
我们将 Gemma 4 模型权重按特定硬件和使用场景进行大小调整,确保您在所需地点获得前沿智能:
#### 26B 和 31B 模型:前沿智能,离线运行于个人计算机
经过优化,提供最先进的推理能力,适合可接入硬件。我们未量化的 bfloat16 权重能够高效地适配单个 80GB 的 NVIDIA H100 GPU。在本地设置中,量化版本能够原生运行于消费者 GPU,以支持您的 IDE、代码助手和智能工作流程。我们的 26B 专家混合模型 (MoE) 关注延迟,在推断期间仅激活其中的 3.8 亿个参数,以提供异常快速的每秒 token 数,而我们的 31B 密集模型则最大化原始质量,为微调提供强大基础。
#### E2B 和 E4B 模型:为移动与 IoT 设备带来智能的新水平
这些模型从根本上优化,最大化计算和内存效率,在推断期间激活分别有效的 20 亿和 40 亿参数,节省 RAM 和电池寿命。与我们的 Google Pixel 团队和 Qualcomm Technologies、MediaTek 等移动硬件领导者紧密合作,这些多模态模型可以在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,且延迟几乎为零。Android 开发者现在可以立即在 [AICore 开发者预览](https://android-developers.googleblog.com/2026/03/AI-Core-Developer-Preview) 中原型智能流程,以便与 Gemini Nano 4 兼容。
### 开放源代码许可
我们听取了您的反馈,并采取了行动。构建 AI 的未来需要协作的方式,我们相信赋能开发者生态而不设置限制性障碍。这就是为什么 Gemma 4 在商业上宽松的 [Apache 2.0 许可协议](https://goo.gle/gemma-4-apache-2) 下发布。
这一开放源代码许可证为完整的开发者灵活性和数字主权奠定了基础;使您完全掌控数据、基础设施和模型。它允许您在任何环境中自由构建和安全部署,无论是在本地还是在云端。
选择 Gemma 4,企业和主权组织将获得一种受信任、透明的基础,提供最先进的能力,且符合最高的安全和可靠性标准。
---
原文链接:[点击查看](https://deepmind.google/blog/gemma-4-byte-for-byte-the-most-capable-open-models/)
评论
暂无评论。