Gemma 4 Technical Report

2026年07月02日
  • 简介
    我们推出了 Gemma 4——Gemma 模型家族中新一代开源权重、原生多模态大语言模型。该系列模型旨在提升计算效率与推理能力,包含稠密架构(Dense)和混合专家架构(Mixture-of-Experts, MoE)两种技术路线,参数规模覆盖 2.3B 至 31B。除为所有尺寸模型升级了视觉与音频编码器外,我们还为其中的 12B 模型提出了一种统一的、无需独立编码器的全新架构,可直接接收原始音频波形与图像块(image patches)作为输入。此外,我们为 Gemma 系列模型集成了“思维模式”(thinking mode),使其能在生成最终回答前,先输出完整的推理过程(reasoning traces)。通过若干关键性架构设计,我们在推理速度、内存占用、计算效率以及长上下文处理能力等方面均取得显著优化。Gemma 4 在 STEM(科学、技术、工程与数学)、多模态及长上下文等各类基准测试中实现了性能跃升,并在人类评估任务中可与更大规模的前沿开源模型相媲美。
  • 作者讲解·1
  • 图表
  • 解决问题
    现有开源多模态大模型在计算效率、推理能力、长上下文处理及原生多模态(尤其是原始音频/图像patch级输入)支持方面存在瓶颈,缺乏统一、轻量、高效且具备可解释性推理能力的架构设计。
  • 关键思路
    提出Gemma 4系列模型:① 首次在开源多模态模型中实现‘编码器无关’(encoder-free)架构(12B规模),直接接收原始图像patch和音频waveform;② 引入‘思考模式’(thinking mode),显式生成推理轨迹以提升可解释性与逻辑严谨性;③ 系统性优化计算效率(含MoE与dense双路径)、内存占用与长上下文建模(>128K tokens),而非单纯扩大参数量。
  • 其它亮点
    涵盖2.3B–31B多规格模型;所有尺寸均配备增强型视觉/音频编码器;12B encoder-free模型为业界首个开源的原生端到端多模态语言模型(无需独立视觉/音频编码器);在STEM、多模态理解(如MMMU、VQAv2)、长上下文(如LongBench)及人类偏好评估(如Chatbot Arena)上显著超越同规模模型,媲美更大闭源模型;已开源权重与推理代码(Hugging Face & Kaggle);值得深入方向包括thinking mode的可控性引导、encoder-free架构的跨模态对齐机制、以及MoE稀疏训练稳定性优化。
  • 相关研究
    LLaVA-1.6(2024)、Qwen2-VL(2024)、Fuyu-8B(2023)、InternVL 2(2024)、Phi-3-Vision(2024)、Gemma 2(2024)、Llama-3.2-Vision(2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问