发表时间: 2026-06 · Blog post by Google Developers (developers.googleblog.com)
文章标题:Gemma 4 12B:开发者指南
作者/机构:André Susano Pinto, Andreas Steiner, Karolis Misiunas, Karsten Roth, Michael Tschannen, Omar Sanseviero (均为Google研究工程师/科学家/技术人员)
一句话结论 Gemma 4 12B 是一款拥有 12B 参数的密集型、无编码器多模态大语言模型,它通过将视觉和音频原始信号直接投影到解码器中,在 16GB 显存的消费级设备上实现了低延迟的本地多模态交互与智能体工作流。
要解决什么问题 传统的多模态大语言模型在处理跨模态输入时,通常依赖于独立且参数被冻结的外部编码器。例如,在同系列的其他模型中,往往需要外挂一个 150M 或 550M 参数的视觉模型,以及一个 300M 参数的音频编码器。这种多阶段的处理范式带来了两个显著的底层卡点。首先是推理延迟的增加与显存占用的碎片化,多模态数据必须先经过庞大的独立编码器网络进行特征提取,随后才能喂给主语言模型,导致数据流转链路过长,难以在资源受限的本地消费级设备上实现低延迟的实时交互。其次是下游微调的工程成本极高,由于视觉、音频和文本模块在架构上是物理分离的,开发者在针对特定任务进行适配时,无法轻易地协同调整多个独立的冻结编码器。这种割裂的架构不仅增加了训练的复杂性,也阻碍了模型在多模态对齐上的效率。
怎么做的 Gemma 4 12B 的核心思路是彻底抛弃繁重的多阶段视觉和音频编码器,采用单一的、仅解码器(decoder-only)的 Transformer 架构来统一处理所有模态的输入。为了绕开传统外挂编码器带来的延迟和显存碎片化卡点,该方法设计了极简的直接投影机制,将多模态原始数据直接映射到大语言模型的骨干网络中。关键设计由两个轻量级输入部件和一个统一微调机制构成。第一个部件是仅有 35M 参数的视觉嵌入器,它直接替代了传统模型中多达 27 层的视觉 Transformer。该部件接收原始的 48x48 像素图像块,通过单次矩阵乘法将其投影到语言模型的隐藏层维度,其核心线性变换可表示为 $H_{vision} = X_{patch} W_{v}$,同时通过分解式的 X 和 Y 坐标查找表矩阵,将空间位置信息直接附加到输入特征中。第二个部件是音频波形投影模块,它直接砍掉了传统设计中的 12 个 Conformer 层。该模块将原始的 16 kHz 音频信号切分为 40 毫秒的帧(每帧包含 640 个浮点数),随后通过一个简单的线性投影层将其映射到模型的输入空间,即 $H_{audio} = X_{frame} W_{a}$。这种无编码器设计的最大优势在于统一微调:由于视觉、音频和文本输入最终共享完全相同的权重空间,开发者在进行 LoRA 适配器微调或全量微调时,只需通过单次前向和反向传播,就能自然地更新整个多模态词元环路,彻底免去了协同调整多个独立编码器的烦恼。为了进一步压榨本地推理速度,作者还专门配套发布了一个多词元预测(MTP)模型。
效果如何 由于本文档定位为开发者指南,作者并未提供与标准基准数据集或其他基线方法的量化对比结果,而是通过具体的本地部署案例来验证其有效性。实验主要在配备 16GB 显存或统一内存的专用 GPU 笔记本电脑(如 Apple Silicon 设备)上进行。在智能体推理任务中,该模型结合 OpenCode 框架和 `gemma-skills` 技能库,成功在本地编写并驱动了一个用于图像处理的 Gradio 应用程序。在长视频理解测试中,研究人员向模型输入了一段 5 分钟的视频片段,包含 313 帧以 1 FPS 提取的图像(分辨率被调整以适应 70 个词元的预算)、原始音频及文本提示词。模型能够准确进行跨模态推理,指出视频中“男人自拍”并非真实动作,而是展示 AI 生成能力的视觉隐喻。在工程落地方面,通过引入 LiteRT-LM 驱动的设备端部署方案,模型能够以零延迟的本地执行能力运行。配套的 `litert-lm serve` 工具利用内存中的无状态前缀缓存机制,能够即时绕过预填充延迟,作为与 OpenAI 兼容的本地 API 服务器无缝接入现有开发工具链。此外,官方还推出了原生的 macOS 桌面应用,内置安全的沙箱化 Python 执行循环,支持在聊天界面内直接执行代码和绘制图表。不过,作为一款主打本地运行的中型模型,其在极高分辨率视频处理或超长音频理解上的计算代价与上下文极限,文档中并未给出明确的边界测试。
Gemma 4 12B 是一款密集的、具有统一且无编码器架构的多模态模型。该模型的发布为本地AI(local AI)带来了几个重要的里程碑:
传统多模态模型的局限性。传统的多模态模型依赖于独立的、冻结的编码器来处理不同模态的输入。例如,Gemma 4系列中的其他模型使用一个1.5亿参数的视觉模型(用于边缘尺寸)或5.5亿参数的视觉模型(用于中型尺寸),以及一个3亿参数的音频编码器(用于Gemma 4 E2B和E4B)。在将多模态输入送入LLM之前,使用多个独立的编码器进行处理,会导致延迟增加和内存占用碎片化。
Gemma 4 12B的统一架构。Gemma 4 12B通过采用单一的、仅解码器(decoder-only)的Transformer架构来解决上述问题。该架构包含了与Gemma 4 31B密集模型(Dense model)相同的先进解码器结构。
该架构的核心组件包括:
深入了解无编码器架构。关于这种无编码器架构如何工作的更深入概述,可以查阅文章《https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-gemma-4-12b》。
Gemma 4 12B在多项任务中展现了卓越的性能,其能力涵盖自动语音识别(ASR)、智能体推理(agentic reasoning)、说话人日志(diarization)、视频理解、编码等。以下是展示该模型智能体和多模态能力的具体示例。
该示例展示了Gemma 4 12B的智能体和多模态理解能力。通过与现有的智能体框架(如OpenCode)结合,并使用llama.cpp和gemma-skills在本地部署,Gemma 4 12B能够编写一个Gradio应用程序来帮助用户处理图像。值得注意的是,这个应用程序本身就是由构建它的同一个Gemma 4 12B模型驱动的。
(原文此处嵌入了一个视频,展示了该过程)
抱歉,您的浏览器不支持播放此视频
研究人员使用Gemma 4 12B分析了https://www.youtube.com/watch?v=wYSncx9zLIU&start=932&end=1245https://www.youtube.com/watch?v=wYSncx9zLIU&start=932&end=1245中从00:15:32到00:20:45的5分钟片段。为此,他们提取了该片段的所有帧(以1 FPS的速率),并结合了视频的音频和以下提示词作为输入。
输入内容:
1. 313帧图像(1 FPS,图像尺寸调整以适应https://ai.google.dev/gemma/docs/capabilities/vision/image?_gl=1*jm0coc*_up*MQ..*_ga*MTI2MzkwODM0NS4xNzgwNDI5Mzg5*_ga_P1DBVKWT6V*czE3ODA0MjkzODkkbzEkZzAkdDE3ODA0MjkzODkkajYwJGwwJGgxOTEyOTEwNzc5#variable_resolution_token_budget为70)。
2. 提示词:"what happens when the man takes a selfie?"(“当那个男人自拍时发生了什么?”)
3. 视频的原始音频以及上述提示词。
模型输出分析:
<blockquote>当那个男人在这些演示视频中“自拍”或被展示手持智能手机放在脸前时,这是一种巧妙的视觉表现方式,用以说明AI模型如何获取现有的媒体——比如一张个人照片或一个视频片段——并对其进行“重构”。在这些特定的片段中,模型获取一张自拍照,并以此为基础生成各种场景(比如一个人在空间站,或在森林中行走)。
从本质上讲,这个男人并非真的在自拍;相反,他是在通过一个视觉隐喻来演示AI的能力,即获取一个特定的输入(一张“自拍”),并基于它生成一个全新的内容世界。这是Gemini Omni模型的“交换”(Swap)和“构建世界”(Build worlds)能力的展示部分,显示了其执行复杂、多模态推理和创造性生成的能力。
</blockquote>与Gemma 4 12B一同发布的,还有由LiteRT-LM驱动的强大设备端开发者集成,它将零延迟的本地AI执行能力原生带到标准桌面环境中。
原生MacOS应用。移动端的Google AI Edge Gallery应用正式扩展到桌面平台,支持在Apple Silicon GPU上离线、原生运行Gemma 4 12B。该应用内置一个安全的沙箱化Python执行循环,允许用户在聊天气泡内编写、执行代码并绘制科学图表。同时,Mac上的Google AI Edge Eloquent应用也增加了对Gemma 12B的支持,以驱动“语音编辑”(Voice Edit)对话式输入。
(原文此处嵌入了一个视频,展示了应用功能)
抱歉,您的浏览器不支持播放此视频
即插即用的本地API服务器 (litert-lm serve)。开发者可以使用新增的litert-lm serve https://ai.google.dev/edge/litert-lm/cli将Gemma 4 12B作为本地的、与OpenAI兼容的API服务器运行。这使得它能与标准集成工具(如Continue、Aider、OpenClaw、Hermes或OpenCode)无缝连接。该服务器利用内存中的无状态前缀缓存(stateless prefix caching)来匹配上下文历史记录,从而即时绕过预填充(prefill)延迟。
# 从Hugging Face仓库导入模型
litert-lm import --from-huggingface-repo=litert-community/gemma-4-12B-it-litert-lm gemma-4-12B-it.litertlm gemma4-12b
# 启动与OpenAI兼容的服务器
litert-lm serve
关于此功能的深入探讨,请参阅Google AI Edge Gallery的[这篇博客文章](https://developers.googleblog.com/bringing-gemma-4-12b-to-your-laptop-unlocking-local-agentic-workflows-with-google-ai-edge) 。
硬件配置:
软件配置:
gemma-skills。数据集:
本文档介绍了Gemma 4 12B模型,并鼓励开发者利用其创新的无编码器架构来构建本地化的多模态智能体。为了帮助开发者快速上手,提供了丰富的资源和工具:
该文档没有附录部分。
本文为一篇技术博客,未使用传统的数字编号引用格式,而是通过超链接提供了相关背景信息和资源的访问入口。以下是文中提到的主要链接及其内容: