Gemma:Google DeepMind 的开源大语言模型工具库

Google DeepMind 开源的 Gemma 系列模型最近更新到了第四代,配套的 Python 工具库也同步发布在 PyPI 上。这个项目脱胎于 Gemini 的研究成果,目标是把大语言模型的使用门槛降到普通开发者的日常水平。目前项目在 GitHub 上获得了 5,393 个 Star。

Gemma 系列覆盖了从 2B 到 7B 的多个模型规格,既可以做文本生成,也支持图片和文本的混合输入。官方提供了一套完整的工具链,从模型下载、推理采样到微调训练都有对应的接口。

正文顶部截图

工具库的核心能力

Gemma 工具库用 JAX 实现,封装了模型加载、推理采样、微调三个核心环节。支持 CPU、GPU、TPU 三种运行环境。模型权重的硬件要求比较明确:2B 模型 8GB 显存就能跑,7B 模型需要 24GB 显存。

安装过程两步走,先按 JAX 官网文档装好对应硬件的 JAX,然后 pip install gemma 就行。

代码层面什么样子

官方示例代码很直观,十几行就能跑通一个多轮多模态对话:

from gemma import gm

model = gm.nn.Gemma4_E4B()
params = gm.ckpts.load_params(gm.ckpts.CheckpointPath.GEMMA4_E4B_IT)

sampler = gm.text.ChatSampler(
    model=model,
    params=params,
    multi_turn=True,
)

prompt = """Which of the 2 images do you prefer ?
Image 1: <|image|>
Image 2: <|image|>
Write your answer as a poem."""
out = sampler.chat(prompt, images=[image1, image2])

同一个 ChatSampler 接口兼容 Gemma 2、3、3n、4 所有版本。换模型改一行参数就行,调用代码不用动。图片和文本混合输入内建在 API 里,不需要额外处理多模态的拼接逻辑。

README区域截图

实际表现

更新节奏快。 从 Gemma 1 到 Gemma 4,Google DeepMind 保持了密集的迭代频率。每一代模型都配有公开的技术报告,从 Gemma 1 的简版报告到 Gemma 4 的完整 model card,指标数据和能力边界写得很透明,做评估对比时有据可查。

微调路径完整。 官方文档里有 Fine-tuning 和 LoRA 两种方式的 Colab 教程,配合 examples 目录下的脚本,覆盖了从全量微调到低秩适配的主要场景。对于需要在特定领域做定制化训练的团队来说,上手成本不高,也不需要自己从头搭训练框架。

文档密度高。 采样、多模态、微调、LoRA 各有独立的教程页面,ReadTheDocs 上有完整的技术文档。开源项目做到这个文档覆盖度的不多。

当前的限制

JAX 生态是硬性前提。如果你的项目基于 PyTorch,接入这个工具库需要额外做适配工作。社区里有 PyTorch 版本的 Gemma 实现,但那不是官方维护的,稳定性和更新速度没法保证。

模型的商用条款需要单独查看 Google 发布的许可协议。开源代码和模型权重的授权范围可能不同,做商业产品前要把这部分确认清楚。

适合什么场景

做 AI 应用开发的团队,如果需要一个有持续研发保障的开源基座模型做二次开发,Gemma 是目前可选项里值得认真评估的一个。Google DeepMind 持续投入研发资源,短期内模型停更的风险很低。

学术研究者可以拿来做对比实验。公开的技术报告提供了评估基准,方便和其他模型做横向比较。

个人开发者如果显卡配置够用,拿 Gemma 4 的 2B 或 7B 模型做本地推理和微调试验,也是个不错的起点。特别是做多模态应用的,Gemma 4 原生支持图片输入,省去了额外接视觉编码器的步骤。

本地推理和微调试验,也是个不错的起点。特别是做多模态应用的,Gemma 4 原生支持图片输入,省去了额外接视觉编码器的步骤。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐