Announcing Gemma 3n Preview: Powerful, Efficient, Mobile-First AI

Google for DevelopersAbout 2 min readMay 28, 2025Watch original
THE SUMMARYAI-generated

Gemma 3n 新特性详解

Key Concepts:

  • Gemma 3n: Google 最新、最小的开放模型,专注于设备端性能和效率。
  • 设备端函数调用: 模型在设备上直接调用特定功能,无需连接云端。
  • 图文混排: 模型能够理解和处理包含图像和文本的混合输入。
  • MatFormer架构: Gemma 3n 采用的独特二合一架构,包含一个小的嵌入式子模型,可在质量、速度和资源占用之间动态选择。
  • 预填充 (Prefill): 处理输入所需的时间。
  • 嵌入式子模型: MatFormer架构的一部分,允许动态选择模型性能。

1. 主要特性与关键点:

  • Gemma 3n 的定位: Gemma 3n 是 Gemma 系列的最新成员,专注于解锁引人注目的设备端体验,利用便携式计算的强大功能。 "n" 代表纳米尺寸模型,强调效率和设备端性能。
  • 与 Gemini Nano 的关系: Gemma 3n 基于与 Gemini Nano 相同的技术基础,开发者可以通过探索 Gemma 3n 提前预览 Gemini Nano 的架构和功能。
  • Gemma 3n 的新功能:
    • 最佳质量: 提供小模型前所未有的最佳质量,专为设备上表现突出的特定用例定制。
    • 设备端函数调用: 支持设备端函数调用,无需连接云端。
    • 图文混排: 支持图文混排,能够理解和处理包含图像和文本的混合输入。
    • 音频/视频输入: 首次在 Gemma 系列中支持音频和视频输入,使模型能够理解周围环境。
  • 性能优化: Gemma 3n 具备最高效的设备端人工智能推理配置文件,优化了架构,使其在移动处理器上表现出色。
    • 预填充速度比 Gemma 3 4B 模型快 1.5 倍。
    • 使用的内存更少。
  • MatFormer 架构: 采用独特的二合一 MatFormer 架构,包含一个小的嵌入式子模型,允许动态选择峰值质量、更快的速度和更低的资源占用,避免了管理单独模型的复杂性。
  • Google 的承诺: Gemma 3n 体现了 Google 向所有人提供开放、可访问的 AI 模型的承诺。

2. 重要示例与应用:

  • 维珍银河公司太空船一号复制品: 演示了模型理解图像的能力,可以识别物体并将其信息保存到笔记中。
  • 笔记功能: 演示了模型可以创建和管理笔记,例如 "拍摄视频" 和 "付给水管工47美元"。
  • 问题解答: 演示了模型可以回答各种问题,例如如何提高系统速度(添加缓存层)和计算房间面积。
  • 诗歌创作: 演示了模型可以根据要求创作诗歌。
  • 名人识别: 演示了模型可以根据描述识别名人(爱因斯坦)。

3. 步骤与方法:

  • 使用 Gemma 3n 的步骤:
    1. 下载模型。
    2. 使用提供的工具和提供程序探索模型。
    3. 根据需求选择合适的性能配置(通过 MatFormer 架构)。
    4. 将模型集成到应用程序中。

4. 论点与证据:

  • Gemma 3n 适合设备端应用: 通过优化架构和降低内存占用,Gemma 3n 实现了在移动处理器上的高性能,使其成为设备端应用的理想选择。
  • MatFormer 架构的优势: MatFormer 架构允许动态选择模型性能,避免了管理多个模型的复杂性,并提高了资源利用率。

5. 重要引言:

  • "Gemma 3n 中的“n”代表着它与我们的纳米尺寸模型的直接传承关系,表明其核心设计关注效率和设备端性能的前沿技术。"
  • "史上第一次,作为一个开放Gemma模型,Gemma 3n将建立在与我们的Gemini Nano模型相同的技术基础上。"

6. 技术术语:

  • 设备端函数调用: 模型在设备上直接调用特定功能,无需连接云端。
  • 图文混排: 模型能够理解和处理包含图像和文本的混合输入。
  • MatFormer架构: Gemma 3n 采用的独特二合一架构,包含一个小的嵌入式子模型,可在质量、速度和资源占用之间动态选择。
  • 预填充 (Prefill): 处理输入所需的时间。
  • CDN (Content Delivery Network): 内容分发网络,用于缓存静态资源,提高访问速度。

7. 逻辑连接:

视频首先介绍了 Gemma 3n 的定位和与 Gemini Nano 的关系,然后详细介绍了 Gemma 3n 的新功能,包括设备端函数调用、图文混排和音频/视频输入。 接着,视频强调了 Gemma 3n 的性能优化和 MatFormer 架构的优势。 最后,视频通过示例演示了 Gemma 3n 的应用场景,并鼓励开发者使用 Gemma 3n 解锁新的能力。

8. 数据与统计:

  • 预填充速度比 Gemma 3 4B 模型快 1.5 倍。

9. 结论:

Gemma 3n 是 Google 最新、最小的开放模型,专注于设备端性能和效率。 它具有最佳质量、支持设备端函数调用、图文混排和音频/视频输入,并采用独特的 MatFormer 架构,允许动态选择模型性能。 Gemma 3n 体现了 Google 向所有人提供开放、可访问的 AI 模型的承诺,并有望解锁设备端 AI 的新应用场景。

AI summaries can miss context or contain errors. Check important details against the original video.

MAKE IT YOURS

Read. Remember. Reuse.

Free tools

Go a little deeper.

Have a question about this video? Load its transcript to open the video chat.