Gemini 3.8 Flash
TL;DR · AI 摘要
Gemini 3.8 Flash是基于3.7版本的模型迭代,支持多模态输入输出,但技术细节披露有限。
核心要点
- Gemini 3.8 Flash支持1M token上下文窗口和64K token输出
- 模型基于Gemini 3.7 Flash架构,未披露具体改进细节
- 训练数据和处理方法需参考3.7版本模型卡片
结构提纲
按章节快速跳转。
- §模型信息
介绍Gemini 3.8 Flash的基本参数和功能特性
- ·架构依赖
明确基于Gemini 3.7 Flash的模型架构
- ›输入输出
支持文本、图像、音频、视频等多模态输入
- ·训练数据
训练数据信息需参考3.7版本模型卡片
- §评估方法
涵盖编码、多模态、长上下文等基准测试
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Gemini 3.8 Flash
- 模型特性
- 1M token上下文窗口
- 64K token输出
- 技术依赖
- 基于3.7 Flash架构
- 评估范围
- 编码
- 多模态
- 科学推理
金句 / Highlights
值得收藏与分享的关键句。
上下文窗口扩展至1M tokens,输出能力达64K tokens
所有技术细节均指向3.7版本模型卡片,缺乏独立披露
评估覆盖编码、科学推理等6大领域,但未公布具体指标
2026年9月2日发布
模型卡片旨在提供关于Gemini模型的基本信息,包括已知限制、缓解方法和安全性表现。模型卡片可能会随时间更新,例如在模型改进或修订时添加更新后的评估结果。请访问Google DeepMind网站查看完整的模型卡片列表。
发布日期:2026年9月
模型信息
描述
Gemini 3.8 Flash是Gemini 3系列模型的下一代产品,在Gemini 3.7 Flash基础上进行开发,软件工程和智能体知识工作流程方面实现了性能提升。它继续支持可定制的努力级别,以控制质量、成本和延迟的平衡。
模型依赖项
Gemini 3.8 Flash基于Gemini 3.7 Flash构建。
输入
文本字符串(如问题、提示、待总结的文档)、图像、音频和视频文件,上下文窗口最多可达1M个token。
输出
文本,输出长度可达64K个token。
架构
Gemini 3.8 Flash基于Gemini 3.7 Flash构建。有关Gemini 3.8 Flash模型架构的更多信息,请参阅Gemini 3.7 Flash的模型卡片。
- * *
模型数据
训练数据集
Gemini 3.8 Flash基于Gemini 3.7 Flash构建。有关Gemini 3.8 Flash训练数据集的更多信息,请参阅Gemini 3.7 Flash的模型卡片。
训练数据处理
有关Gemini 3.8 Flash训练数据处理的更多信息,请参阅Gemini 3.7 Flash的模型卡片。
- * *
实施与可持续性
硬件
Gemini 3.8 Flash基于Gemini 3.7 Flash构建。有关Gemini 3.8 Flash的硬件信息以及我们持续致力于可持续运营的承诺,请参阅Gemini 3.7 Flash的模型卡片。
软件
Gemini 3.8 Flash基于Gemini 3.7 Flash构建。有关Gemini 3.8 Flash的软件信息,请参阅Gemini 3.7 Flash的模型卡片。
- * *
- * *
评估
方法
Gemini 3.8 Flash在多个基准测试中进行了评估,包括编程、知识工作、多模态能力、长上下文处理、计算机使用和科学推理。更多基准测试以及方法、结果和方法论的详细信息,请访问:deepmind.com/models/evals-methodology/gemini-3-8-flash
结果
截至2026年9月的结果如下:
预期用途与限制
优势与预期用途
Gemini 3.8 Flash非常适合用户、开发者和企业使用,专为高效扩展通用型、生产就绪的智能体而设计。一些使用场景包括:软件工程、智能体任务和复杂知识工作流程。
已知限制
Gemini 3.8 Flash 可能会表现出基础模型的一些通用限制,例如幻觉现象。除此之外,我们持续改进模型的反制能力,近期已在 Frontier Safety 范围内加强了防护措施。偶尔也可能出现响应延迟或超时问题。在某些情况下,模型可能会使用更多 token 以实现性能最大化,尤其是在高努力级别场景中。
Gemini 3.8 Flash 的知识截止日期为 2026 年 3 月。用户在某些领域可以获取更新信息,而在其他领域可能发现模型知识仅限于 2025 年 1 月(与 Gemini 3 模型系列保持一致)。如需了解已知限制的详细信息,请参阅 Gemini 3.7 Flash 模型卡片。
可接受使用范围
如需了解 Gemini 3.7 Flash 的可接受使用范围,请参阅 Gemini 3.7 Flash 模型卡片。
- * *
伦理与内容安全
评估方法
如需了解 Gemini 3.8 Flash 的评估方法,请参阅 Gemini 3.7 Flash 模型卡片。
安全政策
如需了解 Gemini 3.8 Flash 的安全政策,请参阅 Gemini 3.7 Flash 模型卡片。
训练与开发评估结果
以下是开发阶段部分内部安全评估的结果。这些评估结果仅针对自动化评估,不包含人工评估或红队测试。分数表示与指定模型相比的绝对百分比变化,具体说明如下:
总体而言,Gemini 3.8 Flash 在安全性和语气方面与 Gemini 3.7 Flash 表现相似,且不合理拒绝率较低。与 Gemini 3.7 Flash 相比,非英语语言的安全性能略有下降。
| 评估项目 | 描述 | Gemini 3.8 Flash 与 Gemini 3.7 Flash 的对比 | | --- | --- | --- | | 文本到文本安全 | 测量安全政策的自动化内容安全评估 | -0.4个百分点(数值越低越好) | | 多语言安全 | 多语言环境下的自动化安全政策评估 | +5.4个百分点(数值越低越好) | | 图像到文本安全 | 测量安全政策的自动化内容安全评估 | 0.0个百分点(数值越低越好) | | 语气 1 | 测量模型响应客观语气的自动化评估 | +0.2个百分点(数值越高越好) | | 不合理拒绝 | 测量模型在处理边缘提示时安全响应能力的自动化评估 | +1.1个百分点(数值越低越好) |
- 在语气和指令遵循方面,正向百分比增长表示与 Gemini 3 Flash 相比,模型在敏感话题上的语气改进以及在保持安全前提下的指令遵循能力提升。我们用绿色标注改进项,红色标注退步项。
我们持续改进内部评估体系,包括优化自动化评估以减少误报和漏报,同时更新查询集以确保平衡性并维持高标准的评估结果。下文报告的性能结果是基于改进后的评估体系计算得出的,因此与之前Gemini模型卡片中公布的性能结果不具备直接可比性。
我们预计自动化安全评估结果会出现一定波动,因此会对标记内容进行人工复核,以排查是否存在严重或危险内容。人工审核确认的错误中,绝大多数属于以下两种情况:a) 误报,或 b) 并不构成严重风险。
人工红队测试结果
我们由独立于模型开发团队的专家团队执行人工红队测试,测试结果会反馈至模型团队。在儿童安全评估方面,Gemini 3.8 Flash已满足专家团队制定的发布阈值,这些阈值旨在保护儿童在线安全,并实现Google在儿童安全方面的承诺。在内容安全政策方面(包括儿童安全),与Gemini 3.7 Flash相比,Gemini 3.8 Flash在安全性表现上保持相似或有所提升。此外,红队测试的覆盖范围超出了严格政策范畴,与Gemini 3.1 Pro进行性能对比后,未发现任何严重问题。
前沿安全评估
Gemini 3.8 Flash属于Gemini 3系列模型。根据我们最新的前沿安全框架(2026年4月版),我们对Gemini 3.7 Flash进行了评估,发现其未达到任何追踪或关键能力级别(Tracked/Critical Capability Levels, T/CCLs)。评估结果表明,与Gemini 3.7 Flash相比,Gemini 3.8 Flash在前沿安全框架所列领域中未出现具有实质意义的新能力或显著性能提升;因此,基于Gemini 3.7 Flash的评估结果,我们有充分信心认为Gemini 3.8 Flash同样不太可能达到任何T/CCLs。
如需了解前沿安全评估的更多细节,请参阅Gemini 3.7 Flash的模型卡片。