什么是 Gemini 3.6 Flash?为什么 Google 会先发布它而不是 Gemini Pro?Google 于 2026 年 7 月推出了 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,作为面向高负载开发者业务的低成本 Gemini API 模型。此次发布凸显了开发者在构建代码代理(coding agents)和自动化工作流时,对定价、Token 效率及部署考量的重视。

Google Gemini 3.6 Flash 发布:有哪些变化?
概览
- Google 推出了 Gemini 3.6 Flash 和 3.5 Flash-Lite,旨在为高负载开发者工作流提供更具成本效益的选择。
- 据基准测试显示,新模型 Token 效率显著提升,其中输出 Token 消耗量较 Gemini 3.5 Flash 降低了约 17%。
- Gemini Pro 目前尚未向公众全面开放,而 Flash 系列代表了 Google 当前侧重于开发者生态的发布重心。
Google 通过此次产品扩展,推出了两个针对高频开发需求优化的模型层级。Gemini 3.6 Flash 是代码编写、文档解析和 Agent 代理任务的核心通用开发者模型。与此同时,Google 还发布了 Gemini 3.5 Flash-Lite,这是一款专为低延迟需求设计的轻量级、高吞吐模型。
开发者可通过 Google AI Studio、Android Studio 和 Vertex AI 等平台访问这些模型。Google 正在将其 Flash 系列模型推广至更多 AI 产品与开发者生态中。

Gemini 3.6 Flash API 定价与 Token 效率
成本结构是本次发布的重点。Google 公布的 Gemini 3.6 Flash API 定价为每百万输入 Token $1.50,每百万输出 Token $7.50。对于更轻量级的业务,Gemini 3.5 Flash-Lite 将输入成本降至每百万 Token $0.30,输出成本为 $2.50。
下表概括了新 Flash 模型层级的定价及目标业务场景:
| 模型 | 输入定价 | 输出定价 | 目标业务场景 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 / 1M tokens | $7.50 / 1M tokens | Agent 工作流、代码编写、多步自动化任务 |
| Gemini 3.5 Flash-Lite | $0.30 / 1M tokens | $2.50 / 1M tokens | 高频任务、文档解析、搜索归纳 |
根据 Google 公布的评估数据,Gemini 3.6 Flash 的输出 Token 占用量较 Gemini 3.5 Flash 降低了 17%。据第三方机构 Artificial Analysis 的基准测试显示,Gemini 3.5 Flash-Lite 的处理速度可达每秒 350 个输出 Token,详见官方产品公告。

Gemini 3.6 Flash 基准测试:代码与 Agent 性能
在软件工程基准测试中,Google 的评估显示其在 DeepSWE 测试中的任务完成率更高,且产生的不必要代码修改更少。这些结果表明该模型在自动化代码任务和软件工程流程方面表现更优。
此外,该模型在 OSWorld-Verified 测试中表现出更强的“计算机使用”能力,得分 83.0%,相比之下 Gemini 3.5 Flash 为 78.4%。在知识类任务中,该模型在 GDPval-AA v2 测试中获得了 1421 分,体现了其在图表分析和文档撰写等复杂多模态任务中具备更出色的推理能力。

Gemini 3.6 Flash vs Gemini Pro:可用性与模型选择
虽然 Flash 系列模型已可通过 API 平台广泛获取,但 Gemini Pro 仍处于受限开放状态,Google 尚未披露其向公众开放的详细时间表。
下表对比了 Flash 与 Pro 模型层级的核心定位:
| 维度或特性 | Gemini Flash 层级 | Gemini Pro 层级 |
|---|---|---|
| 主要用途 | 高频 Agent 工作流与代码开发 | 复杂单轮深度推理 |
| API 定价 | 公开定价 ($1.50 / $7.50) | 暂未广泛公布 |
| 性能侧重 | 针对吞吐量与执行效率优化 | 针对高级推理能力优化 |
| 当前获取方式 | 通过 API 平台直接访问 | 权限受限 |
这种发布模式让开发者能在 Gemini Pro 大规模上线前,抢先使用低成本的 Flash 模型。对于需要串行工具调用和自动化执行的生产级业务,Flash 系列模型在速度与经济性之间提供了直接的平衡。
为何开发者在 Agent 工作流中需要低成本 AI 模型?
Gemini 3.6 Flash 直接解决了 Agent 工作流带来的成本痛点,即代码代理和自动化系统在执行过程中会产生大量重复 API 调用。与单轮用户查询不同,自主智能体(Autonomous Agents)在多步循环中运行:
[繁重的单体推理循环] 用户查询 ──> 单体模型 ──> 大量输出 Token + 延迟 ──> API 成本激增 [Flash 代理执行循环] 用户查询 ──> Flash 系列模型 ──> 输出 Token 减少 ──> 单任务 API 成本降低
在 Agent 循环中,模型需接收提示词、执行工具调用、接收输出并重复该过程。由于每一轮迭代都需要额外的模型调用和 Token 生成,多步工作流会迅速增加 API 消耗。通过减少冗余及输出 Token 数,Gemini 3.6 Flash 使企业应用能够以可预见的 API 费用运行自动化流程。
从 AI 推理成本到应用执行效率
类似的效率挑战也出现在移动应用领域,开发者需要在减少不必要客户端处理的同时,保存获客上下文。服务端归因平台通过在碎片化的用户旅程中保存转化上下文,解决了类似的基建难题。OpoInstall 为移动增长团队提供了此类能力。这些系统在保持转化上下文跨应用安装与用户旅程传递的同时,降低了客户端开发的复杂度。
Gemini Flash 部署开发者指南
为优化运营成本并确保 Flash 模型部署时的系统稳定性,工程与产品团队应采取结构化的集成准则。
API 工程侧
- 监控 Token 消耗:审核多轮 Agent 请求的输入与输出 Token 数量,以把控执行开销。
- 设定 Agent 执行上限:强制设定工具调用迭代次数上限,防止陷入死循环。
- 缓存重复上下文:利用显式提示词缓存(prompt caching)避免重复处理静态系统指令与固定提示词。
产品团队侧
- 衡量单工作流成本:审核每活跃用户的 API Token 消耗,确保产品功能具备盈利空间。
- 追踪延迟与吞吐量:监控多步执行任务中的 API 往返耗时及输出 Token 生成速度。
- 评估跨层级 ROI:在决定升级至更大模型前,先对比任务完成质量与 Token 成本的投入产出比。
常见问题解答 (FAQ)
什么是 Gemini 3.6 Flash?
Gemini 3.6 Flash 有什么用途?
Gemini 3.6 Flash 现在可用吗?
Gemini 3.6 Flash 是免费的吗?
Gemini 3.6 Flash 的 API 定价如何?
Gemini 3.6 Flash 与 Gemini Pro 有什么区别?
为什么 Google 会先发布 Flash 而不是 Pro?
工程团队的关键要点
Gemini 3.6 Flash 的定位是将 Google 的 Flash 系列作为开发者构建生产级 AI 应用的低成本选项,而 Gemini Pro 则继续聚焦于更高能力的推理场景。此次发布显示,Google 的 Flash 系列正瞄准生产级的 AI 部署,即成本效益与可靠性正变得与模型原始能力同等重要。对于开发者而言,核心抉择不再仅仅是模型能力,而是模型能否在生产规模下提供可靠的性能表现以及可控的成本。
Share this article



