Google Gemini 3.6 Flash:API 定價、基準測試與 Pro 版本狀態

opoinstall
2026-07-22
5 min read

究竟什麼是 Gemini 3.6 Flash?為什麼 Google 會在 Gemini Pro 之前發布它?Google 於 2026 年 7 月推出了 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,作為針對高流量開發者工作負載所設計、成本更低廉的 Gemini API 模型。此次發布凸顯了開發者在建構編碼代理(Coding Agents)與自動化工作流程時,對於定價、Token 效率及部署的考量。

Gemini 3.6 Flash 封面圖,展示全新模型系列

Google Gemini 3.6 Flash 發布:有哪些變更?

重點總覽

  • Google 推出了 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,這些模型經過最佳化,能以更低成本應對高流量開發者工作負載。
  • 基準測試數據顯示 Token 效率有所提升,其中輸出 Token 的消耗量相較於 Gemini 3.5 Flash 降低了最高 17%。
  • 目前 Gemini Pro 尚未開放大眾使用,而 Flash 模型則代表了 Google 現階段以開發者為中心的推行重點。

Google 的產品擴展引入了兩個專為高流量開發者需求設計的模型層級。Gemini 3.6 Flash 作為主要的通用開發者模型,適用於程式編碼、文件解析與代理型任務。同時,Google 推出了 Gemini 3.5 Flash-Lite,專為低延遲工作負載設計,具備輕量化與高傳輸量的特性。

這些模型可透過 Google 的開發者平台(包括 Google AI Studio、Android Studio 及 Vertex AI)進行存取。Google 正持續將 Flash 系列模型推廣至其 AI 產品與開發者生態系中。

Gemini 3.5 Flash-Lite 基準測試,展示速度與效率的提升

Gemini 3.6 Flash API 定價與 Token 效率

成本結構是本次發布的核心要素。Google 公布 Gemini 3.6 Flash API 的定價為每百萬輸入 Token $1.50 美元,以及每百萬輸出 Token $7.50 美元。針對輕量型工作負載,Gemini 3.5 Flash-Lite 將輸入成本降至每百萬 Token $0.30 美元,輸出成本則為每百萬 Token $2.50 美元。

下表概述了新款 Flash 模型層級的定價與目標工作負載:

模型 輸入定價 輸出定價 目標工作負載
Gemini 3.6 Flash $1.50 / 100萬 tokens $7.50 / 100萬 tokens 代理工作流程、程式編碼、多步驟自動化
Gemini 3.5 Flash-Lite $0.30 / 100萬 tokens $2.50 / 100萬 tokens 高流量任務、文件解析、搜尋摘要

根據 Google 發布的評估報告,Gemini 3.6 Flash 相較於 Gemini 3.5 Flash,其輸出 Token 的使用量減少了最高 17%。根據官方產品公告中提到的 Artificial Analysis 外部基準測試,Gemini 3.5 Flash-Lite 的處理速度最高可達每秒 350 個輸出 Token。

Gemini 3.6 Flash Token 效率基準測試圖表,展示輸出消耗量的減少

Gemini 3.6 Flash 基準測試:程式編碼與代理性能

在軟體工程基準測試方面,Google 的評估顯示其在 DeepSWE 測試中的任務完成率有所提升,且產生的錯誤代碼修改次數更少。這些結果顯示在自動化程式編碼任務與軟體工程工作流程中,效能已有顯著改善。

此外,該模型在 OSWorld-Verified 評估中的電腦操作能力亦有所提升,評分從 Gemini 3.5 Flash 的 78.4% 提高至 83.0%。針對知識型任務,該模型在 GDPval-AA v2 評分中獲得 1421 分,展現出在處理圖表分析及文件起草等複雜多模態任務時,具備更強大的推理能力。

開發者對 Gemini Flash Token 效率的見證

Gemini 3.6 Flash 與 Gemini Pro:可用性與模型選擇

雖然 Flash 模型已透過 API 平台廣泛提供,但 Gemini Pro 仍處於有限開放狀態,且 Google 尚未揭露更詳細的公開時程表。

下表比較了 Flash 與 Pro 模型層級之間的核心定位:

指標或功能 Gemini Flash 層級 Gemini Pro 層級
主要用途 高流量代理工作負載與程式編碼 複雜的單輪深度推理
API 定價 公開定價 ($1.50 / $7.50) 定價尚未廣泛公開
效能焦點 針對傳輸量與效率進行最佳化 針對進階推理能力進行最佳化
當前存取權 可透過 API 平台使用 有限開放

這種發布模式讓開發者在 Gemini Pro 尚未廣泛開放前,就能先使用成本更低的 Flash 模型。對於需要依序呼叫工具與自動化執行的生產環境工作負載,Flash 模型提供了速度與經濟效益之間的立即平衡。

為什麼開發者需要用於代理工作流程的低成本 AI 模型

Gemini 3.6 Flash 直接解決了由代理工作負載帶來的成本挑戰,即編碼代理與自動化系統在執行期間會產生大量重複的 API 呼叫。與單輪使用者查詢不同,自動化代理會在多步驟執行迴圈中運作:

[繁重單體推理迴圈]
  使用者查詢 ──> 單體模型 ──> 高輸出 Token + 延遲 ──> API 成本上升


[Flash 代理執行迴圈]
  使用者查詢 ──> Flash 系列模型 ──> 較低輸出 Token ──> 任務 API 成本降低

在代理迴圈中,模型接收提示、執行工具呼叫、接收輸出,然後重複該循環。由於每個代理迭代都需要額外的模型呼叫與生成的 Token,多步驟工作流程可能會迅速增加 API 消耗。透過減少冗長內容與輸出 Token 數量,Gemini 3.6 Flash 使企業級應用程式能夠以可預測的 API 費用執行自動化工作流程。

從 AI 推論成本到應用程式效率

類似的效率挑戰也出現在行動應用程式中,開發者需要在減少不必要用戶端處理的同時,保存獲客情境。伺服器端歸因平台透過跨破碎使用者旅程保存轉換情境,解決了類似的基礎架構問題。OpoInstall 為行動成長團隊提供這些功能。這些系統有助於在 App 安裝與使用者旅程中維護轉換情境,同時降低用戶端的複雜性。

Gemini Flash 部署的開發者檢查清單

為了在部署 Flash 模型時最佳化營運成本並確保系統效能穩定,工程與產品團隊應採取結構化的整合準則。

API 工程

  • 監控 Token 消耗:稽核每次多輪代理請求的輸入與輸出 Token 數量,以追蹤執行支出。
  • 設定代理執行限制:強制執行最大工具呼叫迭代上限,以防止無限執行迴圈。
  • 快取重複情境:利用顯式的提示快取(Prompt Caching),避免重新處理靜態系統指令與固定提示。

產品團隊

  • 衡量工作流程成本:稽核每位活躍使用者的 API Token 消耗,以確保產品功能維持獲利能力。
  • 追蹤延遲與傳輸量:監控多步驟執行任務中的 API 往返時間與輸出 Token 生成速度。
  • 評估各層級的投資回報率 (ROI):在決定升級至較大型模型層級前,務必對比任務完成品質與 Token 成本。

常見問題 (FAQ)

什麼是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是 Google 推出的低成本 Gemini 模型,專為高流量 API 工作負載設計,包含編碼代理、文件處理與自動化工作流程。
Gemini 3.6 Flash 的用途是什麼?
Gemini 3.6 Flash 專為編碼代理、文件處理、自動化工作流程以及其他需要較低延遲與可預測 API 成本的高流量 AI 應用程式所設計。
Gemini 3.6 Flash 現在可以使用嗎?
是的,Gemini 3.6 Flash 可透過 Google 的開發者平台(包括 Google AI Studio、Android Studio 及 Vertex AI)進行存取。
Gemini 3.6 Flash 是免費的嗎?
Gemini 3.6 Flash 可透過 Google 的開發者平台使用,但 API 的使用需根據輸入與輸出消耗進行計費。
Gemini 3.6 Flash 的 API 定價是多少?
Gemini 3.6 Flash API 定價為每百萬輸入 Token $1.50 美元,以及每百萬輸出 Token $7.50 美元。此定價結構專為Token 效率與傳輸量至關重要的高流量 API 工作負載而設計。
Gemini 3.6 Flash 與 Gemini Pro 有什麼不同?
Gemini 3.6 Flash 針對高流量、低成本工作負載進行最佳化,而 Gemini Pro 則針對更複雜的推理任務,在這些任務中,能力優先於速度與價格。
為什麼 Google 在 Pro 之前發布 Flash?
Google 優先考慮 Flash 模型,以滿足開發者對於生產環境中高傳輸量、低延遲 API 執行的需求,而 Gemini Pro 尚未達到廣泛公開的可用性。

工程團隊的核心要點

Gemini 3.6 Flash 將 Google 的 Flash 系列定位為開發者建構生產級 AI 應用程式時的低成本選項,而 Gemini Pro 則維持在更著重於高推理能力的場景。此次發布顯示 Google 的 Flash 系列正鎖定生產規模的 AI 部署,其中成本效率與可靠性已變得與模型的原生能力同等重要。對於開發者而言,關鍵決策點不再僅是模型的能力,而是模型能否以生產規模與可預測的成本提供穩定可靠的效能。

Share this article