究竟什麼是 Gemini 3.6 Flash?為什麼 Google 會在 Gemini Pro 之前發布它?Google 於 2026 年 7 月推出了 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,作為針對高流量開發者工作負載所設計、成本更低廉的 Gemini API 模型。此次發布凸顯了開發者在建構編碼代理(Coding Agents)與自動化工作流程時,對於定價、Token 效率及部署的考量。

Google Gemini 3.6 Flash 發布:有哪些變更?
重點總覽
- Google 推出了 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite,這些模型經過最佳化,能以更低成本應對高流量開發者工作負載。
- 基準測試數據顯示 Token 效率有所提升,其中輸出 Token 的消耗量相較於 Gemini 3.5 Flash 降低了最高 17%。
- 目前 Gemini Pro 尚未開放大眾使用,而 Flash 模型則代表了 Google 現階段以開發者為中心的推行重點。
Google 的產品擴展引入了兩個專為高流量開發者需求設計的模型層級。Gemini 3.6 Flash 作為主要的通用開發者模型,適用於程式編碼、文件解析與代理型任務。同時,Google 推出了 Gemini 3.5 Flash-Lite,專為低延遲工作負載設計,具備輕量化與高傳輸量的特性。
這些模型可透過 Google 的開發者平台(包括 Google AI Studio、Android Studio 及 Vertex AI)進行存取。Google 正持續將 Flash 系列模型推廣至其 AI 產品與開發者生態系中。

Gemini 3.6 Flash API 定價與 Token 效率
成本結構是本次發布的核心要素。Google 公布 Gemini 3.6 Flash API 的定價為每百萬輸入 Token $1.50 美元,以及每百萬輸出 Token $7.50 美元。針對輕量型工作負載,Gemini 3.5 Flash-Lite 將輸入成本降至每百萬 Token $0.30 美元,輸出成本則為每百萬 Token $2.50 美元。
下表概述了新款 Flash 模型層級的定價與目標工作負載:
| 模型 | 輸入定價 | 輸出定價 | 目標工作負載 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 / 100萬 tokens | $7.50 / 100萬 tokens | 代理工作流程、程式編碼、多步驟自動化 |
| Gemini 3.5 Flash-Lite | $0.30 / 100萬 tokens | $2.50 / 100萬 tokens | 高流量任務、文件解析、搜尋摘要 |
根據 Google 發布的評估報告,Gemini 3.6 Flash 相較於 Gemini 3.5 Flash,其輸出 Token 的使用量減少了最高 17%。根據官方產品公告中提到的 Artificial Analysis 外部基準測試,Gemini 3.5 Flash-Lite 的處理速度最高可達每秒 350 個輸出 Token。

Gemini 3.6 Flash 基準測試:程式編碼與代理性能
在軟體工程基準測試方面,Google 的評估顯示其在 DeepSWE 測試中的任務完成率有所提升,且產生的錯誤代碼修改次數更少。這些結果顯示在自動化程式編碼任務與軟體工程工作流程中,效能已有顯著改善。
此外,該模型在 OSWorld-Verified 評估中的電腦操作能力亦有所提升,評分從 Gemini 3.5 Flash 的 78.4% 提高至 83.0%。針對知識型任務,該模型在 GDPval-AA v2 評分中獲得 1421 分,展現出在處理圖表分析及文件起草等複雜多模態任務時,具備更強大的推理能力。

Gemini 3.6 Flash 與 Gemini Pro:可用性與模型選擇
雖然 Flash 模型已透過 API 平台廣泛提供,但 Gemini Pro 仍處於有限開放狀態,且 Google 尚未揭露更詳細的公開時程表。
下表比較了 Flash 與 Pro 模型層級之間的核心定位:
| 指標或功能 | Gemini Flash 層級 | Gemini Pro 層級 |
|---|---|---|
| 主要用途 | 高流量代理工作負載與程式編碼 | 複雜的單輪深度推理 |
| API 定價 | 公開定價 ($1.50 / $7.50) | 定價尚未廣泛公開 |
| 效能焦點 | 針對傳輸量與效率進行最佳化 | 針對進階推理能力進行最佳化 |
| 當前存取權 | 可透過 API 平台使用 | 有限開放 |
這種發布模式讓開發者在 Gemini Pro 尚未廣泛開放前,就能先使用成本更低的 Flash 模型。對於需要依序呼叫工具與自動化執行的生產環境工作負載,Flash 模型提供了速度與經濟效益之間的立即平衡。
為什麼開發者需要用於代理工作流程的低成本 AI 模型
Gemini 3.6 Flash 直接解決了由代理工作負載帶來的成本挑戰,即編碼代理與自動化系統在執行期間會產生大量重複的 API 呼叫。與單輪使用者查詢不同,自動化代理會在多步驟執行迴圈中運作:
[繁重單體推理迴圈] 使用者查詢 ──> 單體模型 ──> 高輸出 Token + 延遲 ──> API 成本上升 [Flash 代理執行迴圈] 使用者查詢 ──> Flash 系列模型 ──> 較低輸出 Token ──> 任務 API 成本降低
在代理迴圈中,模型接收提示、執行工具呼叫、接收輸出,然後重複該循環。由於每個代理迭代都需要額外的模型呼叫與生成的 Token,多步驟工作流程可能會迅速增加 API 消耗。透過減少冗長內容與輸出 Token 數量,Gemini 3.6 Flash 使企業級應用程式能夠以可預測的 API 費用執行自動化工作流程。
從 AI 推論成本到應用程式效率
類似的效率挑戰也出現在行動應用程式中,開發者需要在減少不必要用戶端處理的同時,保存獲客情境。伺服器端歸因平台透過跨破碎使用者旅程保存轉換情境,解決了類似的基礎架構問題。OpoInstall 為行動成長團隊提供這些功能。這些系統有助於在 App 安裝與使用者旅程中維護轉換情境,同時降低用戶端的複雜性。
Gemini Flash 部署的開發者檢查清單
為了在部署 Flash 模型時最佳化營運成本並確保系統效能穩定,工程與產品團隊應採取結構化的整合準則。
API 工程
- 監控 Token 消耗:稽核每次多輪代理請求的輸入與輸出 Token 數量,以追蹤執行支出。
- 設定代理執行限制:強制執行最大工具呼叫迭代上限,以防止無限執行迴圈。
- 快取重複情境:利用顯式的提示快取(Prompt Caching),避免重新處理靜態系統指令與固定提示。
產品團隊
- 衡量工作流程成本:稽核每位活躍使用者的 API Token 消耗,以確保產品功能維持獲利能力。
- 追蹤延遲與傳輸量:監控多步驟執行任務中的 API 往返時間與輸出 Token 生成速度。
- 評估各層級的投資回報率 (ROI):在決定升級至較大型模型層級前,務必對比任務完成品質與 Token 成本。
常見問題 (FAQ)
什麼是 Gemini 3.6 Flash?
Gemini 3.6 Flash 的用途是什麼?
Gemini 3.6 Flash 現在可以使用嗎?
Gemini 3.6 Flash 是免費的嗎?
Gemini 3.6 Flash 的 API 定價是多少?
Gemini 3.6 Flash 與 Gemini Pro 有什麼不同?
為什麼 Google 在 Pro 之前發布 Flash?
工程團隊的核心要點
Gemini 3.6 Flash 將 Google 的 Flash 系列定位為開發者建構生產級 AI 應用程式時的低成本選項,而 Gemini Pro 則維持在更著重於高推理能力的場景。此次發布顯示 Google 的 Flash 系列正鎖定生產規模的 AI 部署,其中成本效率與可靠性已變得與模型的原生能力同等重要。對於開發者而言,關鍵決策點不再僅是模型的能力,而是模型能否以生產規模與可預測的成本提供穩定可靠的效能。
Share this article



