
Google Gemini 3.7 Flash 正式發佈:編程能力大幅躍升,代理工作流程全面優化
發佈概覽
2026年8月13日,Google 正式發佈 Gemini 3.7 Flash,距離上一個版本 Gemini 3.6 Flash 的發佈僅僅三週。這一快速迭代的節奏,充分反映了當前 AI 模型競賽的激烈程度。
Gemini 3.7 Flash 被 Google 定位為一款「主力工作模型」(workhorse model),專為編程、代理工作流程及複雜推理任務而優化。從基準測試數據來看,這次更新帶來了顯著的性能提升,尤其在軟件工程和知識密集型任務方面表現突出。
核心性能數據
編程能力
| 基準測試 | Gemini 3.6 Flash | Gemini 3.7 Flash | 提升幅度 |
|---|---|---|---|
| DeepSWE v1.1 | 49.0% | 65.3% | +16.3 個百分點 |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2 個百分點 |
DeepSWE v1.1 是目前業界最受認可的代理編程基準測試之一,65.3% 的得分使 Gemini 3.7 Flash 在同等價位的模型中處於領先地位。
網頁開發能力
在 Arena.ai 的 WebDev Arena 評估中,Gemini 3.7 Flash 獲得 1588 Elo 分,相比前代的 1538 分提升了 50 分。這一指標反映了模型在設計還原度和功能性佈局生成方面的改進。
文件處理與業務自動化
| 基準測試 | Gemini 3.6 Flash | Gemini 3.7 Flash | 提升幅度 |
|---|---|---|---|
| GDP.pdf | 22.0% | 34.0% | +12.0 個百分點 |
| AutomationBench | 17.0% | 30.4% | +13.4 個百分點 |
AutomationBench 的大幅提升(+13.4 個百分點)尤為值得關注,這直接反映了模型在企業業務流程自動化場景中的實用性提升。
技術規格
上下文窗口:延續前代的 1,048,576 Token(約 100 萬 Token)上下文窗口,支援超長文檔處理。
輸出限制:最大輸出 65,536 Token。
多模態支援:支援文本、圖像、視頻、音頻及 PDF 文件的多模態輸入。
思維模式:提供低、中、高三個思維深度等級,默認為中等。思維 Token 計入輸出 Token 計數,用戶可通過調整思維等級來管理成本。
定價策略
Gemini 3.7 Flash 採用了具有競爭力的定價策略:
| 計費項目 | 2026年12月31日前 | 2027年1月1日起 |
|---|---|---|
| 輸入 Token(每百萬) | $0.75 | $1.50 |
| 輸出 Token(每百萬) | $3.75 | $7.50 |
這一定價使 Gemini 3.7 Flash 在高性能模型中保持了相當的成本競爭力。相比之下,Claude Fable 5 和 GPT-5.6 Sol 等頂級模型的定價通常高出數倍。
訪問渠道
開發者訪問:
- Gemini API
- Google AI Studio
- Android Studio
- Gemini Enterprise Agent Platform
消費者訪問: 模型已整合至「Spark」——一款面向 Google AI Pro 和 Ultra 訂閱用戶的常駐個人代理。需要注意的是,Spark 目前在歐洲經濟區、英國、瑞士及尼日利亞不可用,受地區限制影響。
代理工作流程優化
Gemini 3.7 Flash 的核心設計理念,是成為代理工作流程中的可靠執行引擎。Google 在發佈說明中特別強調了以下改進:
多步驟規劃能力
模型在面對複雜的多步驟任務時,展現出更強的規劃連貫性,能夠在遇到障礙時自主調整執行路徑,而非簡單地停止或報錯。
工具使用精準度
在工具調用(tool use)場景中,模型的首次嘗試準確率(first-pass accuracy)顯著提升,減少了代理工作流程中因工具調用失敗而導致的重試次數。
長文檔理解
百萬 Token 的上下文窗口,配合改進的文檔理解能力,使模型能夠在處理大型代碼庫、法律文件或研究報告時保持更高的準確性。
安全措施
與 Google 在生物安全和網絡安全領域的一貫承諾一致,Gemini 3.7 Flash 包含了針對以下領域的更新安全防護措施:
- 網絡進攻:防止模型被用於生成惡意代碼或攻擊工具
- CBRN 威脅:化學、生物、放射性及核武器相關內容的嚴格過濾
亞太地區視角
對於亞太地區的開發者和企業而言,Gemini 3.7 Flash 的發佈帶來了幾個值得關注的機遇:
成本效益:$0.75/百萬輸入 Token 的定價,使中小型企業也能以可接受的成本構建基於 Gemini 的代理應用。
多語言能力:Gemini 系列模型在中文、日文、韓文等亞洲語言的處理能力上持續改進,有助於本地化應用開發。
企業整合:通過 Gemini Enterprise Agent Platform,亞太地區的企業可以更便捷地將 Gemini 3.7 Flash 整合到現有的業務流程中。
市場競爭格局
Gemini 3.7 Flash 的發佈,進一步加劇了 AI 模型市場的競爭。在同等價位區間,它現在需要與以下模型競爭:
- Claude Fable 5(Anthropic):在長文檔分析和指令遵循方面見長
- GPT-5.6 Sol(OpenAI):在多模態任務和生態系統整合方面具有優勢
- Qwen3.8-27B(阿里巴巴):在消費級硬件上的本地部署方面具有競爭力
結語
Gemini 3.7 Flash 代表了 Google 在「快速迭代、持續改進」策略上的又一次成功實踐。在三週內實現如此顯著的性能提升,表明 Google 在模型訓練和優化方面的工程能力正在快速成熟。
對於正在評估 AI 模型的開發者和企業而言,Gemini 3.7 Flash 提供了一個在性能、成本和可用性之間取得良好平衡的選擇。其在代理工作流程方面的優化,也使其成為構建下一代 AI 應用的有力工具。


