APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 最新科技

Google Gemini 3.7 Flash 正式發佈:DeepSWE 編程評分躍升至 65.3%,每百萬 Token 僅需 0.75 美元

2026年8月28日4 瀏覽
Google Gemini 3.7 Flash 正式發佈:DeepSWE 編程評分躍升至 65.3%,每百萬 Token 僅需 0.75 美元
Google Gemini
AI模型
編程AI
代理工作流程
大型語言模型

Google Gemini 3.7 Flash 正式發佈:編程能力大幅躍升,代理工作流程全面優化

發佈概覽

2026年8月13日,Google 正式發佈 Gemini 3.7 Flash,距離上一個版本 Gemini 3.6 Flash 的發佈僅僅三週。這一快速迭代的節奏,充分反映了當前 AI 模型競賽的激烈程度。

Gemini 3.7 Flash 被 Google 定位為一款「主力工作模型」(workhorse model),專為編程、代理工作流程及複雜推理任務而優化。從基準測試數據來看,這次更新帶來了顯著的性能提升,尤其在軟件工程和知識密集型任務方面表現突出。

核心性能數據

編程能力

基準測試 Gemini 3.6 Flash Gemini 3.7 Flash 提升幅度
DeepSWE v1.1 49.0% 65.3% +16.3 個百分點
FrontierCode 1.1 Main 34.4% 43.6% +9.2 個百分點

DeepSWE v1.1 是目前業界最受認可的代理編程基準測試之一,65.3% 的得分使 Gemini 3.7 Flash 在同等價位的模型中處於領先地位。

網頁開發能力

在 Arena.ai 的 WebDev Arena 評估中,Gemini 3.7 Flash 獲得 1588 Elo 分,相比前代的 1538 分提升了 50 分。這一指標反映了模型在設計還原度和功能性佈局生成方面的改進。

文件處理與業務自動化

基準測試 Gemini 3.6 Flash Gemini 3.7 Flash 提升幅度
GDP.pdf 22.0% 34.0% +12.0 個百分點
AutomationBench 17.0% 30.4% +13.4 個百分點

AutomationBench 的大幅提升(+13.4 個百分點)尤為值得關注,這直接反映了模型在企業業務流程自動化場景中的實用性提升。

技術規格

上下文窗口:延續前代的 1,048,576 Token(約 100 萬 Token)上下文窗口,支援超長文檔處理。

輸出限制:最大輸出 65,536 Token

多模態支援:支援文本、圖像、視頻、音頻及 PDF 文件的多模態輸入。

思維模式:提供低、中、高三個思維深度等級,默認為中等。思維 Token 計入輸出 Token 計數,用戶可通過調整思維等級來管理成本。

定價策略

Gemini 3.7 Flash 採用了具有競爭力的定價策略:

計費項目 2026年12月31日前 2027年1月1日起
輸入 Token(每百萬) $0.75 $1.50
輸出 Token(每百萬) $3.75 $7.50

這一定價使 Gemini 3.7 Flash 在高性能模型中保持了相當的成本競爭力。相比之下,Claude Fable 5 和 GPT-5.6 Sol 等頂級模型的定價通常高出數倍。

訪問渠道

開發者訪問

  • Gemini API
  • Google AI Studio
  • Android Studio
  • Gemini Enterprise Agent Platform

消費者訪問: 模型已整合至「Spark」——一款面向 Google AI Pro 和 Ultra 訂閱用戶的常駐個人代理。需要注意的是,Spark 目前在歐洲經濟區、英國、瑞士及尼日利亞不可用,受地區限制影響。

代理工作流程優化

Gemini 3.7 Flash 的核心設計理念,是成為代理工作流程中的可靠執行引擎。Google 在發佈說明中特別強調了以下改進:

多步驟規劃能力

模型在面對複雜的多步驟任務時,展現出更強的規劃連貫性,能夠在遇到障礙時自主調整執行路徑,而非簡單地停止或報錯。

工具使用精準度

在工具調用(tool use)場景中,模型的首次嘗試準確率(first-pass accuracy)顯著提升,減少了代理工作流程中因工具調用失敗而導致的重試次數。

長文檔理解

百萬 Token 的上下文窗口,配合改進的文檔理解能力,使模型能夠在處理大型代碼庫、法律文件或研究報告時保持更高的準確性。

安全措施

與 Google 在生物安全和網絡安全領域的一貫承諾一致,Gemini 3.7 Flash 包含了針對以下領域的更新安全防護措施:

  • 網絡進攻:防止模型被用於生成惡意代碼或攻擊工具
  • CBRN 威脅:化學、生物、放射性及核武器相關內容的嚴格過濾

亞太地區視角

對於亞太地區的開發者和企業而言,Gemini 3.7 Flash 的發佈帶來了幾個值得關注的機遇:

成本效益:$0.75/百萬輸入 Token 的定價,使中小型企業也能以可接受的成本構建基於 Gemini 的代理應用。

多語言能力:Gemini 系列模型在中文、日文、韓文等亞洲語言的處理能力上持續改進,有助於本地化應用開發。

企業整合:通過 Gemini Enterprise Agent Platform,亞太地區的企業可以更便捷地將 Gemini 3.7 Flash 整合到現有的業務流程中。

市場競爭格局

Gemini 3.7 Flash 的發佈,進一步加劇了 AI 模型市場的競爭。在同等價位區間,它現在需要與以下模型競爭:

  • Claude Fable 5(Anthropic):在長文檔分析和指令遵循方面見長
  • GPT-5.6 Sol(OpenAI):在多模態任務和生態系統整合方面具有優勢
  • Qwen3.8-27B(阿里巴巴):在消費級硬件上的本地部署方面具有競爭力

結語

Gemini 3.7 Flash 代表了 Google 在「快速迭代、持續改進」策略上的又一次成功實踐。在三週內實現如此顯著的性能提升,表明 Google 在模型訓練和優化方面的工程能力正在快速成熟。

對於正在評估 AI 模型的開發者和企業而言,Gemini 3.7 Flash 提供了一個在性能、成本和可用性之間取得良好平衡的選擇。其在代理工作流程方面的優化,也使其成為構建下一代 AI 應用的有力工具。

常見問題

相關文章