APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 最新科技

Sakana Fugu Ultra v2 正式發佈:多代理協調架構達74.3% DeepSWE,每百萬 Token 輸出$30,挑戰單一前沿模型霸權

2026年9月12日0 瀏覽
Sakana Fugu Ultra v2 正式發佈:多代理協調架構達74.3% DeepSWE,每百萬 Token 輸出$30,挑戰單一前沿模型霸權
Sakana AI
多代理協調
Fugu Ultra v2
AI模型
DeepSWE

Sakana Fugu Ultra v2:重新定義 AI 模型競爭的多代理協調革命

引言:超越單一模型的新範式

2026年9月11日,日本 AI 研究公司 Sakana AI 正式發佈 Fugu Ultra v2,這款模型的問世不僅是一次技術迭代,更是對整個 AI 行業「更大模型等於更強能力」這一主流假設的根本性挑戰。

Fugu Ultra v2 的核心理念是:通過智能協調多個專業化模型,可以在不依賴任何單一前沿模型的情況下,達到甚至超越頂級模型的性能水平。這一理念在2026年9月的 AI 競爭格局中,具有深遠的戰略意義。

技術架構:TRINITY 與 Conductor 的結合

學術根基

Fugu Ultra v2 的技術架構建立在 Sakana AI 在 ICLR 2026 發表的兩篇重要論文之上:

TRINITY 論文:

  • 提出了一種學習型任務分解框架
  • 系統能夠自動識別複雜任務的子任務結構
  • 動態分配不同類型的代理(思考者、執行者、驗證者)

Conductor 論文:

  • 設計了多代理協調的指揮機制
  • 實現了跨模型的任務路由和結果整合
  • 建立了代理間的通信協議和衝突解決機制

代理角色分工

Fugu Ultra v2 採用三種核心代理角色:

代理類型 職責 適用場景
思考者(Thinker) 高層次推理和策略規劃 複雜問題分析、研究規劃
執行者(Worker) 具體任務執行和代碼生成 編程、數據處理、文件生成
驗證者(Verifier) 結果審核和質量控制 代碼測試、事實核查、邏輯驗證

這種分工機制使得系統能夠在不同任務類型上都保持高水準表現,同時避免了單一模型在所有任務上的性能妥協。

可替換模型池

Fugu Ultra v2 的一個關鍵設計決策是採用「可替換模型池」架構:

  • 系統不依賴任何單一的專有前沿模型
  • 可以靈活整合開源和商業模型
  • 有效規避供應商鎖定、API 撤銷和地緣政治服務中斷的風險

刻意排除的模型: 值得注意的是,v2.0 版本刻意從模型池中排除了 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra。這一決策並非技術限制,而是 Sakana AI 的戰略聲明:Fugu Ultra v2 的性能來自其協調架構本身,而非對特定旗艦模型的依賴。

性能基準:五項最佳成績

內部基準測試結果

Sakana AI 報告 Fugu Ultra v2 在八個內部基準測試中的五個達到最佳或並列最佳成績:

主要成績:

  • DeepSWE:74.3分(軟件工程任務基準)
  • Chartography:48.3分(圖表理解與生成基準)
  • GDP.pdf:最佳成績(複雜文件理解基準)
  • Toolathon:最佳成績(工具使用效率基準)
  • SWEFish:最佳成績(軟件工程魚類問題基準)

性能定位

Fugu Ultra v2 在性能上定位為「高能力、高質量」層級,與同系列的成本優化版 Fugu Max 形成互補:

  • Fugu Max:優先考慮成本效益,適合高頻率、標準化任務
  • Fugu Ultra v2:優先考慮峰值性能,適合複雜推理、自主研究和全棧軟件開發

獨立驗證的重要性

需要指出的是,截至2026年9月,上述性能數據均為 Sakana AI 自行報告,尚未在 Artificial Analysis 等主要第三方排行榜上獲得獨立驗證。這是評估這些數據時需要考慮的重要背景。

定價與可用性

定價結構

Fugu Ultra v2 提供透明的分層定價:

標準上下文(≤272K Token):

  • 輸入:每百萬 Token $5
  • 輸出:每百萬 Token $30
  • 緩存輸入:每百萬 Token $0.50

長上下文(>272K Token):

  • 輸入:每百萬 Token $10
  • 輸出:每百萬 Token $45
  • 緩存輸入:每百萬 Token $1.00

技術規格

  • 上下文窗口:100萬 Token
  • 最大輸出長度:128,000 Token
  • API 兼容性:OpenAI 相容 API
  • 訪問渠道:Inception API、Baseten、OpenRouter

地區限制

目前,Fugu 產品線在歐盟和歐洲經濟區不可用,原因是 Sakana AI 正在努力確保符合 GDPR 及當地法規要求。這一限制對亞太地區用戶影響較小,但對歐洲市場的企業客戶是一個重要考量。

對 AI 行業的戰略意義

挑戰「更大即更好」的主流假設

Fugu Ultra v2 的發佈,是對 AI 行業主流發展路徑的一次重要質疑。長期以來,AI 性能提升的主要路徑是增加模型參數量和訓練數據規模。Sakana AI 的研究表明,通過智能協調多個中等規模的專業化模型,可以在特定任務上達到甚至超越單一超大模型的性能。

對企業 AI 採購的影響

對於企業用戶而言,Fugu Ultra v2 的出現提供了一個新的選擇維度:

  1. 供應商多元化:不再依賴單一 AI 提供商
  2. 成本可控性:通過任務路由優化成本
  3. 風險分散:避免因單一供應商服務中斷而影響業務

亞太地區的採用前景

亞太地區的企業,特別是在新加坡、日本、韓國等技術成熟市場,對多代理協調架構的接受度較高。Sakana AI 作為日本 AI 公司,在亞太市場具有天然的文化和語言優勢,有望在區域市場獲得更快的採用速度。

結語:協調智能的時代

Sakana Fugu Ultra v2 的發佈,標誌著 AI 競爭進入了一個新階段:從單純的模型能力競爭,轉向協調架構的競爭。在這個新範式下,勝出的不一定是擁有最大模型的公司,而是能夠最有效地協調和整合多個 AI 能力的公司。

對於 AI 行業的從業者和觀察者而言,Fugu Ultra v2 提供了一個重要的思考框架:在追求 AI 能力的道路上,協調智能可能比單純的規模擴張更具可持續性和靈活性。

常見問題

相關文章