
Sakana Fugu Ultra v2:重新定義 AI 模型競爭的多代理協調革命
引言:超越單一模型的新範式
2026年9月11日,日本 AI 研究公司 Sakana AI 正式發佈 Fugu Ultra v2,這款模型的問世不僅是一次技術迭代,更是對整個 AI 行業「更大模型等於更強能力」這一主流假設的根本性挑戰。
Fugu Ultra v2 的核心理念是:通過智能協調多個專業化模型,可以在不依賴任何單一前沿模型的情況下,達到甚至超越頂級模型的性能水平。這一理念在2026年9月的 AI 競爭格局中,具有深遠的戰略意義。
技術架構:TRINITY 與 Conductor 的結合
學術根基
Fugu Ultra v2 的技術架構建立在 Sakana AI 在 ICLR 2026 發表的兩篇重要論文之上:
TRINITY 論文:
- 提出了一種學習型任務分解框架
- 系統能夠自動識別複雜任務的子任務結構
- 動態分配不同類型的代理(思考者、執行者、驗證者)
Conductor 論文:
- 設計了多代理協調的指揮機制
- 實現了跨模型的任務路由和結果整合
- 建立了代理間的通信協議和衝突解決機制
代理角色分工
Fugu Ultra v2 採用三種核心代理角色:
| 代理類型 | 職責 | 適用場景 |
|---|---|---|
| 思考者(Thinker) | 高層次推理和策略規劃 | 複雜問題分析、研究規劃 |
| 執行者(Worker) | 具體任務執行和代碼生成 | 編程、數據處理、文件生成 |
| 驗證者(Verifier) | 結果審核和質量控制 | 代碼測試、事實核查、邏輯驗證 |
這種分工機制使得系統能夠在不同任務類型上都保持高水準表現,同時避免了單一模型在所有任務上的性能妥協。
可替換模型池
Fugu Ultra v2 的一個關鍵設計決策是採用「可替換模型池」架構:
- 系統不依賴任何單一的專有前沿模型
- 可以靈活整合開源和商業模型
- 有效規避供應商鎖定、API 撤銷和地緣政治服務中斷的風險
刻意排除的模型: 值得注意的是,v2.0 版本刻意從模型池中排除了 Claude Fable 5、Claude Fable 5.1 和 GPT-6 Astra。這一決策並非技術限制,而是 Sakana AI 的戰略聲明:Fugu Ultra v2 的性能來自其協調架構本身,而非對特定旗艦模型的依賴。
性能基準:五項最佳成績
內部基準測試結果
Sakana AI 報告 Fugu Ultra v2 在八個內部基準測試中的五個達到最佳或並列最佳成績:
主要成績:
- DeepSWE:74.3分(軟件工程任務基準)
- Chartography:48.3分(圖表理解與生成基準)
- GDP.pdf:最佳成績(複雜文件理解基準)
- Toolathon:最佳成績(工具使用效率基準)
- SWEFish:最佳成績(軟件工程魚類問題基準)
性能定位
Fugu Ultra v2 在性能上定位為「高能力、高質量」層級,與同系列的成本優化版 Fugu Max 形成互補:
- Fugu Max:優先考慮成本效益,適合高頻率、標準化任務
- Fugu Ultra v2:優先考慮峰值性能,適合複雜推理、自主研究和全棧軟件開發
獨立驗證的重要性
需要指出的是,截至2026年9月,上述性能數據均為 Sakana AI 自行報告,尚未在 Artificial Analysis 等主要第三方排行榜上獲得獨立驗證。這是評估這些數據時需要考慮的重要背景。
定價與可用性
定價結構
Fugu Ultra v2 提供透明的分層定價:
標準上下文(≤272K Token):
- 輸入:每百萬 Token $5
- 輸出:每百萬 Token $30
- 緩存輸入:每百萬 Token $0.50
長上下文(>272K Token):
- 輸入:每百萬 Token $10
- 輸出:每百萬 Token $45
- 緩存輸入:每百萬 Token $1.00
技術規格
- 上下文窗口:100萬 Token
- 最大輸出長度:128,000 Token
- API 兼容性:OpenAI 相容 API
- 訪問渠道:Inception API、Baseten、OpenRouter
地區限制
目前,Fugu 產品線在歐盟和歐洲經濟區不可用,原因是 Sakana AI 正在努力確保符合 GDPR 及當地法規要求。這一限制對亞太地區用戶影響較小,但對歐洲市場的企業客戶是一個重要考量。
對 AI 行業的戰略意義
挑戰「更大即更好」的主流假設
Fugu Ultra v2 的發佈,是對 AI 行業主流發展路徑的一次重要質疑。長期以來,AI 性能提升的主要路徑是增加模型參數量和訓練數據規模。Sakana AI 的研究表明,通過智能協調多個中等規模的專業化模型,可以在特定任務上達到甚至超越單一超大模型的性能。
對企業 AI 採購的影響
對於企業用戶而言,Fugu Ultra v2 的出現提供了一個新的選擇維度:
- 供應商多元化:不再依賴單一 AI 提供商
- 成本可控性:通過任務路由優化成本
- 風險分散:避免因單一供應商服務中斷而影響業務
亞太地區的採用前景
亞太地區的企業,特別是在新加坡、日本、韓國等技術成熟市場,對多代理協調架構的接受度較高。Sakana AI 作為日本 AI 公司,在亞太市場具有天然的文化和語言優勢,有望在區域市場獲得更快的採用速度。
結語:協調智能的時代
Sakana Fugu Ultra v2 的發佈,標誌著 AI 競爭進入了一個新階段:從單純的模型能力競爭,轉向協調架構的競爭。在這個新範式下,勝出的不一定是擁有最大模型的公司,而是能夠最有效地協調和整合多個 AI 能力的公司。
對於 AI 行業的從業者和觀察者而言,Fugu Ultra v2 提供了一個重要的思考框架:在追求 AI 能力的道路上,協調智能可能比單純的規模擴張更具可持續性和靈活性。


