APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 最新科技

上海 AI 實驗室靜默發佈 Atria Dawn Preview:744B 參數開源代理 MoE 模型、MIT 授權、BrowseComp 達92.5,挑戰閉源前沿模型

2026年9月16日1 瀏覽
上海 AI 實驗室靜默發佈 Atria Dawn Preview:744B 參數開源代理 MoE 模型、MIT 授權、BrowseComp 達92.5,挑戰閉源前沿模型
開源AI
混合專家模型
代理AI
上海AI實驗室
大語言模型

上海 AI 實驗室靜默發佈 Atria Dawn Preview:開源代理 AI 的重大突破

低調發佈,高調性能

2026年9月11日,上海人工智能實驗室(Shanghai AI Laboratory)在沒有正式新聞稿、沒有博客文章、沒有定價公告的情況下,悄然在 GitHub 和 Hugging Face 上發佈了 Atria Dawn Preview——一個擁有 744億參數的開源代理混合專家(MoE)模型。

次日(9月12日),實驗室又發佈了 FP8 量化版本,進一步降低了部署門檻。

這種「靜默發佈」的方式在 AI 領域並不罕見,但 Atria Dawn 的規模和性能聲明立即引發了全球 AI 社區的廣泛關注。

技術架構:GLM-5.2 的代理進化

Atria Dawn Preview 建立在智譜 AI 的 GLM-5.2 基礎模型之上,採用稀疏混合專家架構:

技術規格 詳情
總參數量 744億(744B)
架構類型 稀疏混合專家(Sparse MoE)
每 Token 激活專家數 8/256
模型層數 78層
上下文窗口 100萬 Token(部分文檔標注256K)
授權協議 MIT(完全開源)
存儲需求 BF16版本約1.5TB;FP8版本約756GB
模態支持 純文本(分詞器含多模態標記但不支持視覺/音頻)

模型採用「GlmMoeDsaForCausalLM」配置,在78層中每個 Token 從256個專家中路由激活8個,這種稀疏激活設計在保持高性能的同時顯著降低了推理成本。

基準測試:代理任務的強勁表現

上海 AI 實驗室在16個基準測試中報告了 Atria Dawn Preview 的性能,在代理和工具使用相關任務上表現尤為突出:

優勢領域(供應商自報數據)

基準測試 得分 說明
BrowseComp 92.5 網絡瀏覽和信息檢索
DeepSearchQA 96.0 深度搜索問答
CyberGym 86.5 網絡安全任務
BFCL v4 77.0 函數呼叫能力
Terminal-Bench 2.1 78.3 終端操作能力

相對弱項

基準測試 得分
SWE-bench Pro 59.6
AutomationBench 53.8
JobBench 50.3

重要提示:截至2026年9月中旬,上述所有數據均為供應商自報,尚未經過 Artificial Analysis、BenchLM 等獨立機構的第三方驗證。BenchLM 已追蹤該模型但因獨立評估覆蓋不足而未給出公開排名。

「可驗證體驗管道」:代理訓練的新範式

Atria Dawn 的技術報告《Atria Dawn: The Dawn of Agentic Superintelligence》由143名研究人員共同撰寫,其中約三分之二為在校大學生。

報告的核心創新是**「可驗證體驗管道」(Verifiable Experience Pipeline)**:

  1. 工具介導的交互:模型通過工具與可執行環境交互
  2. 可重現性保障:每個步驟都連接到可執行環境,確保結果可重現
  3. 循環優先設計:模型被訓練為「分析→設計→執行代碼→迭代」的循環模式,而非單次推理

這種設計哲學與傳統的「單次問答」模型截然不同,更接近人類工程師解決複雜問題的方式。

開發過程中,56名參與者與模型協作完成了769個任務,這些真實任務的完成記錄成為模型訓練的重要數據來源。

部署考量:自托管的挑戰與機遇

Atria Dawn Preview 主要面向自托管場景,這對企業和研究機構既是機遇也是挑戰:

機遇

  • 完全數據主權:所有推理在本地完成,無需將數據發送至第三方服務器
  • MIT 授權:可自由商業使用,無需授權談判
  • 可定制性:可根據特定領域需求進行微調
  • 成本可控:一次性硬件投入,無按量計費

挑戰

  • 硬件要求高:BF16版本需約1.5TB存儲,FP8版本需約756GB
  • 運維複雜度:需要專業的 MLOps 團隊維護
  • 性能未獨立驗證:企業在生產部署前需自行評估

上海 AI 實驗室提供了 OpenAI 兼容的 API,但主要定位仍是自托管。

與競爭對手的比較

Atria Dawn Preview 在代理任務上的設計定位使其與其他開源模型形成差異化:

  • vs Qwen 3.8 Max:Qwen 依賴更高的激活參數數量,在通用推理上更強,但代理任務設計不如 Atria 專注
  • vs Grok 4.6:Grok 在數學和科學推理上更強,但 Atria 在網絡瀏覽和工具使用上更具優勢
  • vs GLM-5.2:Atria 是 GLM-5.2 的代理優化版本,在代理任務上有顯著提升

對亞太 AI 生態的意義

Atria Dawn Preview 的發佈對亞太地區 AI 生態具有深遠意義:

中國開源 AI 的持續崛起

繼 DeepSeek、Qwen 之後,上海 AI 實驗室再次展示了中國在開源 AI 領域的強大實力。MIT 授權的選擇表明中國 AI 機構正在積極融入全球開源生態。

亞太企業的本地化部署機遇

對於日本、韓國、新加坡、澳大利亞等亞太國家的企業而言,一個高性能的開源代理模型意味著:

  • 可以在本地數據中心部署,滿足數據主權要求
  • 可以針對本地語言和業務場景進行微調
  • 無需依賴美國雲服務提供商

學術研究的新基準

744B 參數的開源模型為亞太地區的 AI 研究機構提供了前所未有的研究平台,可以深入研究大規模 MoE 模型的內部機制。

待解問題與未來展望

儘管 Atria Dawn Preview 令人印象深刻,但仍有幾個關鍵問題有待解答:

  1. 獨立驗證:Artificial Analysis 等機構何時會發佈第三方評估?
  2. 多模態支持:分詞器中的多模態標記是否預示著未來版本將支持視覺和音頻?
  3. 商業版本:是否會推出性能更強的商業版本?
  4. 微調生態:社區是否會圍繞 Atria Dawn 建立豐富的微調模型生態?

結語

Atria Dawn Preview 的靜默發佈或許是2026年 AI 領域最重要的「低調時刻」之一。一個擁有744億參數、MIT 授權、專為代理任務優化的開源模型,正在挑戰閉源前沿模型的主導地位。

對於亞太地區的企業和研究機構而言,現在是深入評估 Atria Dawn 的最佳時機——在獨立驗證結果出爐之前,謹慎評估,但保持高度關注。

常見問題

相關文章