APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 工具與應用

Inception Mercury 2.5 正式發佈:擴散式 LLM 達每秒1,107 Token,40%智能提升,代理工作流程新選擇

2026年9月12日0 瀏覽
Inception Mercury 2.5 正式發佈:擴散式 LLM 達每秒1,107 Token,40%智能提升,代理工作流程新選擇
Mercury 2.5
擴散式LLM
Inception Labs
AI工具
代理工作流程

Inception Mercury 2.5:擴散式 LLM 的速度革命與代理工作流程新範式

引言:打破自回歸模型的速度瓶頸

2026年9月8日,Inception Labs 正式發佈 Mercury 2.5,這是迄今為止訓練規模最大的擴散式大型語言模型(Diffusion Large Language Model,dLLM)。與傳統自回歸模型逐字生成文本的方式不同,Mercury 2.5 採用擴散架構,以並行方式生成和精煉整個文本塊,從根本上突破了標準 LLM 的速度瓶頸。

在 AI 代理工作流程對低延遲和高吞吐量需求日益迫切的今天,Mercury 2.5 的發佈代表著一種全新的技術路徑:不追求更大的模型規模,而是通過架構創新實現速度與質量的雙重突破。

核心技術:擴散架構的工作原理

自回歸 vs 擴散:根本性的架構差異

傳統自回歸模型(GPT、Claude、Gemini 等):

  • 逐字(Token)順序生成文本
  • 每個 Token 的生成依賴前一個 Token
  • 速度受限於順序處理的固有瓶頸
  • 典型速度:50-200 Token/秒

擴散式語言模型(Mercury 2.5):

  • 並行生成和精煉整個文本塊
  • 不存在順序依賴的瓶頸
  • 速度可以隨硬件並行能力線性擴展
  • Mercury 2.5 速度:1,107 Token/秒

這種架構差異使 Mercury 2.5 在相同硬件上的速度比典型自回歸模型快5-20倍,對於需要大量文本生成的代理工作流程而言,這是一個革命性的優勢。

技術規格

規格項目 Mercury 2.5
架構類型 擴散式 LLM(dLLM)
吞吐量 1,107 Token/秒(標準 NVIDIA GPU)
上下文窗口 260,000 Token
最大輸出長度 未公開
智能提升 比 Mercury 2 提升40%
性能對標 GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5

性能與能力

40%智能提升的具體含義

Inception Labs 報告 Mercury 2.5 比前代 Mercury 2 提升40%的智能,並將其性能定位為與以下成本優化前沿模型相當:

  • OpenAI GPT-5.6 Luna(低配版)
  • Google Gemini 3.5 Flash-Lite
  • Anthropic Claude Haiku 4.5

這一定位表明 Mercury 2.5 並非追求頂級性能,而是在「足夠好的質量」與「極致速度」之間找到最佳平衡點,特別適合對延遲敏感的應用場景。

代理工作流程的關鍵特性

Mercury 2.5 針對代理工作流程和搜索基礎設施管道進行了專項優化:

並行工具調用:

  • 支持同時調用多個外部工具
  • 大幅減少代理完成複雜任務的總時間
  • 特別適合需要多源數據整合的工作流程

可調節推理:

  • 允許用戶根據任務複雜度調整推理深度
  • 在速度和準確性之間靈活平衡
  • 降低簡單任務的計算成本

Schema 對齊 JSON 輸出:

  • 確保輸出嚴格符合預定義的 JSON 結構
  • 對於需要結構化數據的自動化工作流程至關重要
  • 減少後處理和數據清洗的需求

生態系統擴展:Mercury Voice 與 Mercury Router

Mercury Voice:語音代理的新選擇

與 Mercury 2.5 同步推出的 Mercury Voice 是專為語音代理設計的工具:

核心目標:

  • 首 Token 延遲(TTFT)低於170毫秒
  • 這一延遲水平接近人類對話的自然節奏
  • 使語音 AI 代理能夠提供流暢、自然的對話體驗

應用場景:

  • 客戶服務語音機器人
  • 實時語音翻譯
  • 語音驅動的 AI 助理

Mercury Router:智能任務路由

Mercury Router 是一個協調層,分析提示並根據質量、速度和成本的平衡,將任務路由到最合適的模型:

工作原理:

  1. 分析輸入提示的複雜度和類型
  2. 評估不同模型的成本效益比
  3. 自動選擇最優模型處理請求
  4. 在保持質量的同時最大化成本效率

這種智能路由機制可以幫助企業在不犧牲質量的情況下,將 AI 推理成本降低30-50%。

定價策略:激進的市場進入策略

標準定價

計費項目 標準價格
輸入(每百萬 Token) $0.20
輸出(每百萬 Token) $0.75

發佈折扣

Inception Labs 在發佈時提供了激進的80%折扣:

  • 折扣後輸入:每百萬 Token $0.04
  • 折扣後輸出:每百萬 Token $0.15

這一定價策略明顯低於主流前沿模型,使 Mercury 2.5 成為高吞吐量應用場景的極具競爭力的選擇。

企業選項

企業用戶可以申請:

  • 專用計算容量
  • 自動擴展能力
  • 可配置的數據保留選項

可用性與訪問渠道

訪問方式

Mercury 2.5 通過以下渠道提供訪問:

  • Inception API:直接 API 訪問
  • Baseten:企業級 ML 部署平台
  • OpenRouter:多模型路由平台

地區限制

目前,Mercury 2.5 在歐盟和歐洲經濟區不可用,原因是 Inception Labs 正在確保符合 GDPR 及當地法規。對於亞太地區的用戶,這一限制不適用,可以直接訪問所有功能。

對 AI 工具生態系統的影響

速度競爭的新維度

Mercury 2.5 的發佈,為 AI 模型競爭引入了一個新的重要維度:吞吐量。在此之前,AI 模型競爭主要集中在:

  • 基準測試性能(MMLU、HumanEval 等)
  • 上下文窗口大小
  • 多模態能力

Mercury 2.5 表明,對於特定應用場景(特別是代理工作流程和實時應用),吞吐量可能比原始智能更重要。

對亞太企業的實際意義

對於亞太地區的企業用戶,Mercury 2.5 的高吞吐量特性在以下場景中具有特別的價值:

客戶服務自動化:

  • 高峰期需要同時處理大量客戶查詢
  • 低延遲確保客戶體驗流暢

內容生成管道:

  • 媒體和電商平台需要大規模生成產品描述、新聞摘要等
  • 高吞吐量直接降低生成成本

金融數據分析:

  • 實時分析大量市場數據和新聞
  • 快速生成分析報告

結語:速度即競爭力

Inception Mercury 2.5 的發佈,提醒我們 AI 工具的競爭不僅僅是智能的競爭,更是速度、成本和適用性的全面競爭。對於需要高吞吐量、低延遲的代理工作流程,擴散式 LLM 架構提供了一條全新的技術路徑。

隨著 AI 代理在企業環境中的大規模部署,對高速、低成本推理的需求將持續增長。Mercury 2.5 的出現,為這一需求提供了一個有力的解決方案,也為整個 AI 工具生態系統的發展指明了新的方向。

常見問題

相關文章