
Inception Mercury 2.5:擴散式 LLM 的速度革命與代理工作流程新範式
引言:打破自回歸模型的速度瓶頸
2026年9月8日,Inception Labs 正式發佈 Mercury 2.5,這是迄今為止訓練規模最大的擴散式大型語言模型(Diffusion Large Language Model,dLLM)。與傳統自回歸模型逐字生成文本的方式不同,Mercury 2.5 採用擴散架構,以並行方式生成和精煉整個文本塊,從根本上突破了標準 LLM 的速度瓶頸。
在 AI 代理工作流程對低延遲和高吞吐量需求日益迫切的今天,Mercury 2.5 的發佈代表著一種全新的技術路徑:不追求更大的模型規模,而是通過架構創新實現速度與質量的雙重突破。
核心技術:擴散架構的工作原理
自回歸 vs 擴散:根本性的架構差異
傳統自回歸模型(GPT、Claude、Gemini 等):
- 逐字(Token)順序生成文本
- 每個 Token 的生成依賴前一個 Token
- 速度受限於順序處理的固有瓶頸
- 典型速度:50-200 Token/秒
擴散式語言模型(Mercury 2.5):
- 並行生成和精煉整個文本塊
- 不存在順序依賴的瓶頸
- 速度可以隨硬件並行能力線性擴展
- Mercury 2.5 速度:1,107 Token/秒
這種架構差異使 Mercury 2.5 在相同硬件上的速度比典型自回歸模型快5-20倍,對於需要大量文本生成的代理工作流程而言,這是一個革命性的優勢。
技術規格
| 規格項目 | Mercury 2.5 |
|---|---|
| 架構類型 | 擴散式 LLM(dLLM) |
| 吞吐量 | 1,107 Token/秒(標準 NVIDIA GPU) |
| 上下文窗口 | 260,000 Token |
| 最大輸出長度 | 未公開 |
| 智能提升 | 比 Mercury 2 提升40% |
| 性能對標 | GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 |
性能與能力
40%智能提升的具體含義
Inception Labs 報告 Mercury 2.5 比前代 Mercury 2 提升40%的智能,並將其性能定位為與以下成本優化前沿模型相當:
- OpenAI GPT-5.6 Luna(低配版)
- Google Gemini 3.5 Flash-Lite
- Anthropic Claude Haiku 4.5
這一定位表明 Mercury 2.5 並非追求頂級性能,而是在「足夠好的質量」與「極致速度」之間找到最佳平衡點,特別適合對延遲敏感的應用場景。
代理工作流程的關鍵特性
Mercury 2.5 針對代理工作流程和搜索基礎設施管道進行了專項優化:
並行工具調用:
- 支持同時調用多個外部工具
- 大幅減少代理完成複雜任務的總時間
- 特別適合需要多源數據整合的工作流程
可調節推理:
- 允許用戶根據任務複雜度調整推理深度
- 在速度和準確性之間靈活平衡
- 降低簡單任務的計算成本
Schema 對齊 JSON 輸出:
- 確保輸出嚴格符合預定義的 JSON 結構
- 對於需要結構化數據的自動化工作流程至關重要
- 減少後處理和數據清洗的需求
生態系統擴展:Mercury Voice 與 Mercury Router
Mercury Voice:語音代理的新選擇
與 Mercury 2.5 同步推出的 Mercury Voice 是專為語音代理設計的工具:
核心目標:
- 首 Token 延遲(TTFT)低於170毫秒
- 這一延遲水平接近人類對話的自然節奏
- 使語音 AI 代理能夠提供流暢、自然的對話體驗
應用場景:
- 客戶服務語音機器人
- 實時語音翻譯
- 語音驅動的 AI 助理
Mercury Router:智能任務路由
Mercury Router 是一個協調層,分析提示並根據質量、速度和成本的平衡,將任務路由到最合適的模型:
工作原理:
- 分析輸入提示的複雜度和類型
- 評估不同模型的成本效益比
- 自動選擇最優模型處理請求
- 在保持質量的同時最大化成本效率
這種智能路由機制可以幫助企業在不犧牲質量的情況下,將 AI 推理成本降低30-50%。
定價策略:激進的市場進入策略
標準定價
| 計費項目 | 標準價格 |
|---|---|
| 輸入(每百萬 Token) | $0.20 |
| 輸出(每百萬 Token) | $0.75 |
發佈折扣
Inception Labs 在發佈時提供了激進的80%折扣:
- 折扣後輸入:每百萬 Token $0.04
- 折扣後輸出:每百萬 Token $0.15
這一定價策略明顯低於主流前沿模型,使 Mercury 2.5 成為高吞吐量應用場景的極具競爭力的選擇。
企業選項
企業用戶可以申請:
- 專用計算容量
- 自動擴展能力
- 可配置的數據保留選項
可用性與訪問渠道
訪問方式
Mercury 2.5 通過以下渠道提供訪問:
- Inception API:直接 API 訪問
- Baseten:企業級 ML 部署平台
- OpenRouter:多模型路由平台
地區限制
目前,Mercury 2.5 在歐盟和歐洲經濟區不可用,原因是 Inception Labs 正在確保符合 GDPR 及當地法規。對於亞太地區的用戶,這一限制不適用,可以直接訪問所有功能。
對 AI 工具生態系統的影響
速度競爭的新維度
Mercury 2.5 的發佈,為 AI 模型競爭引入了一個新的重要維度:吞吐量。在此之前,AI 模型競爭主要集中在:
- 基準測試性能(MMLU、HumanEval 等)
- 上下文窗口大小
- 多模態能力
Mercury 2.5 表明,對於特定應用場景(特別是代理工作流程和實時應用),吞吐量可能比原始智能更重要。
對亞太企業的實際意義
對於亞太地區的企業用戶,Mercury 2.5 的高吞吐量特性在以下場景中具有特別的價值:
客戶服務自動化:
- 高峰期需要同時處理大量客戶查詢
- 低延遲確保客戶體驗流暢
內容生成管道:
- 媒體和電商平台需要大規模生成產品描述、新聞摘要等
- 高吞吐量直接降低生成成本
金融數據分析:
- 實時分析大量市場數據和新聞
- 快速生成分析報告
結語:速度即競爭力
Inception Mercury 2.5 的發佈,提醒我們 AI 工具的競爭不僅僅是智能的競爭,更是速度、成本和適用性的全面競爭。對於需要高吞吐量、低延遲的代理工作流程,擴散式 LLM 架構提供了一條全新的技術路徑。
隨著 AI 代理在企業環境中的大規模部署,對高速、低成本推理的需求將持續增長。Mercury 2.5 的出現,為這一需求提供了一個有力的解決方案,也為整個 AI 工具生態系統的發展指明了新的方向。


