APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 最新科技

智譜AI發佈GLM-5.3-FlashX:10萬國產芯片驅動每秒200 tokens,中國AI基礎設施新里程碑

2026年9月20日1 瀏覽
智譜AI發佈GLM-5.3-FlashX:10萬國產芯片驅動每秒200 tokens,中國AI基礎設施新里程碑
智譜AI
GLM-5.3-FlashX
國產AI芯片
高速推理
中國AI

智譜AI發佈GLM-5.3-FlashX:10萬國產芯片驅動每秒200 tokens,中國AI基礎設施新里程碑

引言

2026年9月18日,中國領先的AI公司智譜AI正式發佈GLM-5.3-FlashX模型,這款高速推理服務以每秒高達200個tokens的速度震驚業界。更引人注目的是,這一性能完全由超過10萬枚國產AI芯片驅動,標誌著中國在AI基礎設施自主化道路上取得了重大突破。

GLM-5.3-FlashX的技術規格

模型架構

GLM-5.3-FlashX並非全新的基礎模型,而是GLM-5.3-Flash系列的高速推理配置版本。GLM-5.3-Flash原版於2026年8月26日由智譜AI開源發佈。

核心技術參數:

  • 模型規模:3200億參數的混合專家(MoE)架構,活躍參數180億
  • 上下文窗口:100萬tokens的超長上下文支持
  • 多模態能力:原生支持文本、圖像、視頻及文件輸入
  • 推理速度:峰值每秒200個tokens,較標準Flash版本的30-50 tokens/秒提升5-6倍

國產芯片的突破

這次發佈最具戰略意義的方面,是其完全依賴國產AI加速器的基礎設施:

  • 芯片規模:超過10萬枚國產AI加速器組成的大規模集群
  • 性能對標:智譜AI報告稱,優化後的效率水平可與主流NVIDIA GPU相媲美
  • 戰略意義:在美國對華芯片出口限制持續收緊的背景下,這一成就證明了國產硬件支持大規模高性能生產環境的能力

InfraAgent:AI自我優化的里程碑

GLM-5.3-FlashX發佈中最具技術前瞻性的亮點,是「InfraAgent」的應用——這是一個由GLM-5.3驅動的AI代理,參與了模型自身推理基礎設施的優化工作。

遞歸自我改進(RSI)的實踐

這是中國生產環境中首批有公開記錄的遞歸自我改進(RSI)案例之一:

  1. 問題診斷:InfraAgent分析性能瓶頸,識別推理鏈路中的低效環節
  2. 代碼修改:代理自主編寫和修改內核補丁,優化服務棧
  3. 效果驗證:在兩週內,端到端吞吐量提升了3.2倍

技術架構創新

FlashX的服務棧採用了多項先進技術:

  • EPD架構:解耦的編碼-預填充-解碼(Encode-Prefill-Decode)架構
  • ReplaySSM:先進的記憶技術,高效處理百萬token上下文
  • 混合量化:平衡精度與速度的量化策略
  • 強制思考模式thinking.type: enabled為必選項,不可禁用

「牛Alpha」的神秘測試期

在正式發佈前,GLM-5.3-FlashX以「牛Alpha」(Ox Alpha)的代號,匿名部署在OpenRouter和OpenCode等平台上進行公開測試。

測試數據:

  • 測試持續時間:6天
  • 處理tokens總量:超過62萬億個tokens
  • 這一規模的匿名測試,充分驗證了模型在真實生產環境中的穩定性和性能

市場定位與定價策略

API可用性

GLM-5.3-FlashX通過智譜AI的API和體驗中心提供服務,模型標識符為glm-5.3-flashx

定價結構

  • FlashX層級的定價約為標準Flash層級的2.5倍
  • 儘管價格較高,但在智譜AI的模型生態系統中仍定位為具有成本效益的選擇
  • 主要競爭對手:DeepSeek等高速模型

目標用戶場景

FlashX特別適合對延遲敏感的應用場景:

  • 代碼補全:實時代碼建議和自動完成
  • 實時對話:低延遲的交互式AI助理
  • 高頻API調用:需要快速響應的企業級應用

對亞太AI生態的影響

中國AI自主化的示範效應

GLM-5.3-FlashX的成功,對整個亞太地區的AI發展具有重要的示範意義:

  1. 技術自主:證明在先進芯片出口限制下,仍可構建世界級AI推理基礎設施
  2. 成本路徑:為其他亞太國家提供了一條不依賴西方芯片的AI發展路徑
  3. 競爭格局:加劇了全球AI模型市場的競爭,特別是在高速推理領域

亞太企業的機遇

對於亞太地區的企業用戶,GLM-5.3-FlashX提供了:

  • 更低延遲的AI服務,特別適合實時應用
  • 中文語言能力的天然優勢
  • 相對於西方模型的數據主權考量

行業反應與市場影響

GLM-5.3-FlashX的發佈在業界引發廣泛關注:

  • SCMP報道:智譜AI股價在「牛Alpha」模型身份揭露後大幅上漲
  • 技術社區:開發者對200 tokens/秒的速度表示驚嘆,認為這將顯著改善用戶體驗
  • 競爭壓力:DeepSeek等競爭對手面臨更大的速度競爭壓力

未來展望

智譜AI的這一突破預示著幾個重要趨勢:

  1. AI自我優化:InfraAgent的成功應用,預示著AI系統自我改進能力的快速發展
  2. 國產芯片崛起:10萬枚國產芯片的規模化應用,將加速中國AI芯片產業的成熟
  3. 速度競賽:高速推理將成為AI模型競爭的新維度,推動整個行業的技術進步
  4. 開源生態:GLM-5.3-Flash的開源策略,有助於建立更廣泛的開發者生態

結語

智譜AI發佈GLM-5.3-FlashX,不僅是一次技術性能的突破,更是中國AI基礎設施自主化進程中的重要里程碑。10萬枚國產芯片驅動每秒200 tokens的推理速度,以及InfraAgent實現的遞歸自我改進,都展示了中國AI技術的快速進步。

對於亞太地區的AI從業者和企業而言,這一發展值得密切關注,因為它不僅改變了高速AI推理的技術格局,也為整個地區的AI自主化發展提供了重要參考。

常見問題

相關文章