APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 工具與應用

阿里巴巴發布 Qwen3.8-Omni-Flash:百萬 Token 上下文全模態 AI 模型音視頻處理成本暴降98%

2026年9月24日1 瀏覽
阿里巴巴發布 Qwen3.8-Omni-Flash:百萬 Token 上下文全模態 AI 模型音視頻處理成本暴降98%
全模態AI
阿里巴巴
Qwen
AI工具
企業AI應用

阿里巴巴發布 Qwen3.8-Omni-Flash:百萬 Token 上下文全模態 AI 模型音視頻處理成本暴降98%

引言

2026年9月18日,阿里巴巴旗下 Qwen 團隊正式發布 Qwen3.8-Omni-Flash,這是一款原生全模態(omnimodal)AI 模型,支援文字、圖像、音頻及視頻的統一輸入處理,並配備高達 100萬 token 的超長上下文窗口。更令業界矚目的是,阿里巴巴宣稱每小時音頻攝取成本較前代下降超過 98%,混合音視頻輸入成本降幅超過 93%,為企業級媒體處理應用帶來革命性的成本優勢。

核心能力

Qwen3.8-Omni-Flash 的設計理念是將 AI 從被動感知工具轉變為主動代理生產系統。模型在單一工作流中原生處理多種模態,無需在不同專業模型之間切換。

技術規格:上下文窗口100萬token、支援最長2小時視頻和3小時音頻、輸入模態涵蓋文字圖像音頻視頻、輸出為文字(需外接TTS引擎輸出語音)、支援「思考模式」調節推理深度。

代理功能支持:函數調用(與外部工具和API無縫集成)、網絡搜索(實時獲取最新信息)、結構化輸出(生成符合特定格式的結構化數據)、空間音頻感知(實時版本可追蹤物理目標)。

性能突破

阿里巴巴報告顯示,Qwen3.8-Omni-Flash 在29項基準測試中的平均得分較前代 Qwen3.5-Omni-Plus 提升超過 25%,WildClawBench-MM 提升 +36.5 分,AgenticVBench 提升 +22.3 分,官方評估顯示其音視頻推理能力與 Google Gemini 3.8 Flash 相當。

成本革命

定價結構:國際定價每百萬輸入token $0.15,每百萬輸出token $0.47;國內定價分別為0.8元和2.7元人民幣。

成本降幅:每小時音頻攝取成本較前代下降超過 98%,混合音視頻輸入成本較前代下降超過 93%,並支援上下文緩存折扣。

主要應用場景

企業媒體處理:工業視頻編輯(自動分析識別異常)、會議轉錄與分析(處理長達3小時錄音)、多語言內容本地化。

代理工作流集成:複雜工具編排、長時程任務執行(利用100萬token上下文)、實時環境感知。

部署方式

Qwen3.8-Omni-Flash 不提供開源權重,僅通過阿里雲模型工作室以托管雲服務形式提供,支援 OpenAI 兼容的 API 端點。

亞太地區視角

Qwen3.8-Omni-Flash 的發布是中國 AI 企業在全球競爭中持續提升實力的最新例證。對於亞太地區的企業用戶,其優勢包括:對中文、日文、韓文等亞洲語言的理解和生成能力更強;定價比西方競爭對手更具競爭力;通過阿里雲部署更易滿足亞太地區的數據本地化要求;以及與阿里巴巴電商、物流及金融生態系統的深度整合。

技術限制

模型僅輸出文字,語音輸出需外接 TTS 引擎;無法本地部署,完全依賴阿里雲服務;使用雲端 API 意味著數據需傳輸至阿里雲服務器,對數據敏感的企業需謹慎評估。

結語

Qwen3.8-Omni-Flash 的發布標誌著全模態 AI 進入了一個新的成本效益時代。98%的音頻處理成本降幅和100萬 token 的超長上下文,使其成為企業級媒體處理應用的強力競爭者,有望加速亞太地區企業 AI 轉型的步伐。

常見問題

相關文章