APAIIF 亞太人工智能產業總會APAIIFAI 知識庫
AI 最新科技

DeepSeek V4.1 Flash 正式發佈:552B MoE 架構、原生多模態視覺、MIT 授權、GPQA Diamond 90.9,高效代理推理新標竿

2026年9月18日0 瀏覽
DeepSeek V4.1 Flash 正式發佈:552B MoE 架構、原生多模態視覺、MIT 授權、GPQA Diamond 90.9,高效代理推理新標竿
DeepSeek
開源AI模型
MoE架構
多模態AI
代理推理

DeepSeek V4.1 Flash 正式發佈:552B MoE 架構、原生多模態視覺、MIT 授權、GPQA Diamond 90.9,高效代理推理新標竿

引言

2026年9月10日,DeepSeek 正式發佈 DeepSeek-V4.1-Flash,這是其最新一代的混合專家(Mixture-of-Experts,MoE)語言模型。這款模型在架構設計上進行了根本性的創新,採用因果編碼器-解碼器(Causal Encoder-Decoder,CED)架構,擁有 552億個骨幹參數,並首次實現了原生多模態視覺整合。更重要的是,該模型以 MIT 授權發佈,允許商業使用和修改,為全球開發者和企業提供了一個強大的開源選擇。

架構創新:因果編碼器-解碼器設計

DeepSeek-V4.1-Flash 的核心架構創新在於其 CED 設計,這與傳統的純解碼器 Transformer 架構有根本性的不同。

關鍵架構特性

參數規模與激活效率

模型的骨幹參數達552億,但在推理時只激活總參數的一小部分:預填充(Prefill)階段激活約80億參數,解碼(Decoding)階段激活約160億參數。整個模型包含40個 Transformer 層。這種設計意味著模型在推理時只激活總參數的一小部分,大幅降低了計算成本,同時保持了高質量的輸出。

記憶體效率的突破

DeepSeek-V4.1-Flash 引入了三項關鍵工程創新:

  1. 壓縮稀疏注意力 2(CSA2):優化注意力計算的記憶體使用,通過稀疏化注意力模式減少計算量
  2. FP4 KV 快取:使用4位浮點數格式存儲鍵值快取,相比 FP16 格式節省75%的記憶體
  3. 投影全局 KV 快取:跨層共享快取信息,進一步減少重複計算

這三項創新的組合效果顯著:與上一代相比,HBM(高頻寬記憶體)需求降低至四分之一,SSD 存儲需求降低至八分之一。這對於在有限硬件資源上部署大型模型的企業和研究機構而言,具有重要的實際意義。

原生多模態視覺:從零開始的聯合訓練

DeepSeek-V4.1-Flash 的一個重大突破是其原生多模態視覺整合。與許多模型在預訓練後才添加視覺能力不同,V4.1-Flash 的視覺編碼器(DeepSeek-ViT)和投影器從預訓練開始就與語言模型聯合訓練。

這種從零開始的聯合訓練方式帶來了幾個優勢:

  • 視覺和語言表示之間的更深層次對齊,使模型能夠更自然地理解圖像中的文字和概念
  • 更自然的多模態推理能力,能夠在視覺和語言信息之間無縫切換
  • 在視覺問答和圖像分析任務上的更強性能

模型支持 100萬令牌上下文窗口,使其能夠處理超長文檔、複雜的多輪對話以及大型代碼庫。這一上下文長度對於需要分析長篇報告、法律文件或大型代碼庫的企業應用尤為重要。

可控推理努力:思考模式的精細調節

DeepSeek-V4.1-Flash 引入了一個創新的可控推理努力機制,允許用戶在1到100的範圍內調節模型的推理深度。

這一設計的實際意義在於:

  • 低推理努力(1-30):適合簡單查詢、快速回答,最小化延遲和成本,適用於高頻率的簡單任務
  • 中等推理努力(31-70):適合標準業務任務,平衡質量和效率,是大多數企業應用的最佳選擇
  • 高推理努力(71-100):適合複雜推理、科學問題和代碼生成,最大化準確性,適用於需要深度分析的關鍵任務

這種靈活性使企業能夠根據具體任務的需求動態調整推理成本,而不是為所有任務支付相同的計算費用。例如,一個企業可以為客服查詢設置低推理努力,為合同分析設置高推理努力,從而在整體上優化成本效益。

基準測試表現

DeepSeek-V4.1-Flash 在多個關鍵基準測試中展示了強勁的性能:

基準測試 得分 說明
GPQA Diamond 90.9 研究生水平科學問題,接近人類專家水平
Codeforces 評分 3471 競技編程能力,達到頂級程序員水平
Terminal-Bench 2.1 90.6 終端操作和系統管理任務

GPQA Diamond 90.9 的得分特別值得關注,這一基準測試評估模型在研究生水平科學問題上的表現,90.9 的得分代表了接近人類專家的水平。Codeforces 評分 3471 則顯示了模型在競技編程方面的卓越能力,這對於需要高質量代碼生成的企業應用具有重要意義。

API 定價與遷移策略

峰值/非峰值定價模型

DeepSeek 為 V4.1-Flash 引入了創新的峰值/非峰值定價模型,鼓勵企業在非峰值時段批量處理任務:

峰值時段(UTC 01:00-04:00 和 06:00-10:00 工作日):

  • 輸入:$0.30/百萬令牌
  • 輸出:$1.20/百萬令牌

非峰值時段:峰值價格的50%

  • 輸入:$0.15/百萬令牌
  • 輸出:$0.60/百萬令牌

快取輸入:低至 $0.003/百萬令牌

對於亞太地區的企業,UTC 01:00-04:00 對應的是亞洲工作時間(HKT 09:00-12:00),這意味著亞太地區的企業在正常工作時間內使用 API 可能需要支付峰值費率。企業可以通過在非工作時間批量處理任務來節省成本。

模型路由更新

自2026年9月14日起,所有發送至 deepseek-v4-pro 端點的請求自動路由至 DeepSeek-V4.1-Flash,並按 Flash 層級費率計費。舊端點(deepseek-v4-flashdeepseek-v4-flash-vision-exp)已退役,暫時作為新模型的別名運行。

亞太地區的影響

DeepSeek V4.1 Flash 的發佈對亞太地區的 AI 生態系統具有深遠影響:

開源優勢:MIT 授權允許亞太地區的企業和研究機構自由使用、修改和部署模型,無需支付高昂的 API 費用,特別適合資源有限的初創企業和學術機構。

多語言能力:DeepSeek 模型在中文處理方面具有天然優勢,對於亞太地區的中文市場(中國大陸、台灣、香港、新加坡等)尤為重要。原生多模態視覺能力也使模型能夠處理中文文檔中的圖表和圖像。

成本效益:峰值/非峰值定價模型和極低的快取輸入價格,使亞太地區的企業能夠以更低的成本構建 AI 應用。特別是對於需要處理大量重複性文檔的企業,快取輸入的低價格可以帶來顯著的成本節省。

本地部署選項:MIT 授權使企業能夠在自己的基礎設施上部署模型,這對於有數據主權要求的亞太地區企業(如金融機構、醫療機構和政府機構)尤為重要。

競爭格局分析

DeepSeek V4.1 Flash 的發佈進一步加劇了開源 AI 模型市場的競爭。與同期發佈的其他模型相比:

  • vs. OpenAI GPT-6 Astra:GPT-6 Astra 在整體性能上可能更強,但 DeepSeek V4.1 Flash 的開源性質和更低成本使其在特定場景下更具吸引力
  • vs. Alibaba Qwen 3.8 Max:兩者都是中國 AI 實驗室的開源旗艦模型,在不同基準測試上各有優勢,形成了健康的競爭格局
  • vs. Meta Muse Spark 1.3:DeepSeek 在推理效率和成本方面具有競爭優勢,特別是在記憶體效率方面的突破

結語

DeepSeek V4.1 Flash 代表了開源 AI 模型在效率、多模態能力和可控推理方面的重要進步。其 MIT 授權、創新的 CED 架構、原生多模態視覺和可控推理努力機制,使其成為企業和研究機構構建代理 AI 應用的有力選擇。對於亞太地區的 AI 從業者而言,這款模型提供了一個在成本、性能和靈活性之間取得良好平衡的開源選項,特別是對於需要在自有基礎設施上部署大型語言模型的企業,DeepSeek V4.1 Flash 的記憶體效率優勢使其成為一個極具吸引力的選擇。

常見問題

相關文章