APAIIF 亞太人工智能產業總會APAIIFAI 知識庫

AI 最新科技

追蹤人工智能領域的最新突破與技術進展

共 11 篇文章

OpenAI GPT-6 Astra 正式發佈:ARC-AGI-3 評分 99.9%、ExploitBench 滿分,史上首個達到「危急」網絡安全門檻的 AI 模型

OpenAI GPT-6 Astra 正式發佈:ARC-AGI-3 評分 99.9%、ExploitBench 滿分,史上首個達到「危急」網絡安全門檻的 AI 模型

OpenAI 於 2026 年 9 月 3 日正式發佈 GPT-6 Astra,ARC-AGI-3 評分達 99.9%、ExploitBench 滿分 100%,成為史上首個觸及「危急」網絡安全門檻的 AI 模型。模型在 10 萬個 GPU 上訓練,採用分階段發佈策略,攻擊性網絡能力僅限 Daybreak Blue 計劃的受審查防禦者使用。

2026年9月4日5
Google Gemini 3.8 Flash 正式發佈:六週三次更新創紀錄,Flash Cyber 安全專用版漏洞修補準確率提升2.6倍

Google Gemini 3.8 Flash 正式發佈:六週三次更新創紀錄,Flash Cyber 安全專用版漏洞修補準確率提升2.6倍

Google 發佈 Gemini 3.8 Flash 及安全專用版 Flash Cyber,六週內完成三次 Flash 系列更新。3.8 Flash 在 DeepSWE v1.1 排行榜奪冠,Flash Cyber 漏洞修補準確率較大型商業模型提升2.6倍,僅向受信任測試人員和政府機構開放。

2026年9月3日4
Anthropic Claude Fable 5.1 正式發佈:快取讀取成本降75%、Terminal-Bench-Science評分翻倍,代理工作流程成本節省達45%

Anthropic Claude Fable 5.1 正式發佈:快取讀取成本降75%、Terminal-Bench-Science評分翻倍,代理工作流程成本節省達45%

Anthropic Claude Fable 5.1於2026年9月1日發佈,快取讀取成本降75%,代理工作流程成本節省達45%,Terminal-Bench-Science評分從24.7躍升至52.6,並引入三項破壞性API變更。

2026年9月2日4
Anthropic 模型硬件標準(MHS)研究預覽:AI 代理直接操控實體設備,QuEra 量子激光成功率從 58% 躍升至 99.3%

Anthropic 模型硬件標準(MHS)研究預覽:AI 代理直接操控實體設備,QuEra 量子激光成功率從 58% 躍升至 99.3%

Anthropic 於2026年8月27日推出模型硬件標準(MHS)研究預覽,讓 AI 代理直接操控機械臂、量子激光等實體設備。QuEra 量子激光成功率從58%躍升至99.3%,CMU 實驗速度提升三倍,標誌 AI 進入物理世界新紀元。

2026年9月1日5
Anthropic Claude Opus 5 正式發佈:同等定價下性能媲美 Fable 5,ARC-AGI-3 評分三倍領先、85% 減少拒絕回應

Anthropic Claude Opus 5 正式發佈:同等定價下性能媲美 Fable 5,ARC-AGI-3 評分三倍領先、85% 減少拒絕回應

Anthropic 於2026年7月24日發佈 Claude Opus 5,定位為「近前沿」旗艦模型,以與 Opus 4.8 相同的定價(每百萬輸入 Token 5美元、輸出 25美元)提供媲美 Fable 5 的性能。Opus 5 在 ARC-AGI-3 評分上三倍領先次優模型,拒絕回應率降低 85%,並支援 100萬 Token 上下文窗口,成為 Claude Max 和 Claude Pro 用戶的預設模型。

2026年8月31日5
智譜 AI GLM-5.3-Flash 揭秘:「Ox Alpha」神秘模型正體曝光,320B MoE 架構每日7000萬請求創紀錄

智譜 AI GLM-5.3-Flash 揭秘:「Ox Alpha」神秘模型正體曝光,320B MoE 架構每日7000萬請求創紀錄

2026年8月26日,智譜 AI 正式確認神秘模型「Ox Alpha」為 GLM-5.3-Flash,一個320B參數混合專家架構模型,具備100萬 Token 上下文窗口及原生多模態能力,以 MIT 授權開源,在匿名測試期間每日請求量突破7000萬次,以國產 AI 晶片提供服務。

2026年8月30日4
Google Gemini 3.7 Flash 正式發佈:DeepSWE 編程評分躍升至 65.3%,每百萬 Token 僅需 0.75 美元

Google Gemini 3.7 Flash 正式發佈:DeepSWE 編程評分躍升至 65.3%,每百萬 Token 僅需 0.75 美元

Google 於 2026年8月13日發佈 Gemini 3.7 Flash,在 DeepSWE v1.1 編程基準測試中得分從 49.0% 大幅提升至 65.3%,支援百萬 Token 上下文,定價每百萬輸入 Token 僅 0.75 美元,專為代理工作流程優化設計。

2026年8月28日4
OpenAI Astra 數學推理突破:對 AI 研究與商業應用的深層意義

OpenAI Astra 數學推理突破:對 AI 研究與商業應用的深層意義

Astra 的重點不在更會算,而在讓 AI 從會說,走向可被企業信任地做對事。

2026年8月22日13
阿里巴巴 Qwen3.8-Max:2.4 萬億參數的技術突破、定價與企業應用前景

阿里巴巴 Qwen3.8-Max:2.4 萬億參數的技術突破、定價與企業應用前景

Qwen3.8-Max 真正改變的不是參數排行榜,而是亞洲企業買大模型的成本與部署邏輯。

2026年8月19日9
2026 開源 AI 模型全景:Llama、Qwen、DeepSeek 與企業自建方案

2026 開源 AI 模型全景:Llama、Qwen、DeepSeek 與企業自建方案

2026 年開源 AI 的關鍵,不是哪個模型最強,而是哪家公司先把成本、合規與主權邊界算清楚。

2026年7月26日12
GPT-5 你需要知道的一切:能力、價格與對企業的影響

GPT-5 你需要知道的一切:能力、價格與對企業的影響

GPT-5 的關鍵不在更聰明,而在能否把企業流程真正做完、做穩、做出 ROI。

2026年7月1日12