微軟將首個專用網路安全模型MAI-Cyber-1-Flash接取漏洞挖掘系統 MDASH,並表示這套組合在 CyberGym 基準測試中取得 95.95% 的成績,高於 Anthropic、OpenAI 和Google的同類方案。該公司同時表示,新配置的成本較其現有最佳 MDASH 方案低約 50%。
文章所述數據來自微軟揭露。 CyberGym 是一項公開基準,要求 AI 代理在受控環境中復現 188 個開源專案中的 1507 個已知漏洞,再按成功復現比例評分。微軟這次公佈的結果在發稿時尚未出現在 CyberGym 公開排行榜上。
測驗成績高於多家模型
以微軟揭露,MDASH 這次的成績為 95.95%,高於 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。
微軟強調,這項成績並非單一模式獨立完成,而是整套系統協同運作的結果。 MAI-Cyber-1-Flash 負責最多 90% 的任務,剩餘最複雜的約 10% 個案會被轉交給 GPT-5.4 處理。
MDASH負責驗證與復現
公司揭露稱,MAI-Cyber-1-Flash 是負責理解程式碼與推理的模型層,MDASH 則是外圍執行系統,負責調度代理、呼叫工具、交叉檢查結果、移除重複項,並驗證漏洞是否真的可以被觸發。
微軟稱,MDASH 內部使用了 100 多個專用代理,分別承擔程式碼審計、結果辯論和概念驗證建置等任務。所謂概念驗證,即產生一個可運行的漏洞觸發範例,用來證明缺陷確實存在。
已接入Defender私有預覽
微軟已透過 Defender 入口網站中的 Microsoft Security Exposure Management 啟動 MDASH 私有預覽。企業用戶可以掃描 Git 程式碼倉庫,查看按可信度排序的發現結果,並透過 Defender CLI 產生建議修復程式碼,供開發團隊審核。
目前預覽版對使用範圍仍有限制,包括單一倉庫規模約 256MB,以及每個租戶在同一時間僅允許一次並發掃描。微軟也提到,Project Perception 未來將類似的多代理方法擴展到更廣泛的威脅監控和處置流程。
補充資料:文中提到,研究人員先前已用公開模型複現類似 Claude Mythos 的漏洞挖掘流程,單次掃描成本可低至 30 美元以內,行業競爭焦點正從模型獲取轉向結果驗證能力。











