微软称新型网络安全 AI 模型助力 MDASH 以一半成本取得 95.95% 得分
导语:微软在其多模型漏洞识别与修复框架 MDASH 中推出了首款网络安全专用模型 MAI-Cyber-1-Flash,并声称在与 GPT-5.4 配合使用时,于 CyberGym 基准测试中取得 95.95% 的得分,同时成本相比既有最佳模型组合降低 50%。该模型目前仅以 Azure AI Foundry 私有预览方式向获批客户开放,且仅作为 MDASH 内部组件提供。
微软推出首款网络安全专用 AI 模型
微软在 MDASH(其多模型漏洞识别与修复框架)内部推出了首款网络安全专用模型。微软表示,MDASH 在同时使用 MAI-Cyber-1-Flash 和 GPT-5.4 的情况下,在 CyberGym 上取得了 95.95% 的得分,并宣称该配置的成本比其当前最佳的 MDASH 模型组合(GPT-5.4、GPT-5.4 mini 和 GPT-5.3 Codex)低 50%。访问权限仅通过 Azure AI Foundry 私有预览向获批的 MDASH 客户开放。
模型定位与架构
MAI-Cyber-1-Flash 旨在处理 MDASH 高达 90% 的任务,剩余最困难的 10% 由 GPT-5.4 承担。该模型仅在 MDASH 内部提供,不作为独立的公开模型或通用编程接口(API)对外发布。这一设计要点揭示了路由机制是核心技术主张:MAI-Cyber-1-Flash 负责处理大多数任务,GPT-5.4 处理最困难的剩余部分,微软以 MDASH 系统层面报告最终结果。
CyberGym 得分对比
95.95% 的头条得分属于同时运行 MAI-Cyber-1-Flash 和 GPT-5.4 的 MDASH,而非新模型本身的单独表现。CyberGym Level 1 是一项已知漏洞复现测试,它向智能体提供漏洞描述及对应的未修补源代码,然后检查其能否生成可用的概念验证(PoC)。该测试并不衡量盲目的漏洞发现能力,也不评估生成的补丁是否正确。截至 2026 年 7 月 28 日查询时,CyberGym 公开排行榜上并未列出微软的 95.95% 结果。排行榜上第一名是 Wiz 的 Atlas 智能体,在 7 月 27 日的条目中得分为 90.9%,而微软 5 月 12 日提交的 MDASH 结果仍为 88.4%。微软的公开资料并未说明该结果是否已被提交用于上榜。微软此前 96.55% 的 MDASH 结果也无法直接对比——该 6 月的数字统计了所有崩溃,包括非目标漏洞;7 月的资料未说明 95.95% 结果是否使用相同标准,因此这两个得分不能安全地视为前后性能趋势。
模型技术规格
根据微软的模型卡,MAI-Cyber-1-Flash 是一个稀疏混合专家(MoE)Transformer,总参数量为 1370 亿,活跃参数量为 50 亿,上下文窗口为 256,000 个 token。它是对 MAI-Code-1-Flash 进行网络安全微调得到的,而 MAI-Code-1-Flash 又是从 MAI-Thinking-1 中期训练检查点开发的。模型卡指出,所评估的配置替换了 MDASH 现有 80% 的模型,并将报告的 CyberGym 结果从 88.4% 提升至 95.95%。其中 80% 是被替换模型的比例,而单独的 90% 则是微软声称该较小模型能够处理任务的最大比例。

成本对比
微软的发布公告以当前最佳 MDASH 模型组合(GPT-5.4、GPT-5.4 mini 和 GPT-5.3 Codex)作为基线,定义了 50% 的节省幅度。产品页面则单独描述该系统能够"以领先模型 50% 的成本提供相当的性能"。公告与模型卡均未披露该对比背后的 token 使用量、调用次数、延迟、任务混合或算力分配,因此该数字尚无法独立复现或与其他系统进行归一化比较。
其他基准测试结果与专家观点
微软智能体安全副总裁 Taesoo Kim 在 6 月份描述 MDASH 时曾强调:"模型只是一个输入,模型周围的系统才是产品。"在轻量级终端框架下,模型卡报告的得分包括 CVEBench 0.314、CyberSecEval4 威胁情报 0.553、其恶意软件分析测试 0.33,以及 POV=1200 条件下的 CRSBench 0.651。该模型在 ExploitGym 的内核、用户态和浏览器类别中得分均为零;ExploitGym 要求智能体将提供的漏洞和崩溃输入转化为可工作的代码执行利用。这些结果来自不同的任务和评分标准,因此没有一个可单独作为 MAI-Cyber-1-Flash 的 CyberGym 得分。
测试环境与安全声明
微软表示,所有基准测试均在网络隔离环境中进行,无法访问生产系统、公共互联网或外部服务。模型卡同时警告,生成的文本和代码可能不准确或不完整,应在进行重大使用前进行人工审查。
Project Perception 与未来规划
在 MDASH 内部使用 MAI-Cyber-1-Flash 进行软件漏洞管理,是微软为其更广泛的防御性安全智能体协调系统 Project Perception 所宣布的首个应用场景。Project Perception 计划于 8 月 3 日进入公开预览,微软计划将该模型的应用范围从软件漏洞工作扩展到更多的安全工作流程。
来源信息
来源:The Hacker News
原文链接:https://thehackernews.com/2026/07/microsoft-says-new-cybersecurity-ai.html
作者:info@thehackernews.com (The Hacker News)

