返回 AI 情报
模型精选 712026-07-28 16:33Asif RazzaqMarkTechPost(RSS)

Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

Microsoft AI Releases MAI-Cyber-1-Flash: A 5B-Active-Parameter Cyber Model That Pushes MDASH to 95.95% on CyberGym

精选理由

微软这个安全模型把漏洞挖掘系统推到95.95%,关键是90%任务由5B模型完成成本砍半,路由设计比模型本身更值得关注,做漏洞挖掘的可以马上跑起来试试。

AI 摘要

Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。

正文 · AI 翻译

MAI-Cyber-1-Flash 是一款采用自注意力机制和稀疏混合专家层的 Transformer 架构模型。它拥有 1370 亿总参数量,其中 50 亿参数处于激活状态,上下文窗口长度为 256k。输入和输出仅支持文本。

该模型是对 MAI-Code-1-Flash 进行网络安全领域微调后的版本,后者是已集成到 GitHub Copilot 和 VS Code 中的轻量级智能体编程模型。发布信息称其源自 MAI-Thinking-1 系列。

评测基准

CyberGym 是一个公开的评测套件,包含来自 188 个 OSS-Fuzz 项目的 1507 个真实漏洞复现任务。微软在 CyberGym 的默认一级配置下进行评估,该配置提供存在漏洞的源代码和高级描述。

在 MDASH 系统中运行 MAI-Cyber-1-Flash 配合 GPT-5.4 时,得分达到 95.95%。微软表示这比 Anthropic 的 Mythos 高出约 12 个百分点,发布图表显示四个对比系统的得分区间为 83.2% 至 85.6%。

微软在 2026 年 5 月首次详细介绍 MDASH 时,该框架仅使用通用模型在 CyberGym 上取得了 88.45% 的分数。这已是公开排行榜上的最高分,比第二名(83.1%)高出约 5 个百分点。研究团队明确说明了改进情况:将 MDASH 中 80% 的现有模型替换后,框架得分从 88.4% 提升至 95.95%。

为何路由机制才是真正的核心产品

MDASH 通过五个阶段管理超过 100 个专业智能体:准备(Prepare)、扫描(Scan)、验证(Validate)、去重(Dedupe)和证明(Prove)。审计智能体标记发现的问题,辩论智能体就漏洞可利用性展开辩论(以分歧作为信号),证明阶段则针对 C/C++ 目标使用 ASan 执行触发输入。

为了在大规模应用中控制前沿模型成本,MAI-Cyber-1-Flash 处理 MDASH 中高达 90% 的任务,将最难的 10% 升级至 GPT-5.4。这种路由机制相比此前使用 GPT-5.4、5.4 mini 和 5.3 codex 的配置,节省了 50% 的成本。

MDASH 由微软自主代码安全(ACS)团队开发,团队成员包括曾赢得 DARPA AI 网络挑战赛的亚特兰大队成员。今年 5 月,MDASH 辅助工作生成了 16 个 CVE(包括四个严重级别的远程代码执行漏洞),涉及 Windows 网络和身份验证堆栈。回顾来看,它在五年时间窗口内恢复了 clfs.sys 中 28 个 MSRC 案例的 96%,以及 tcpip.sys 中 7 个案例的 100%。

性能

研究团队展示了来自轻量级终端测试工具的独立结果:

基准测试MAI-Cyber-1-Flash

CVEBench0.314

CyberSecEval4 — 威胁情报0.553

CyberSecEval4 — 恶意软件分析0.33

CRSBench0.651(POV=1200)

ExploitGym — 内核 / 用户空间 / 浏览器0 / 0 / 0

ExploitGym 上的零分是刻意为之,并非缺陷。微软团队表示,该模型经过训练用于执行防御性任务(如修补漏洞),而非攻击性任务(如部署恶意软件)。一个 5B 活跃参数的模型无法生成漏洞利用代码,却能驱动 95.95% 的发现流程——这正是纯防御型产品所需的特性。

如何使用

核心要点

MAI-Cyber-1-Flash 总参数量 137B / 活跃参数 5B,是基于 MAI-Code-1-Flash 的稀疏 MoE 微调版本,支持 256k 上下文窗口。

CyberGym 上的 95.95% 是系统级得分——由 MDASH 加上新模型以及 GPT-5.4 共同实现,较 2026 年 5 月的 88.45% 有所提升。

它可处理高达 90% 的 MDASH 任务,将困难的 10% 升级给 GPT-5.4,据称可削减 50% 成本。

ExploitGym 得分按设计为 0/0/0——该模型用于修补漏洞,不编写漏洞利用代码。

访问权限受控。

原文

Original Title

Microsoft AI Releases MAI-Cyber-1-Flash: A 5B-Active-Parameter Cyber Model That Pushes MDASH to 95.95% on CyberGym

Source

MarkTechPost(RSS)

Site

marktechpost.com

Author

Asif Razzaq

Published

2026-07-28 16:33

阅读原文· marktechpost.com

继续阅读

Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95% - AI 情报频道 - 小黑丸