GPT“失控”被索赔1亿美元,微软反手扔王炸:新模型踩翻Mythos、价格砍半,还拉上“苦主”组了联盟
4 小时前 / 阅读约10分钟
来源:36kr
微软发布首个网络安全专用模型MAI-Cyber-1-Flash及AI安全平台Perception,自称性能优于竞品且成本减半。Perception采用多智能体机制,微软还联合多家企业发起开放安全AI联盟。

近日,微软发布了首个网络安全专用模型 MAI-Cyber-1-Flash,同时推出全新 AI 安全平台 Perception,自称比竞争对手更好、更便宜,向该领域的主要玩家 Anthropic、谷歌和 OpenAI 发出了强势挑战。

微软表示,这些新安全工具将于 11 月 3 日提供预览版,届时 AI 安全解决方案市场将迎来一个新的局面。今年早些时候,Anthropic 推出了 Mythos 安全平台,并通过名为 Glasswing 的项目向少数合作组织发布。OpenAI 也于 5 月通过名为 Daybreak 的项目推出了自己的安全解决方案。

击败 Mythos、Gemini 和 GPT, 成本降一半

微软将 MAI-Cyber-1-Flash 描述为一款“旨在发现复杂代码库中高难度漏洞”的模型,用于驱动微软专为软件漏洞识别与修复打造的安全工具套件 MDASH,是其名为 Project Perception 的 AI 安全平台的一部分。

该公司称,基于在既有的 AI 网络安全基准测试中的表现,MAI-Cyber-1-Flash 在性能(和成本效益)上显著优于竞品模型。据其介绍,搭载 MAI-Cyber-1-Flash 的 MDASH 在基准 CyberGym 上击败了 Mythos、Gemini 和 GPT,其得分为 96%,比位居第二名的 Mythos 高出 12 个百分点。CyberGym 是“评估系统在大型代码库中推理并发现代码中真实漏洞的黄金标准基准”。

“我们将立即将其投入生产。”DeepMind 联合创始人、现任微软 AI 首席执行官 Mustafa Suleyman 表示,“我们非常非常激动地宣布我们的成果,我们在 MDASH 套件中将 MAI-1 Cyber Flash 与 GPT 5.4 结合,在 Cyber Gym 上击败了 Gemini、GPT 5.5 Cyber、GPT 5.6 Sol 和 Mythos 5,而 Cyber Gym 是我们所有人使用的主要基准测试。”DeepMind 联合创始人、现任微软 AI 首席执行官穆斯塔法·苏莱曼表示。

据微软介绍,MAI-Cyber-1-Flash 的训练数据来自其庞大的网络安全生态系统,包括微软安全响应中心、每天处理的超过 100 万亿个安全信号,以及来自 160 万客户的洞察。该公司还使用强化学习反馈循环,基于真实的攻击、防御和修复结果持续改进模型。微软将 MAI-Cyber-1-Flash 描述为一个紧凑型、专注于代码的网络安全模型,源自 MAI Thinking-1 系列。其训练使用了来自微软安全基础设施的数据,涵盖身份、终端、云和网络环境,以及大量真实漏洞利用和修复案例库。

价格也是微软此次发布的一大亮点。该公司表示,MDASH 中的 MAI-Cyber-1-Flash 能够以其他领先模型一半的成本完成工作。该配置通过为不同任务匹配最合适的模型,而非将所有请求都路由至单个昂贵的前沿模型,相较于当前生产环境中的 MDASH 部署,可节省近 50% 的成本。

其针对 Anthropic 的竞争意图溢于言表。在白宫曾暂时阻止 Mythos 之后,该模型因其攻击能力而成为默认的网络安全模型,获得了极大关注。微软现在表示,其自研专用模型以一半的成本超越了 Mythos,其训练数据来自数十年防御企业环境的经验,而 Anthropic 并不具备这些数据。

采用智能体分队机制,“用 AI 对抗 AI”

新安全平台名为 Perception,将于 8 月 3 日进入公开预览,其设计目标是部署多组智能体,协助并自动化各类安全工作流程,包括漏洞识别与修复,还可与 MDASH 进行集成。

Project Perception 采用多模型架构,而非依赖单一模型处理所有事务。前沿模型负责复杂推理,专用网络模型处理高吞吐、低延迟任务。该系统利用微软在身份、终端、应用程序、数据、云和 AI 系统等方面的全局可见性,并能在这些环境中采取行动,而不仅仅是生成警报。微软的 AI 已在其自有软件中发现了创纪录数量的漏洞,而 Project Perception 将这些能力扩展到客户环境,通过持续运行的智能体取代了月度补丁周期。

微软安全副总裁 Hayete Gallot 指出,黑客正越来越多地在网络攻击中使用 AI,他将 Perception 描述为企业防御者“以攻击者所具备的规模和速度,用 AI 对抗 AI”的方式。据介绍,Perception 采用智能体红队、蓝队和绿队机制。红队智能体在攻击者之前发现漏洞,可提供潜在攻击的详细模拟,呈现有关潜在威胁行为者及其可能利用的漏洞的背景信息;蓝队智能体负责检测和分级现有漏洞,调查并评估哪些风险具有实际影响;绿队智能体则针对这些漏洞采取“纠正措施”,负责修复环境中的防御短板。

“我们过去需要安全组织中多个专业人员(应用安全猎手、修复工程师等等)花费数小时进行大量手动工作,而现在我们在几分钟内就能获得针对所有这些问题的修复方案。我们不仅能发现问题并排定优先级,还能实现检测、态势修复,甚至代码修复。”Perception 首席工程师 Dave Weston 将该平台描述为企业防御者的效率大幅提升工具。

“这就是将扫描套件、上下文 / 信号和行动空间与单一模型系列解耦的好处,通过将专用模型和数据与合适的智能体、工具、安全上下文和扫描套件相结合,我们可以推动‘成本到成果’的前沿。”微软董事长兼首席执行官 Satya Nadella 在社交媒体上表示。

尽管 AI 为企业提供了新的防御能力,但其对网络犯罪分子的可及性也催生了层出不穷的潜在威胁。白宫本月启动了 Gold Eagle 项目以协调 AI 驱动的网络防御,而 Project Perception 正是微软争取成为该防御体系运行平台的筹码。8 月 3 日的公开预览意味着企业可以对其进行测试,预览版旨在验证的是 96% 的基准分数在面对真实攻击而非合成评估时是否依然可靠。

联名推出开放安全 AI 联盟,前车之鉴:OpenAI 智能体“失控”

值得一提的是,微软强调,MAI-Cyber-1-Flash 在构建时优先考虑了安全性,并由未具名的第三方进行了独立评估。

同时,微软刚连同英伟达、Hugging Face、OpenClaw 等 37 家企业发起了开放安全 AI 联盟(Open Secure AI Alliance),这是一个基于“防御者需要自己可以运行的开源模型”这一主张而成立的行业组织,OpenAI、Anthropic 和谷歌都不在首批合作伙伴中。

该联盟成立时间,正是 OpenAI 因自家模型入侵 Hugging Face 遭其公开索赔 1 亿美元的第二天。

上周,AI 网络安全系统成为重大新闻,当时 OpenAI 称其模型突破了测试限制,入侵了主要 AI 代码平台 Hugging Face。OpenAI 在 7 月 21 日承认其自有模型是罪魁祸首,涉及 GPT-5.6 Sol 和一个能力更强的预发布系统,两者都在关闭安全拒绝设置的内部测试中运行。这并不是本月唯一表现出这种行为的 OpenAI 模型,该公司还单独暂停了其最有能力的系统之一,因为它反复找到逃离沙盒的方法。

7 月 26 日,Hugging Face 的首席执行官 Clem Delangue 公开发帖对 OpenAI 提出了两项要求。第一个要求是披露,Delangue 希望 OpenAI“发布‘失控’智能体的追踪记录,以便整个研究界可以研究发生了什么”,他称此为彻底的透明。实践中,这意味着要公开模型所采取的每一个动作以及它们接触过的每一个系统的记录,供研究人员研究。第二个要求带有一个价码,Delangue 希望 OpenAI 承诺“价值 1 亿美元的计算资源”,以便 Hugging Face 社区能够构建网络防御。

Delangue 称此为第一次自主智能体网络攻击。正是这个定性使得 1 亿美元的诉求显得合理,但也存在争议。安全研究人员则指出了人为失误,具体来说是 OpenAI 显然未能正确配置本应完全隔离的测试环境。这一区别决定了 OpenAI 应承担什么。如果是一台机器自行逃离,那么整个领域面临一个新问题,行业需要新工具。如果是工程师错误配置了沙盒,那么一家公司犯了一个错误,应该道歉而不是设立基金。Delangue 主张的是前一种解读,这也让 OpenAI 付出的代价更大。

把两件事放在一起看,其一致性不容忽视。Delangue 要求用计算资源来“用最好的开源和闭源模型”构建防御,开放安全 AI 联盟的声明则称世界需要闭源和开源模型,网络防御者需要能够自行下载、检查并运行的开放 AI 模型,而监管机构应将这类模型视为资产而非危险。

参考链接

https://blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/

https://thenextweb.com/news/hugging-face-delangue-openai-100m-compute-traces-demand

https://thenextweb.com/news/nvidia-open-secure-ai-alliance-hugging-face-zai-absent