谷歌安全团队开发的大语言模型漏洞研究工具“Big Sleep”在FFmpeg和ImageMagick等多个开源软件中发现了20个漏洞。尽管漏洞的具体细节尚未公开,但这一成果标志着基于大语言模型(LLM)的自动化漏洞发现技术已开始取得显著成效。谷歌指出,所有漏洞均由人工智能代理独立发现并重现,仅在提交漏洞报告前由人类专家进行验证。此外,RunSybil和XBOW等类似工具也在推动这一领域的发展。然而,这些AI工具在实际应用中仍存在误报等问题,因此受到部分开发者的质疑。