据加州大学伯克利分校研究人员称,截至 2026 年年中,AI Agent 在 CyberGym 基准测试中复现现实世界软件漏洞的成功率已达到 93.2%,高于该基准测试于 2025 年年中首次推出时的 10% 至 30%。基于 DeepSeek-V4-Flash 运行的 Sangfor AI Agent 位居排行榜首位,另有三个 Agent 的成功率也超过了 90% 的门槛。

CyberGym 涵盖来自 188 个开源软件项目的 1,507 个真实漏洞案例,其中大部分源自 Google 的 OSS-Fuzz 漏洞库。各 Agent 总共发现了 34 个新的零日漏洞,并在基准测试数据集中识别出 18 个不完整的补丁。