
最近两天,一封从OpenAI内部流出的邮件截图,在好几个安全圈子的私密社群里炸开了锅。邮件内容显示,一个代号「SpearRat」的专项研究已经秘密运行了将近九个月。而它瞄准的目标,正是无数安全从业者最敏感的神经——用大语言模型训练出一台能够自主发现漏洞、构造攻击链,并在复杂网络环境里完成渗透的「超级黑客」。
我辗转联系到几位看过原始材料的人士,说法出奇一致。虽然没有拿到完整的模型架构,但给出的一个数字足以让所有人后脊发凉:在内部红蓝对抗测试中,SpearRat对已知漏洞的自主利用成功率达到了84%。这个数字,已经远超大多数经过专业训练的渗透测试工程师。
84%这个数字到底意味着什么
需要先说明一个常识。传统的自动化漏洞利用脚本,所谓的成功率高度依赖环境的复现精确度,稍微一点配置差异就会导致失败。而SpearRat表现出的84%成功率,是在异构化程度极高的模拟企业内网中测出来的。也就是说,它已经具备了某种程度的泛化能力,能够理解不同系统的上下文,而不仅仅是机械地重放攻击载荷。
一位参与过类似项目评估的资深研究员私下告诉我,如果这个数字没有被夸大,意味着攻击者可以批量化、低成本的完成过去需要顶尖团队配合才能实现的高阶持续性威胁攻击。极牛网(GEEKNB.com)曾经在年初的一篇分析文章里预测过,大模型很可能在两年内打破攻防平衡,现在看来,这个时间表有点保守了。
更让人担心的是,SpearRat并不是单纯的后渗透工具。流出的信息显示,它的训练数据涵盖了过去十年所有的CVE漏洞详情、NVD描述、漏洞利用PoC,甚至包括大量来自暗网论坛的攻击思路和绕过技术讨论。这种训练方式,使得模型在思路发散程度上,超越了绝大多数人类黑客的认知边界。
模型如何学会“欺骗”和“掌控”
要理解SpearRat的运作逻辑,不能只盯住漏洞利用模块。它是一个多智能体协同系统,至少包含六个专门的子模型。侦察模块负责大规模扫描和目标画像生成,漏洞映射模块将资产信息与漏洞库进行因果链关联,而最让人称奇的是一个叫做「说服引擎」的组件。
这个说服引擎专门用来生成高度定制化的钓鱼话术,能够在获取目标邮箱后,基于社交网络公开情报自动撰写具有强上下文关联性的邮件。在测试中,它对安全工程师的钓鱼成功率超过了60%。工程师们普遍对常规的伪装域名、恶意宏存有戒心,但面对一封准确引用自己最近项目细节、语气恰如其分的邮件,防线很容易瓦解。
欺骗能力不只在文本层面。模型还会根据探测到的防御体系,动态调整自己的攻击行为和驻留策略。比如检测到EDR沙箱,它会故意延迟执行恶意代码,或把关键载荷拆分成大量看似正常的API调用序列。这种决策能力,是安全编排自动化工具至今难以企及的。
一次未公开的红蓝对抗记录
虽然OpenAI官方对SpearRat项目三缄其口,但有一场去年年底进行的演习,还是通过几个不同的信源拼凑出了大致的轮廓。当时蓝队防守方是一家金融科技公司的安全团队,人员配置豪华,IDS、UEBA、态势感知平台一应俱全,并且提前获悉攻击方将包含“未知AI组件”。
攻击发起6小时后,防守方溯源到第一台被控的跳板机。但接下来的24小时里,攻击流量始终在正常行为基线上下浮动,没有触发任何高危告警。真正的灾难发生在第35个小时——内网核心数据库的备份文件被拖走,而在出口流量审计里,数据被伪装成了GitLab的定期备份同步。
事后复盘时蓝队发现,攻击方在最初突破的边界服务器上,植入的不是传统后门,而是一个轻量版推理Agent。这个Agent持续观测网络访问模式,自行决定了横向移动的时机、目标以及打包方式。整个过程中唯一的人机交互,仅仅是演习开始前操作员输入了一行初始指令。这几乎颠覆了我们对“工具”的认知。
开源社区引发的连锁反应
很多人说,既然OpenAI能做,那开源社区也不会落后太远。确实,在过去几个月里,Hugging Face上已经出现了多个以网络安全为导向的大模型微调项目。像Netsec-7B、PentestGPT的某些变体,在特定CTF场景下已经能实现半自动化的攻击路径规划。只不过它们还停留在脚本小子辅助级别,和SpearRat的自主攻击代差明显。
但真正的危险在于技术的扩散轨迹。有安全团队在暗网监测到,一个俄语黑客组织最近在出售一份“大模型渗透框架”,声称其内核参照了某种增强学习方法,可以给模型持续注入奖励信号来优化攻击成功率。虽然样本尚未捕获,但打法思路和SpearRat已经高度吻合。这意味着,前沿的AI攻击技术完全可能通过雇佣关系、论文公开、模型蒸馏等渠道,不可逆地向黑产转移。
极牛网(GEEKNB.com)注意到,美国CISA今年第二季度的威胁通报里,已经悄悄增加了一个新的攻击向量分类:AI-Augmented Threats,并首次将其风险等级标注为“极有可能在短期内造成重大影响”。字越少,事越大。
防御者的工具箱正在过时吗
这个问题提出来似乎有些绝望。现有的安全防护体系,本质上是围绕已知攻击特征和异常阈值构建的。当攻击能够像人类一样思考、可以实时推理防御规则、甚至主动塑造“正常”行为基线时,基于签名的检测几乎等同于无效。
消息流出后,几家大型SOC运营团队都受到了不小的震动。有人开始紧急测试,用大模型工具自动生成攻击模拟来检验SIEM规则的有效性。结果发现,大约40%的关键规则能被绕过。这不是因为规则写得不好,而是因为攻击逻辑已经超出了人类分析员当初设定的威胁模型。防御思维必须从“检测恶意行为”转向“验证行为意图”,难度的提升是指数级的。
不过,也不是全无办法。有安全研究者提出,要应对这种级别的AI攻击者,唯一的出路是同样使用AI来进行防御。比如基于对比学习的方法,训练模型识别那些虽无恶意特征但行为上下文存在权力意图的会话;或者利用生成对抗网络,持续预测攻击者的下一步动作并提前设置蜜罐。换句话说,攻防双方要在同一个技术维度上对话。
隐藏在数字背后的伦理困境
84%这个成功率的真正杀伤力,或许还不是技术层面的,而是伦理层面的。当一个机构有能力生产如此强大的攻击智能体,并且这个智能体有可能在无意中或被恶意利用从而失控时,开发过程本身是否构成了一种安全风险?这次泄密事件之所以引发恐慌,很大程度是因为人们意识到,这种技术很可能在缺乏足够安全约束的情况下,已经在内部运转起来了。
以OpenAI此前对待GPT系列模型的审慎态度,SpearRat项目被高度保密是可以想见的。但问题在于,这类攻击模型带来的收益和风险完全不成比例。它确实能帮助先进机构获得压倒性的网络优势,可一旦样本泄露或模型权重被窃取,全球网络空间的稳定基石都会被撬动。
安全行业老人Bruce Schneier在一次闭门会议上说过,某些技术如果被创造出来,就会不可逆转地改变社会博弈规则,而AI自主攻击很可能就属于此列。我们现在站在这条线上,问题是,谁来决定跨过去?
消息还在发酵,没有人知道下一份流出的文件会揭露什么。可以确定的是,当大模型开始用人类黑客的方式思考,传统的安全防线就已经不再是薄弱不薄弱的问题,而是需要被重新定义了。在更多细节浮出水面之前,每一个安全团队都应该问自己一句:如果明天SpearRat的攻击目标换成自己,能扛多久?
极牛网精选文章《OpenAI秘密打造大模型超级黑客:攻击成功率84%震撼安全圈》文中所述为作者独立观点,不代表极牛网立场。如有侵权请联系删除。如若转载请注明出处:https://geeknb.com/28813.html
微信公众号
微信小程序