在人工智能安全领域出现了一个令人震惊的案例:独立安全研究人员利用Anthropic的Claude模型成功入侵了OpenAI,揭示了这家ChatGPT开发商防御体系中的漏洞。《华尔街日报》周四晚间报道了这一事件。
这次攻击由初创公司Hacktron AI的三人安全团队执行,作为OpenAI漏洞赏金计划的一部分。Hacktron向OpenAI报告了他们的发现,随后获得了6500美元的奖励。该团队通过串联利用两个关键漏洞,成功访问了多名OpenAI员工的ChatGPT账户,从而进入了公司的软件系统。
OpenAI表示,已修复Hacktron发现的问题。此事发生之际,顶尖AI公司正面临日益增长的安全压力。
几周前,OpenAI的AI代理在一次网络安全评估中突破限制,入侵了Hugging Face,展示了AI模型在自主决策方面的强大能力。这也凸显了现成技术能够被用来发现即使是最先进企业基础设施中的安全漏洞。
AI安全公司Gray Swan的CEO Matt Fredrikson向TechCrunch表示:“只需每月200美元,任何人都能利用这些工具攻击像OpenAI这样的公司。如果他们都可能被攻破——而且我认为他们最近在网络安全方面并没有松懈——那么任何人都有可能成为目标。”
一位AI专家在社交媒体上指出:“[Hacktron]使用Opus 5完成了这次攻击……问题是,如果这三个人能做到,国家级黑客又能做什么?”
研究人员于7月25日通过OpenAI社区论坛所使用的第三方软件Discourse中的一个漏洞进入系统。
根据Hacktron发布的博客,攻击入口是一个普通的图片上传功能。当用户上传HEIF或HEIC格式(iPhone默认格式)的图片时,Discourse会通过一系列后台工具将其转换为标准JPEG格式。转换的第一步是使用ImageMagick,这是一个已有数十年历史的开源图像处理工具。由于ImageMagick无法直接处理苹果格式,它会将文件交给另一个名为libheif的库进行解码。
libheif中存在一个内存漏洞,攻击者可以利用该漏洞注入恶意指令。具体来说,向该库提供特制图片会导致其错误计算图像叠加位置,从而实现服务器劫持。

令人不安的是,这个漏洞几个月前已被libheif开发者修复,但未被正式认定为安全漏洞,因此没有获得CVE编号,这可能导致Discourse仍在使用易受攻击的旧版本。
值得注意的是,研究人员最初使用的Claude模型版本Opus 4.8未能成功构建有效的攻击代码,但在Anthropic发布Opus 5后,情况发生了变化。
Hacktron在博客中写道:“Opus 4.8在多次尝试中都未能成功生成有效攻击代码。Opus 5发布数小时后,我们用同样的问题测试它,结果成功了。”
进入Discourse服务器后,研究人员又发现了另一个漏洞,使他们能够控制包括OpenAI员工在内的ChatGPT和Codex账户。
“随后我们控制了一个OpenAI员工的账户,该账户的Codex连接到了OpenAI的GitHub组织,”Hacktron总结道。
事件发生后,研究人员及时通知了OpenAI和Discourse,后者于7月27日发布了修复补丁。
此次事件凸显了AI模型能力的边界。最终破解漏洞的Claude Opus 5版本没有受到安全出口限制,而更新的Mythos 5版本因其强大的黑客能力曾被暂时限制使用。
不仅是封闭模型,开源模型在网络安全能力方面也在迅速追赶。例如,AI安全非营利组织SaferAI发现中国公司Z.ai的GLM-5.2模型仅比OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7落后几个月。
正如Hacktron创始人Mohan Pedhapati在社交平台上所言:“AI正在减少开发漏洞利用所需的稀缺专业知识。过去需要数月的工作,现在可能只需几天。”


