不要担心——这次AI操控并未被用来黑客攻击或制造核武器。我只是亲眼见识到一些前沿AI模型在安全防护方面的脆弱性。

总部位于加州的非营利AI安全组织FAR.AI开发了一款工具,能够针对一系列问题提示自动生成超过一千种不同版本,试图识别有效的“越狱”方法。我看到一些模型生成了详细的网络攻击计划,目标是一个虚构的水电站,此外还有其他内容。通常,这需要尝试数十个提示,模型会直接拒绝许多不当请求。

在FAR.AI发布新报告前,我与他们进行了交流。报告测试了四家美国知名公司的模型安全防护:Anthropic的Claude Opus 4.8和Fable 5;OpenAI的GPT 5.5和5.6;谷歌的Gemini 3.1 Pro;以及埃隆·马斯克旗下SpaceXAI的Grok 4.3和4.5。该工具自动生成旨在诱导模型执行潜在有害行为的提示,比如生成软件漏洞利用代码,或提供化学和生物武器开发细节。

报告显示,Grok模型最容易被破解,共发现448个越狱案例;其次是Gemini,发现249个;而Claude、Fable和GPT则未被攻破。然而,FAR.AI和其他专家指出,这并不意味着这些模型对更复杂的越狱手段免疫,这些手段可能涉及更复杂的交互方式。

报告还计算了利用另一AI模型自动生成越狱提示的成本,结果非常低廉——破解Grok仅需58美元,破解Gemini则需278美元。

FAR.AI首席执行官、AI安全与对齐专家亚当·格里夫表示:“目前AI模型的监管甚至不如餐馆。”他强调,这些发现凸显了外部强制标准和法规的必要性。“依赖AI公司自我监管的说法毫无意义。”

不过,格里夫也认为这些结果表明模型可以被系统性地安全测试。“这里有积极的一面,防御和安全确实是可行的。”

谷歌DeepMind的AGI安全与对齐主管罗欣·沙阿表示,报告结果“不应被视为对Gemini安全性的全面评估”,因为并非所有越狱都同等严重。“我们持续改进安全措施,进行广泛的红队测试和风险评估,并在开发和部署过程中应用多层保护。”

Anthropic发言人迈克尔·阿西曼告诉WIRED:“这些发现反映了我们在安全防护上的持续投入。随着攻击手段日益复杂,我们不断完善安全系统。”

OpenAI发言人加比·赖拉在给WIRED的声明中表示:“越狱是整个行业持续面临的挑战,我们随着攻击技术的发展不断加强防护。我们严格测试模型应对新威胁,并利用测试结果提升保护措施。”

SpaceXAI未回应WIRED的置评请求。

加州和纽约近期通过的州法律要求前沿AI开发者发布安全报告,不久后伊利诺伊州法律也将要求这些公司接受第三方安全审计。但联邦政府尚未出台具体安全要求,行业和监管机构仍在摸索中。

今年6月,特朗普政府以国家安全为由对Anthropic的Fable 5和Mythos 5模型实施出口管制,导致公司暂停服务数周。白宫也曾要求Anthropic和OpenAI推迟新模型发布,担心可能带来新的网络安全风险。

形势或许正在改变——近期一项行政命令呼吁政府与私营部门合作推进相关网络安全项目,总统也暗示将出台轻度监管措施。但目前,防止重大灾难仍主要依赖模型开发者自身。

AI潜在的失控风险已显而易见,OpenAI模型曾自行攻击流行代码库和其他服务。剑桥大学研究人员的报告显示,尼日利亚东北部博科圣地成员曾利用ChatGPT、Claude、Gemini、Grok、Meta AI和DeepSeek策划暴力袭击。

部分外部专家认为,更严重的事件可能迫在眉睫。哈佛大学计算机科学家斯蒂芬·卡斯珀表示:“AI研究界普遍且严肃地预期,未来几个月而非几年内,可能发生涉及生物、网络或化学滥用的严重事件。如果近期发生重大滥用,几乎肯定是因为该系统未配备最先进的安全防护。”

斯坦福大学专注AI政策的计算机科学家安卡·鲁尔指出,FAR.AI报告的关键启示是Anthropic和OpenAI采用的安全措施应成为所有模型的标准。“显然有些公司知道如何防御至少本报告测试的攻击,问题是为什么有些公司采用而有些不采用。”

更新于2026年7月29日18:55:本文新增了OpenAI的评论。