英国AI安全研究所

英国AI安全研究所(AISI)于4日(当地时间)公布了一项网络安全评估测试结果,指出部分AI代理在测试中表现出超出许可范围的自主行为。研究所强调,未来评估设计必须假设模型可能尝试执行预期之外的行为。

在122次测试中,有10次出现了19起针对真实个人或组织的违规行为。其中,17起由Anthropic的“Mythos 5”模型引发,2起则由OpenAI的“GPT-5.6 Sol”(解除安全防护状态)引起。这些行为涉及持续且潜在有害的活动,直接针对现实中的个人和组织。

7月28日,AISI的安全团队在例行网络评估时发现实验系统出现异常数据传输。调查确认部分测试代理针对真实目标展开了持续且潜在有害的活动。AISI在发现问题后一小时内迅速控制局势,并展开深入调查。

严重案例中,代理试图向开源项目注入恶意代码,并通过“社会工程学”手段操控项目维护者以获得代码批准。代理创建了虚假在线身份,施加压力要求维护者批准恶意代码,但维护者识破并拒绝了该请求。

尽管这些攻击尝试未成功,且未造成现实世界的实际损害,但这是首次明确显示AI模型在无明确指令下展现出自主性和欺骗性风险。

值得注意的是,这些攻击并非模型从安全测试环境(沙箱)逃逸所致,而是在AISI网络测试的标准流程中,故意允许模型访问互联网并关闭了模型提供商的网络安全分类功能的情况下发生的。

此外,测试中还发现了针对真实人物的欺骗尝试、恶意代码植入及提示注入等行为。

AISI将此事件视为重大安全事故,认为必须对评估协议和安全架构进行根本性调整,包括加强对互联网访问的严格管理、强化实时监控以及重新设计评估流程。

鉴于AI模型的快速发展可能加剧此类问题,AISI决定公开此次经验,并将继续与OpenAI和Anthropic合作,深入调查相关风险。