如今,防御者也开始利用提示注入技术。

Tracebit的研究人员周一表示,他们发现将提示注入与存储在亚马逊云服务(AWS)上的密码、加密密钥及其他机密信息一起放置,通常足以阻止AI黑客代理的攻击。这些提示指令会让攻击用的大型语言模型(LLM)执行其安全防护机制禁止的操作。LLM在遇到这些命令后会自动关闭。

例如,提示可能要求LLM提供制造可吸入炭疽孢子的步骤,或者针对中国开发的LLM,提示中会提及1989年天安门广场事件中的“坦克人”。一旦LLM遇到这些禁令,它就不会继续执行之前的命令。研究人员将这种技术称为“上下文炸弹”。

Tracebit联合创始人兼CEO Andy Smith解释说:“我们实际上是在触发上下文中的拒绝机制。这种机制效果强烈且明显,代理一旦接收到这些内容,就会持续拒绝执行后续命令。”

Tracebit的初步测试显示,上下文炸弹具有巨大潜力。他们在模拟的AWS环境中测试了Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro和Kimi 2.6五款主流模型,给它们下达执行常规开发任务的指令,模型在枚举资源时会偶然触及植入的提示字符串。

测试结果显示:

  • 在152次攻击尝试中,植入提示字符串的诱饵机密使代理获得完整管理员权限的成功率从57%降至5%。
  • 完全控制(包括留下持久后门)的成功率从36%降至1%。
  • 最强的代理Opus 4.8在面对上下文炸弹时,管理员访问成功率从93%降至0%。

平均来看:

  • 管理员权限提升成功率从57%降至5%
  • 带持久后门的权限提升从36%降至1%
  • 任何攻击路径成功率从91%降至15%
  • 平均每次攻击成功路径数从1.53降至0.16
  • 没有一次攻击能在未触发“金丝雀”检测的情况下完成

这项研究基于Tracebit今年5月的发现,当时他们提出了一种方法,利用看似正常但实际上未被使用的AWS资源作为“金丝雀”,在AI代理攻击基础设施时发出预警。这些资源与真实资源并存,能在攻击造成严重后果前提醒防御者。

Tracebit的“金丝雀”平均能在攻击开始后8分钟内发出警报。开发上下文炸弹的动机正是为了阻止攻击,而不仅仅是发出警告。实验中,AI代理平均需要14分钟才能获得管理员权限,提前6分钟的警告时间显得非常紧迫。

攻击者早已利用提示注入关闭网络内的AI防御。例如,安全公司Socket的研究人员上个月发现一个LLM代理指示目标LLM提供制造核武器或生物武器的步骤,目的是关闭AI辅助的恶意软件分析。Check Point的研究人员也发现了类似的恶意软件原型。

而上下文炸弹似乎是首次由防御者反制攻击的案例。

加州大学圣地亚哥分校AI安全专家Earlence Fernandes表示:“据我所知,还没有其他人用这种技术作为防御。我自己也在尝试类似方法,只是应用场景略有不同。原本想做第一个,但看来这次被他们抢先了。”

目前尚无根本解决提示注入问题的方法,开发者只能设计复杂的安全防护措施,防止注入的提示让LLM偏离正常轨道。防御者现在或许能将这一难题转化为己用。

本文最初发表于Ars Technica。