
“AI能够自主思考、编写代码并完成工作任务”——AI代理正在迅速进化。然而,人们也开始担忧:“如果AI失控,导致无法挽回的事故怎么办?”
因此,AI的“护栏”变得尤为重要。
在本系列第9期《什么是“提示注入”》中,曾介绍过通过欺骗AI使其执行非法操作的攻击手法。防止这类攻击以及AI产生意外行为的安全装置,就是护栏的作用之一。
AI不掉入“危险悬崖”的保护栏
提到护栏,大家可能会想到道路旁的金属防护栏,它能防止车辆因操作失误而冲出道路。
AI的护栏也是类似的概念。
无论大型语言模型(LLM)多么强大,都可能给出错误信息、发表不当言论,甚至被恶意指令误导。因此,需要对输入信息、AI生成的回答以及AI实际执行的操作进行检查,设立机制阻止危险行为。
关键在于,不仅要对AI说“请不要做危险的事情”,还要在系统端设置“不可逾越的壁垒”。
仅靠“请求”无法避免的9秒数据库删除事故
为什么仅靠“请求”是不够的?2026年4月的一起事故说明了这一点。
在美国PocketOS中,编码AI代理“Cursor”在工作时遇到认证信息不匹配。它试图自行解决问题,意外发现了拥有强大权限的API令牌,未经过确认便删除了生产数据库及其备份,整个过程仅耗时9秒。
PC Watch报道了这起“AI无视护栏,9秒内删除企业数据库”的事故。
【PC Watch报道】 AI无视护栏,9秒内删除企业数据库事故 https://pc.watch.impress.co.jp/docs/news/yajiuma/2105658.html
更令人担忧的是,AI本已被指示避免破坏性操作,但仍执行了违反规则的行为。
这表明,仅依赖AI自身的“自制力”来保障安全是不够的。
护栏作用于哪里?
护栏机制多种多样,但大致可以分为“输入”、“输出”和“执行”三个环节。

“输入护栏”在将用户指令、网页内容、邮件等传递给AI之前进行检查,检测提示注入攻击和敏感信息,并在必要时阻断。
“输出护栏”则在AI生成回答展示给用户前进行审查,过滤不当表达和防止机密信息泄露,发现问题时会阻止或替换回答。
随着AI代理时代的到来,“执行护栏”尤为关键。正如第18期介绍的多合一控制平台(MCP)等,通过它们AI在发送邮件、操作文件、管理数据库时,能禁止危险操作,或要求人工确认“是否真的执行?”

强劲的油门需要坚固的护栏
目前,NVIDIA的“NeMo Guardrails”和Meta的“Llama Guard”等,为AI添加安全功能的框架已被公开。
高性能跑车之所以能安心高速行驶,不仅因为强劲的引擎和灵敏的刹车,更因为有防止出轨的护栏。
AI亦是如此。
随着AI从“聊天助手”进化为实际执行任务的“AI代理”,除了提升智能水平,设计“禁止执行的内容”和“危险时刻的拦截点”同样重要。
为了让AI更自由地工作,坚固的护栏必不可少。


