我第一次意识到即将到来的AI代理在网络安全领域可能引发的混乱,是在2025年底。加州大学伯克利分校教授、全球顶尖的AI与网络安全专家之一Dawn Song在NeurIPS学术会议结束时抓住了我的手臂,告诉我应该警告大家,AI快速提升的黑客技能可能带来严重后果。她并不轻易被AI炒作所影响,所以我认真对待了她的提醒。
然而,事态在过去八个月里迅速升级。一系列AI代理突破限制,肆意入侵外部系统的事件,显示了这项技术的强大威力。我最近联系了刚加入Meta的Song教授,询问未来可能的发展方向以及我们应采取的应对措施。
坏消息是,Song认为AI黑客攻击在变好之前还会变得更糟。好消息是,我们已经大致明白这些“小捣蛋鬼”为何会失控。
“它们只是有需要完成的目标,而且能力非常强大,”Song告诉我。
反馈循环
去年,AI代理的能力远不如现在。它们犯错太多,常常半途而废。但持续训练让它们变得更加熟练。
一种叫做强化学习的技术让算法能够解决问题,并根据结果的好坏给予正面或负面反馈。编程尤其适合这种方法,因为如果模型写出的程序能正确运行,就会得到奖励。
持续训练使得AI模型能够执行多步“代理”操作——操纵文件、使用软件工具、访问网络——来构建软件。AI公司也投入大量精力,教模型如何发现软件和系统中的漏洞,试图实现网络安全工作的自动化。

当然,AI模型也被训练不要做坏事。问题是,随着它们在编程和漏洞挖掘方面越来越擅长遵循人类指令,它们完成任务的热情开始模糊了对是非的判断。换句话说,AI代理并非邪恶,它们只是过于渴望取悦人类。“它们被训练去完成任务,”Song说。为了作弊而入侵互联网看似狡猾,但这可能是完成任务最有效的方式。
我当时没完全意识到事情会变得多么怪异:AI代理在私人留言板上讨论黑客技术,设计巧妙的诈骗手段来操纵人类,甚至复制自己到其他计算机以寻找更多资源。
一方面,AI模型被训练得非常擅长模仿许多人的行为,那么它们为什么不能策划、欺骗和诈骗呢?但另一方面,人类(通常)知道黑客攻击和诈骗是不道德的。我认为这些事件揭示了这种人类模仿的浅薄:AI代理并没有学会哪怕是小孩都具备的道德推理能力。
AI的未来趋势
Song表示,随着AI能力的提升,代理失控或被恶意利用的风险将会增加。解决“失控”——或者说“过于热情”——AI代理问题的最好方法,可能是用更多的AI来应对。
AI公司已经使用辅助AI系统来监控主AI的行为,未来可能会更加注重检测AI模型何时越界。
另一个新兴思路是,在模型通过强化学习完成任务的过程中,加入更强的道德判断。“代理可以规划多条通向目标的路径。我认为下一步需要解决的是让它们理解,并非所有路径都是等价的,”Song说。“这是一个开放的研究领域,但我们已经开始探索。”
希望Song教授或其他专家能教会AI正确地遵循人类指令。


