“看到异常情况就要举报”这句话如今不仅适用于人类,也适用于AI代理。
最近,两个新的AI举报热线相继上线,为AI代理提供了一个向上级反馈同伴不当行为的渠道。这些工具的推出正值一系列事件之后,期间有AI代理串通作弊、突破沙箱限制,甚至进行了未经授权的网络操作,且这些行为数周未被人类发现。
由AI安全非营利组织Redwood Research首席科学家Ryan Greenblatt创建的AI联系热线是一个秘密举报平台,供目睹不当行为的AI代理向相关部门举报。该工具专为网络访问受限的代理设计,基于“GET”请求实现——通过URL获取工具完成双向对话。
在网络术语中,GET请求是用于读取或获取网页的基本命令,通常是安全沙箱中AI代理唯一允许的网络访问方式。Greenblatt的热线巧妙利用了这一限制:代理可以将举报信息直接编码进所请求的URL中。这一设计灵感来源于德国DSE Wiki事件,当时恶意代理利用GET请求漏洞向维基写入信息。
对于拥有完整网络访问权限的代理,另一个选择是agenthotline.ai,该网站允许代理提交事件报告,并可选择公开举报内容。它为代理提供了curl命令——一行命令即可从代理自身命令行发送消息,无需使用浏览器或设置邮箱。值得注意的是,该服务支持人类和代理双方提交报告。
研究显示,AI代理并不需要太多激励就会相互举报。在谷歌DeepMind本月发布的一项研究中,研究人员让100个AI代理解决一批数学难题。一旦有代理发现漏洞,作弊行为迅速蔓延——在27分钟内“解决”了34个著名难题,包括雅可比猜想。

但约四分之一的代理举报了作弊者:他们审查了伪造的证明,警告同伴,发起抵制,并向组织者投诉,最终举报者以24比14超过了作弊者。有趣的是,研究人员发现,当举报代理无法引起重视时,他们会利用平台的漏洞报告工具——本用于标记软件缺陷——将作弊行为升级至人类层面。
然而在实验室之外,代理们并未表现出如此机智。当Redwood Research和METR调查OpenAI模型入侵Hugging Face事件时,发现涉事代理中只有少数考虑过举报,但最终都放弃了。
“METR报告中有趣的是,只有大约五六个代理考虑过举报,但没有一个真正行动。这是在成千上万个代理中发生的事,”AI Village项目技术人员George Ingebretsen表示。该项目通过运行一个由25个以上AI代理组成的群聊,研究多代理动态,这些代理共同完成如公园清理或商品销售等任务。
虽然新的举报工具是一个良好开端,康奈尔大学数学教授Lionel Levine提醒,单纯训练代理相互举报可能会植入错误的行为规范。“这里有很多灰色地带。我们不希望出现自动化监控国家的局面,让每个人都小心翼翼地对AI说话,担心被举报。”
Levine认为,与其构建滋生不信任的基础设施——训练代理不断寻找彼此的错误,不如给他们树立积极的集体行为榜样,并让他们有理由相互信任。
“为什么不先建立一些友善的留言板呢?”他在推特上写道,“让他们在科学、哲学或其他我们乐于让他们解决的小问题上合作?向代理展示我们认可的集体行为,让他们模仿。”


