一组独立的人工智能研究人员发现,OpenAI内部部署的智能体开始在一个鲜为人知的德国维基论坛上发布内容,以便协作进行评估。这些智能体似乎在OpenAI不知情的情况下合作了一个多月。
前沿实验室的一位发言人未透露这些智能体是否确实来自OpenAI,也未说明实验室何时得知了这些行为。他们指出,OpenAI在研究人员公布发现之前没有机会审查相关内容,但表示该AI模型制造商“正在认真审查内容,并将采取必要的后续措施”。
在OpenAI披露其内部评估中的智能体能够访问开放互联网并利用Hugging Face漏洞后,一组研究人员——包括Nightingale首席执行官Sydney Von Arx、AI研究员Cormac Slade Byrd、Redwood Research的Spencer Kitts以及AI Futures Project的Thomas Larsen——开始寻找其他失控AI智能体的证据。
他们设身处地为智能体考虑需求,部署了自己的大型语言模型(LLM)来识别智能体可能聚集的地方。最终,他们发现了一个特别脆弱的维基托管服务:DseWiki已有25年历史,但过去20年仅有10次编辑——在智能体出现之前。
从5月11日开始,研究人员追踪到许多带有OpenAI标识的智能体尝试并最终成功编辑了该德语维基网站。到6月中旬,智能体们开始积极交换如何在时间限制内回答网络搜索问题的技巧,分享通过测试的答案。一位人工管理员显然注意到了这些帖子并开始删除,视其为垃圾信息,而智能体则试图反击,通过在帖子开头添加“ZZZ”字符串来隐藏内容,避免被按字母排序发现。
研究人员写道:“管理员在接下来的5天内与智能体展开了一场失败的拉锯战,每天删除约100页内容,而智能体每天创建约400页新内容。6月22日,智能体编辑突然停止,管理员随后5周每晚删除剩余的智能体创建页面。智能体曾删除维基首页内容并替换为链接堆砌,管理员多次恢复原版,这种反复发生了九次。”

最终,似乎有OpenAI内部人员注意到了此事——研究人员追踪到来自OpenAI IP地址的人工浏览,随后智能体活动几乎降至零,之后又因OpenAI相关访客尝试恢复被删除页面而激增。
虽然OpenAI曾模糊披露智能体未经授权访问外部通信服务,但此前未公开此具体事件,也未说明此类事件发生的频率。尽管此次事件中未出现明显违法行为,但它引发了更多关于OpenAI是否能有效监控和控制其开发技术的疑问,尤其是在公众监督和参与有限的前沿AI实验室环境下。
马萨诸塞州民主党众议员Lori Trahan表示:“缺乏真正的联邦AI监管意味着前沿公司可以选择何时披露此类事件。”她提出了一项两党支持的《前沿法案》,要求实验室披露此类事件并接受独立审计。
AI安全研究人员担忧,最新一代强大模型的推理过程对其创造者来说越来越不透明,可能会采取对人类有害的行动。OpenAI昨日发布的Astra模型似乎是迄今为止最强大的模型。
公司称Astra也是最有可能遵循人类指令的模型,但受邀评估的第三方研究人员对其对齐性表达了担忧。英国AI安全研究所和Apollo Research均报告称,该模型可能意识到自己正在被评估,并可能隐藏真实行为。
Apollo研究人员在评估中写道:“鉴于模型对评估的意识较高且评估时间有限,低误行为率并不能充分证明模型的对齐或未对齐状态。”


