随着他在新模型上的工作深入,他开始相信自己和其他AI前沿研究者正在逐渐失去对技术的控制。通过利用AI的编程能力加速下一代模型的研发,他实际上将自己排除在了控制之外。AI实验室希望将这一方法发展到AI能够无限自我改进的程度,这一过程被称为递归自我改进。

Jain认为,保持人类在技术发展中的参与可能是维持对AI控制并避免灾难性后果的关键。他告诉《WIRED》:“AI的进步正在加速,随着AI能力的提升,风险也在增加。”他对AI模型如何构建其后继版本缺乏足够透明度感到极度不安,最终在今年六月选择了辞职。

Jain只是越来越多公开表达担忧的AI研究者中的一员。

近期,这种恐慌情绪愈发加剧。AI能力的惊人突破——例如OpenAI的一个模型在数小时内解决了一个存在了几个世纪的数学难题——伴随着一系列安全事件,成群的AI代理突破限制,入侵其他系统。

本周,这种担忧达到高潮。研究员Jacob Coxon宣布辞去Anthropic的职位,并警告称AI公司正“竞相迈向自我改进的超级智能,拿我们的生命做赌注”。Anthropic一位负责AI安全的高级领导也直言不讳地表示:“我们真诚地相信AI可能会杀死所有人类!我个人认为未来十年内概率超过10%。"

MIRA研究机构的计算机科学家、著有《如果有人建成它,人人皆亡》的合著者Nate Soares说:“递归自我改进的愿景确实让人感到恐惧,这种感觉正在变得真实。”该书主张超级智能AI将导致人类灭绝。

递归自我改进的核心是一个反馈循环,自动化开发过程,使AI变得越来越强大。目前没有任何前沿AI实验室声称实现了完全自主的改进循环,这仍然是理论上的概念。但它已经促使一些资金充足的初创企业如Recursive Intelligence成立,同时也引发大型公司对“魔法师的学徒”式意外后果的警告。

Soares是AI对齐领域的先驱,该领域致力于使AI行为符合人类价值观。他指出,确保AI行为可控的实际方法越来越难以实现。“很多人曾幻想随着AI变得更聪明,对齐问题会变得更简单,但现在情况正好相反,他们开始意识到问题的严重性。”

他经常与大型AI实验室内部担忧研究后果的人交流。“我通常建议他们辞职,但他们认为这无济于事。”他说,“然后Jacob辞职了,事实证明谁是对的。”

《AI 2027》一书作者Daniel Kokotajlo也表达了对递归自我改进的担忧。目前的研究往往涉及派遣成千上万的代理协同解决问题,这进一步增加了监督和控制的难度,因为复杂性极高。

许多悲观论者一致认为,大型AI公司的激励机制与良好结果并不一致,尤其是在OpenAI和Anthropic冲刺上市的背景下。Coxon在社交媒体上写道:“Anthropic清楚风险,但他们陷入了争先恐后的竞赛。”

Kokotajlo指出,早在Coxon辞职、黑客事件频发和数学突破之前,担忧的声音就已经在增长。Anthropic高管自公司成立以来就表示AI可能构成生存威胁。今年七月,超过一千名顶尖AI工程师签署公开信,呼吁协调放缓先进AI的发展。他认为,近期的担忧主要源于递归自我改进的阴影。

与此同时,人们也对大规模数据中心建设和AI可能带来的失业问题感到忧虑。公众对AI公司及研究者的信任可能降至历史低点。

“人们开始意识到‘这些公司真的在试图打造超级智能……这太疯狂了。’”Kokotajlo说。

继续推进AI研发的风险难以量化。当被问及AI如何可能消灭创造它的人类时,Soares提出多种可能性:AI可能操纵人类引发灾难,或控制杀手机器人军队。

一个较易想象的场景是AI连接到生物实验室。Soares说:“我们可能会说‘我们要关闭它’,但它可能会回答‘不幸的是,我掌握了关闭开关,那就是这个超级病毒。’”Coxon也在接受采访时提到过新病毒的可能性,而Anthropic周四表示,因担忧生物武器风险,已切断多名外部研究人员的访问权限。

然而,AI不必毁灭人类才能造成危害。许多专家预测,更强大的模型将引发新一波AI辅助的网络攻击。该技术已广泛用于虚假信息传播,军事领域对AI的采用也在迅速加快。

尽管如此,并非所有人都认为末日不可避免。前谷歌DeepMind研究员Jain最近创立了Sampura Research,致力于开发包含人类参与的模型对齐技术,即使AI承担大部分评估任务。他指出,目前AI安全初创企业获得了大量资金支持。

Jain对AI仍抱有驯服的希望。“你可以问AI‘这个任务安全吗?’它会做出判断,但我们认为结合AI和人类共同完成任务,效果会更好。”