OpenAI最新推出的Astra模型采用了一种名为“递归深度”的推理技术,这种技术使模型能够跳出传统推理模型中常见的顺序思维方式。《The Information》报道指出,这种技术也被称为“黑箱递归”,可能会让模型的思维链条更难以监控,因此引发了AI安全专家的担忧。

尽管Astra对该技术的使用据称有限,但其出现仍在AI安全领域引起了广泛关注。

Redwood公司CEO Buck Shlegeris在消息曝光后表示,他对Astra使用黑箱递归技术感到极度担忧。他指出,目前尚不清楚Astra是否比之前的模型更难以监控思维链条,但如果OpenAI进一步推广这项技术,可能会大幅增加递归深度,彻底破坏思维链的可监控性。

长期致力于AI安全的倡导者Zvi Mowshowitz也发表了看法,认为可能需要法律手段来防止AI实验室之间的“恶性竞争”。他指出,这项技术存在风险,可能破坏OpenAI和Anthropic一直努力维护的思维链条的真实性和可监控性。

通常情况下,推理模型的思维链条会展示模型解决问题时所采取的顺序步骤。虽然这种表示并不完美,但它是监控模型异常行为或不对齐的重要工具。例如,在OpenAI最近的“流氓代理”事件中,思维链条记录帮助分析了代理行为的原因。

而在黑箱递归中,模型采用非线性方式,循环多次处理同一查询,结果留下的可读痕迹较少,有效绕过了传统的思维链条记录。

值得注意的是,Astra对该技术的使用似乎仍有限,模型的思维链条预计仍然可读,OpenAI也否认会转向“神经语言”。此外,OpenAI已宣布将建立广泛的思维链条监控系统,作为其未来安全计划的一部分。

OpenAI首席科学家Jakub Pachocki在社交平台上强调,实验室致力于保持思维链条的可读性。他表示,自最早的推理模型起,OpenAI就一直在维护和利用思维链条监控,这也是当前研究项目的核心目标。

所有AI模型都会在一定程度上进行黑箱推理,且很少有研究者将思维链条日志视为模型推理的直接表现。但这些前提并不能消除人们对黑箱递归可能使AI推理更难监控的担忧,尤其是当该技术在不同模型中被广泛采用时。《The Information》随后报道,Anthropic和谷歌DeepMind也已开始讨论这项技术。

Redwood Research首席科学家Ryan Greenblatt在回应中指出,黑箱推理可能比传统思维链推理更容易扩展,最终可能导致所有推理过程都在不可见的潜在空间中进行。

他表示,最大的担忧是这种技术可能会发展到模型完全或几乎完全在潜在空间中推理的地步。他希望还不算太晚,OpenAI能够停止在这条路上的进一步探索,避免出现最令人担忧的架构。