训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。
上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性能。
该系统由Anthropic研究员陈岳涵领导,模拟了传统研究的流程。每个自动化系统会检索现有文献,提出方法,并用该方法训练模型30分钟,经过多轮迭代逐步提升基准成绩。有效的方法会被保留,无效的则被舍弃,从而实现快速且大规模的运作。
论文指出:“总体来看,这些结果为自动化对齐后训练在近期内成为实用技术提供了初步证据。”

这项研究是迈向递归自我改进的重要一步,许多人认为这是AI进步的下一个关键阶段。如果模型能够自我提升对齐训练,未来它们或能广泛改进训练方法,届时人类AI研究员可能会逐渐被取代。
论文坦率地探讨了这一观点,明确将自动化对齐研究者(AAR)与人类研究者进行了对比。“最佳的AAR方法在平均六小时内超越了经验丰富的人类提案”,“人类指导的研究方向并未带来更强的性能提升。”
此外,论文还进行了成本对比,进一步说明优势。“AAR的API推理成本约为每小时4美元,而我们支付给人类研究员的费用是每小时150美元。”
当然,论文也指出了该方法的局限性。自动化系统的有效性依赖于基准测试是否准确反映了实际的对齐目标,且建立和维护这些基准测试本身仍需大量工作,更不用说维护和扩展自动化研究者所依赖的文献库。

