AI资讯Anthropic研究员首次展示自我改进型AI的雏形
训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。 上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性
按标签聚合查看文章内容。
AI资讯训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。 上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性