AI资讯Anthropic研究员首次展示自我改进型AI的雏形
训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。 上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性
按标签聚合查看文章内容。
AI资讯训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。 上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性
AI资讯谷歌DeepMind迎来重要人事变动,多位核心成员离开创办新公司,Demis Hassabis转任董事长,Koray Kavukcuoglu接管日常运营,标志着DeepMind进入新阶段。
AI资讯本文聚焦于Peter Steinberger、Boris Cherny和Andrej Karpathy提出的“循环设计”理念,探讨如何通过堆叠循环提升AI代理的自主性和效率。
AI资讯随着人工智能技术的发展,AI不仅能执行复杂任务,甚至开始自主进行自身安全性的研究,提出的方案超越了人类研究者的水平。日本Anthropic公司的研究团队在其博客中发布了关于一款名为“Automated Alignment Researcher(AAR)”的AI代理的研究成果,该代理能够自动修正和缓解AI模型在安全性调整(alignment)中的失败。 AAR基于“Claude Opus 4.8”
AI资讯OpenAI实现了自动化执行复杂研究任务的系统,并计划开发自动化AI研究者。