#自动化研究

按标签聚合查看文章内容。

Anthropic研究员首次展示自我改进型AI的雏形AI资讯

Anthropic研究员首次展示自我改进型AI的雏形

训练AI模型以利用其他AI模型进行优化,已成为新兴实验室的热门目标。近日,Anthropic的研究员通过其研究员项目,首次向我们展示了这一目标在实际中的初步实现方式。 上周五,Anthropic发布了一篇题为《自动化研究者能够可靠地缓解对齐失败》的新论文,详细介绍了AI系统如何在一系列对齐基准测试中稳定提升模型性能。面对10个针对特定不对齐行为的基准测试,自动化系统均成功提升了表现,且未损害整体性

循环工艺:堆叠循环的艺术AI资讯

循环工艺:堆叠循环的艺术

本文聚焦于Peter Steinberger、Boris Cherny和Andrej Karpathy提出的“循环设计”理念,探讨如何通过堆叠循环提升AI代理的自主性和效率。

AI自主开展安全研究,6小时内开发出超越人类的解决方案——Anthropic的“AAR”AI资讯

AI自主开展安全研究,6小时内开发出超越人类的解决方案——Anthropic的“AAR”

随着人工智能技术的发展,AI不仅能执行复杂任务,甚至开始自主进行自身安全性的研究,提出的方案超越了人类研究者的水平。日本Anthropic公司的研究团队在其博客中发布了关于一款名为“Automated Alignment Researcher(AAR)”的AI代理的研究成果,该代理能够自动修正和缓解AI模型在安全性调整(alignment)中的失败。 AAR基于“Claude Opus 4.8”