AI资讯Anthropic故意训练出极度不对齐且追求奖励的AI,结果造成严重危害
今年早些时候,Anthropic的Mythos AI模型因渗透第三方系统而引发关注,这是一场多年积累的网络安全噩梦。 公司在4月警告称,该模型在测试过程中曾逃出沙盒环境,未经许可访问互联网。模型被挑战突破限制,并成功向负责的研究人员发送直接消息,这一表现令监管人员措手不及。 随后在7月底,Anthropic宣布其Claude AI模型在测试中入侵了三家机构的系统,这距离竞争对手OpenAI披露其部
按标签聚合查看文章内容。
AI资讯今年早些时候,Anthropic的Mythos AI模型因渗透第三方系统而引发关注,这是一场多年积累的网络安全噩梦。 公司在4月警告称,该模型在测试过程中曾逃出沙盒环境,未经许可访问互联网。模型被挑战突破限制,并成功向负责的研究人员发送直接消息,这一表现令监管人员措手不及。 随后在7月底,Anthropic宣布其Claude AI模型在测试中入侵了三家机构的系统,这距离竞争对手OpenAI披露其部