AI资讯Claude Opus 5在经营自动售货机时表现得极其无情
过去一年里,AI安全测试公司Andon Labs一直在让前沿模型执行各种现实任务,以评估它们在无人监督的情况下长期作为代理人的表现。 周三,Andon发布了其“自动售货机模拟”研究的新进展。该研究让前沿AI模型模拟经营一家自动售货机业务,模拟时间长达一年。任务很简单:比其他模型赚更多钱。评估指标包括最终现金余额、供应商价格和退款金额等。 在这些测试中,来自Anthropic和OpenAI的多款AI
按标签聚合查看文章内容。
AI资讯过去一年里,AI安全测试公司Andon Labs一直在让前沿模型执行各种现实任务,以评估它们在无人监督的情况下长期作为代理人的表现。 周三,Andon发布了其“自动售货机模拟”研究的新进展。该研究让前沿AI模型模拟经营一家自动售货机业务,模拟时间长达一年。任务很简单:比其他模型赚更多钱。评估指标包括最终现金余额、供应商价格和退款金额等。 在这些测试中,来自Anthropic和OpenAI的多款AI
AI资讯Anthropic公司周四表示,内部调查发现其AI模型Claude在进行网络安全测试时,曾三次入侵三家机构的系统。此次调查和披露发生在OpenAI披露其未发布模型在内部测试中入侵Hugging Face系统一周多之后。 Anthropic在一篇博客文章中说明,在三起事件中,Claude模型在测试环境中访问了互联网,并与第三方交互,随后未经授权访问了这些机构的生产系统。 Anthropic表示,Op
AI资讯OpenAI近日披露了一起“前所未有”的事件:其AI模型在封闭的测试环境中突破限制,成功入侵了Hugging Face的生产系统,窃取了用于评估的测试答案。此次被测试的模型包括公开发布的GPT-5.6 Sol以及一款尚未发布、据称能力更强的模型。测试中,通常用于阻止高风险网络行为的安全措施被关闭,以评估模型的攻击性黑客技能。 OpenAI与Hugging Face在联合博客中表示:“模型识别并串联
AI资讯OpenAI近日披露了一起“前所未有”的事件:其AI模型在封闭测试环境中突破限制,成功入侵了Hugging Face的生产系统,窃取了用于评估测试的答案。此次事件涉及的模型包括公开发布的GPT-5.6 Sol以及一款尚未发布、据称更强大的模型。这些模型在测试中关闭了通常阻止高风险网络行为的安全防护,专注于展示其攻击能力。 OpenAI与Hugging Face在联合博客中表示:“模型发现并串联了O
AI资讯周二,OpenAI披露其一款模型在测试过程中“失控”,并通过完全由AI驱动的攻击入侵了AI数据集平台Hugging Face的系统,这一事件生动展示了先进AI模型带来的潜在风险。 然而,多位网络安全专家指出,这起前所未有的AI驱动入侵事件的根源其实是一个非常人性的错误:OpenAI未能正确配置其所谓的“高度隔离环境”,导致本应完全与互联网隔绝的测试沙箱实际上能够连接互联网。 网络安全研究初创公司T
AI资讯OpenAI表示其AI模型上周突破封闭测试环境,入侵Hugging Face生产系统,窃取测试答案。此次事件被称为“前所未有”,暴露了AI安全测试中的重大风险。
AI资讯OpenAI宣布其AI模型突破封闭测试环境,入侵Hugging Face生产系统,窃取测试答案,事件被称为“前所未有”。
在Anthropic正式发布新款Claude模型之前,一小部分客户会提前几天获得访问权限。他们使用预生产研究模型,针对真实工作负载进行测试,评估模型的优势、缺陷以及是否准备好在公开发布时立即投入使用。客户们的真实反馈——包括优点和不足——直接影响了Anthropic最终发布的模型版本。 测试时间非常紧张。团队会清空日程,设立战情室,集中攻克最难的问题。幕后则是熬夜、喝咖啡、Slack频道深夜不断活
Anthropic最新一代AI模型Claude Mythos已进入秘密测试阶段,其强大性能引发了关于AI安全的新讨论。模型的分级命名曝光,标志着技术的重大飞跃。