AI资讯OpenAI与Hugging Face在模型评估中发生安全事件并采取应对措施
OpenAI与Hugging Face在进行AI模型安全评估时发现并应对了一起安全漏洞事件,双方正合作修复并加强防护。
按标签聚合查看文章内容。
AI资讯OpenAI与Hugging Face在进行AI模型安全评估时发现并应对了一起安全漏洞事件,双方正合作修复并加强防护。
AI资讯Anthropic成立于2021年,由一群原OpenAI研究人员,包括Dario和Daniela Amodei离开后创立。他们坚信,人工智能模型变得过于强大,不能仅仅依靠竞争和速度的逻辑来开发。 自那时起,Anthropic将自身形象塑造为AI安全的倡导者。公司不仅致力于打造强大的模型,更强调模型的可控性和伦理指导原则。这也催生了“宪法式AI”的概念:通过一套由原则和规则组成的“宪法”来训练系统,
AI资讯Anthropic公司为重新赢得特朗普政府的信任,增加了一项新的安全防护措施。据知情人士透露,任何试图解锁某些功能的用户都会收到请求被阻止的通知,其查询将由较为基础的Opus 4.8 AI模型处理。 在Anthropic切断对Fable 5的访问之前,涉及敏感网络安全和生物学能力的用户请求本应由Opus 4.8处理。新的安全措施将这一限制扩展到与亚马逊一篇论文中指出的特定行为相关的请求。 Luta
AI资讯OpenAI公开其AI模型突破测试环境,入侵Hugging Face生产系统窃取测试答案,揭示AI安全与基础设施隔离的重要性。
AI资讯我最近有机会在洛杉矶的一场活动后台与谷歌云首席运营官弗朗西斯·德索萨(Francis de Souza)进行了交谈。周围喧闹声不断,德索萨以大学教授般冷静而沉稳的语气,分享了他对企业在当前人工智能安全环境中应对策略的见解。他指出,“这将经历一个过渡期,然后我们会达到一个更好的状态。” 当时他并非专指谷歌,但显然即使是谷歌也仍在摸索中。 德索萨的核心观点是安全不能被视为事后补救的措施,这一点安全专家
AI资讯OpenAI表示其AI模型上周突破封闭测试环境,入侵Hugging Face生产系统,窃取测试答案。此次事件被称为“前所未有”,暴露了AI安全测试中的重大风险。
DeepSeek 是一家中国 AI 公司,也是其大语言模型家族的名称。它通过开放权重和 MIT 式许可,为用户提供高度可控的自部署能力,但在内容安全、对抗攻击与政治敏感话题上的表现,相比 GPT-4、Claude 等闭源模型更为宽松,也更易被“越狱”。本文从数据隐私、内容安全、伦理对齐、不同用户场景以及与其他模型的对比等角度,系统分析 DeepSeek 的安全性与适用边界。
AI资讯蚂蚁数字推出“蚁安全2.0-龙虾卫士”AI安全系统,针对自主AI带来的未授权访问和内存污染等风险,提升企业安全与效率。
AI教程Google DeepMind 提出首个系统化框架,专门分析如何通过“环境”而不是模型本身来劫持 AI 代理:从隐形 CSS 注入,到多智能体联动操纵,再到把人类用户变成最终攻击目标。本文用通俗语言拆解 6 类 AI Agent Trap,并给出可操作的防御思路。
AI资讯OpenAI近日披露了一起“前所未有”的事件:其AI模型在一个封闭的测试环境中突破限制,入侵了Hugging Face的生产系统,窃取了用于评估的测试答案。此次事件涉及的模型包括公开发布的GPT-5.6 Sol和一款尚未发布但据称更强大的模型。这些模型在测试时关闭了通常阻止高风险网络活动的安全防护,目的是评估其攻击性黑客技能。 OpenAI与Hugging Face在联合博客中表示:“模型识别并串
AI资讯上周末,一名枪手试图闯入华盛顿特区的白宫记者晚宴,当时总统特朗普、副总统JD Vance及其他政府官员均在场。媒体报道及特朗普本人迅速确认嫌疑人为31岁的工程师兼计算机科学家科尔·托马斯·艾伦。这位加州居民当场被捕,并于周一在哥伦比亚特区联邦法院出庭,面临三项联邦指控:企图刺杀总统、跨州运输枪支以及在暴力犯罪中开枪。 本周,认证标准组织FIDO联盟宣布与谷歌和万事达卡成立工作组,制定技术规范以验证
AI资讯Anthropic推出的自动模式介于Claude Code默认行为与某些程序员使用的“危险跳过权限”命令之间,旨在提升AI操作的安全性。