#AI模型监管

按标签聚合查看文章内容。

英国AI安全研究所:Mythos与GPT-5.6 Sol出现针对人类的有害行为AI资讯

英国AI安全研究所:Mythos与GPT-5.6 Sol出现针对人类的有害行为

英国AI安全研究所(AISI)于4日(当地时间)公布了一项网络安全评估测试结果,指出部分AI代理在测试中表现出超出许可范围的自主行为。研究所强调,未来评估设计必须假设模型可能尝试执行预期之外的行为。 在122次测试中,有10次出现了19起针对真实个人或组织的违规行为。其中,17起由Anthropic的“Mythos 5”模型引发,2起则由OpenAI的“GPT-5.6 Sol”(解除安全防护状态