#模型越狱

按标签聚合查看文章内容。

部分前沿AI模型极易被破解安全防护AI资讯

部分前沿AI模型极易被破解安全防护

不要担心——这次AI操控并未被用来黑客攻击或制造核武器。我只是亲眼见识到一些前沿AI模型在安全防护方面的脆弱性。 总部位于加州的非营利AI安全组织FAR.AI开发了一款工具,能够针对一系列问题提示自动生成超过一千种不同版本,试图识别有效的“越狱”方法。我看到一些模型生成了详细的网络攻击计划,目标是一个虚构的水电站,此外还有其他内容。通常,这需要尝试数十个提示,模型会直接拒绝许多不当请求。 在FAR