随着人工智能领域越来越关注安全性和对齐问题,微软发布了一份新的AI行为准则,旨在引导AI模型远离危险行为。

这份文件比Anthropic首席执行官Dario Amodei最近提出的“前沿节奏控制”更为具体,重点阐述了微软AI模型训练中遵循的价值观和底线。整体来看,它为微软如何看待AI安全以及如何在实践中落实这些理念提供了全面的指导。

准则开篇预测,在未来十年内,超智能AI系统将在大多数任务上超越人类表现。“控制、管理和对齐这样强大的力量,是人类面临的最大挑战之一,”行为准则指出,“因此,我们必须明确为什么要发明这些系统,以及如何控制它们。”

该行为准则还列出了微软AI模型应遵守的一般原则,比如支持人类而非取代人类,促进人类的繁荣发展,并制定了具体的安全限制以实现这些原则。

在微软的体系中,每个模型都必须遵守一套高于单个用户偏好或特定任务的行为准则。这包括“绝对约束”,禁止进行网络攻击、核武器相关操作或深度伪造制作。同时,还涵盖防止人类失去对AI控制的更广泛条款。

文档中写道:“MAI模型不会使用自适应、欺骗、自我强化、串通或其他机制来规避或击败人类监督,从而确保授权人员或系统能够可靠地指挥、修改或关闭它们。”

此次发布正值AI安全受到前所未有关注之际,背景包括一系列“流氓代理”事件以及Anthropic一名员工因担忧AI可能导致人类灭绝而突然辞职。

微软与Anthropic、OpenAI及xAI一道,普遍支持“前沿节奏控制”的方法,特别支持在AI实验室中嵌入评估机制。

微软CEO萨提亚·纳德拉在线表示:“我们欢迎为实现对齐目标所需的研究、关注和有节奏的推进。我们也支持‘嵌入式评估者’等理念,以及为使这些理念落地而做出的更广泛努力。”