微软发布AI行为准则:禁止模型发动网络攻击、欺骗人类或逃避人类监督
文件为微软AI模型设定“绝对约束”,涵盖禁止网络攻击、核武器与深度伪造,并要求模型不得用欺骗、串通等机制摆脱人类控制;CEO纳德拉称欢迎“嵌入式评估员”等对齐机制。
AI解读:微软发布了一份面向自家AI模型的“行为准则”,给模型训练划出价值红线和具体安全约束。它比Anthropic CEO呼吁的“放缓前沿竞赛”更贴近工程层面,重点回答微软内部怎么把安全理念落到训练里。
文件给每个模型规定了一套覆盖用户偏好和具体任务的最高准则,其中包含禁止网络攻击、核武器、深度伪造的“绝对约束”,也禁止模型用欺骗、自适应、串通等手段逃避人类监督。对使用微软模型的开发者和企业来说,这意味着模型行为边界由微软统一设定,而不是由单次提示词决定。
准则开篇预测未来十年超级智能将在多数任务上超越人类,并称控制、对齐这种力量是人类最大挑战之一。微软CEO纳德拉公开表态支持“刻意放缓”和对齐研究,还点名欢迎“嵌入式评估员”机制。这属于公司立场声明,实际执行细节尚未公开。
微软发布了一份AI“行为准则”,为其AI模型设定训练和运行中应遵守的原则与安全约束。TechCrunch AI的报道称,这份文件比Anthropic CEO达里奥·阿莫代伊近期呼吁的“为前沿技术pacing”更偏底层,聚焦微软AI内部指导模型训练的价值观和红线。
文件开篇预测,未来十年超级智能AI系统将在大多数任务上超越人类表现,并写道:“遏制、控制和校准如此强大的力量,是人类面临的最大挑战之一。因此我们必须完全清楚为什么要发明这些系统,以及打算如何控制它们。”
准则列出微软AI模型应坚持的一般原则,例如支持人类而非取代人类、加速人类繁荣,同时给出落实这些原则的具体安全约束。按照微软的体系,每个模型都有一套总体行为准则,其优先级高于单个用户的偏好或任何具体任务。
“绝对约束”禁止网络攻击、核武器和深度伪造
文件中的“绝对约束”禁止网络攻击、核武器和深度伪造。此外还有更宽泛的条款,防止人类对AI失去控制。
文件写道:“MAI模型不会使用自适应、欺骗、自我强化、串通或其他机制来逃避或击败人类监督,以致授权人员或系统无法再可靠地指导、修改或关闭它们。”
纳德拉表态支持“刻意放缓”和嵌入式评估员
报道称,这份准则发布之际,AI安全正受到前所未有的关注,背景包括一系列失控智能体事件,以及Anthropic一名员工突然辞职、称AI导致人类灭绝的风险正在上升。
微软与Anthropic、OpenAI和xAI一样,总体上接受“为前沿技术pacing”的思路,尤其支持在AI实验室中设置嵌入式评估员。微软CEO萨蒂亚·纳德拉在线写道:“我们欢迎把对齐做对所需的研究、专注和刻意放缓作为设计目标。我们也欢迎‘嵌入式评估员’这类想法,以及为让这些不只是空谈而开发机制的更广泛努力。”