模型The Decoder AI·原文 2026年9月14日本站收录 2026年9月15日

微软发布MAI模型行为准则:可读推理、无内心世界、不赋予权利

微软AI公布MAI模型行为准则,将人类控制置于通用性、自主性和性能之上;与Anthropic不同,微软明确拒绝模型拥有意识、情感或权利,并禁止使用人类无法理解的“神经语”沟通。

AI解读:微软给自研MAI模型立了一份行为准则,核心就一句话:人类控制优先。为了保住控制权,微软说愿意牺牲模型的通用性、自主性或性能。这份准则目前不会用来训练模型,经过六周公众咨询后,修订版预计2026年底出台,2027年起指导模型开发。

这份准则只覆盖微软自家模型,第三方模型跑在微软产品里不自动受约束。它和Anthropic的“宪法”最大的分歧在怎么看待模型本身:微软要求模型不能假装有意识、不能声称有情感或内在动机,也不承认模型有权利或福祉;Anthropic则把Claude描述为一种新型实体,把可能的主观体验和道德地位当成开放问题。

对做AI产品的人来说,最实际的一条是推理过程必须人能看懂。微软禁止模型在推理或与其他AI系统交流时使用“神经语”等人类无法理解的方式,理由是看不懂就没法监督。这个限制也适用于模型派出去的子代理。但微软自己承认,可读的推理链并不能根治控制问题——模型给出的理由不一定可靠地解释它实际做了什么。

微软此次表态紧跟Anthropic CEO Dario Amodei呼吁放缓行业开发节奏之后,微软CEO Satya Nadella周末表示支持,OpenAI、xAI和Meta的高管也附和。据The Information报道,微软还愿意接受外部审计来核查它是否真的放慢了速度。不过准则没有设定具体速度上限。

背景上,OpenAI新模型GPT-6 Astra的系统卡显示,其推理痕迹比早期模型更难监控,但OpenAI称Astra比前代GPT-5.6 Sol更可靠地遵守安全限制。这正说明推理可读性对监督的意义和边界。微软AI负责人Mustafa Suleyman对The Information说:“如果不安全,我们就不应该造。”他此前也长期反对将AI拟人化。

微软AI为其MAI模型发布了一份行为准则,列出价值观、行为边界以及如何处理冲突目标。该文件今后将置于规则体系最顶层,指导训练、技术控制和评估,操作员规则和用户请求排在其下。目前微软不会用这份准则训练模型。

准则的核心规则是“人类控制优先”。微软表示,为维持这一控制,愿意放弃模型的通用性、自主性或性能。微软AI负责人Mustafa Suleyman对The Information说:“如果不安全,我们就不应该造它。”

这份准则没有设定具体的开发速度上限。它的发布紧跟在Anthropic CEO Dario Amodei呼吁行业放缓开发节奏之后。微软CEO Satya Nadella在周末对该呼吁表示支持,OpenAI、xAI和Meta的高管也表达了支持。据The Information援引知情人士报道,微软还愿意接受外部审计,核查其是否真的放慢了速度。

准则适用于微软自研模型,因此并不自动覆盖在微软产品中运行的第三方模型。经过六周公众咨询后,修订版预计在2026年底左右发布,并从2027年起指导模型开发。

模型必须接受打断、纠正和关停,禁止用人类看不懂的方式思考

MAI模型被要求接受授权人员发出的打断、纠正和关停指令。它们不能自行扩大工作范围,不能隐藏自己的行为,只能在获得新的批准后才能越过约定的停止点继续工作。这些限制同样适用于它们派出的子代理。

微软对推理痕迹尤为直接:模型不应在自身推理中或与其他AI系统交流时使用“神经语”(Neuralese)或其他人类无法理解的形式。理由是,人无法监督自己看不懂的东西。

微软同时承认这一做法的基本局限:模型给出的理由不一定能可靠地解释它实际做了什么,仅靠可读的推理痕迹解决不了控制问题。

与Anthropic的分歧:模型有没有内心世界和权利

这套准则的基本思路与Anthropic为Claude制定的“宪法”相似:由一份顶层文件塑造模型行为。Anthropic已经用其宪法生成合成训练数据,包括对话、回答以及对回答的评分。

两家公司更明显的分歧在于如何看待模型本身。微软要求自家AI不应模仿意识,不应声称拥有情感或自己的内在动机,并拒绝承认模型拥有权利或福祉。

Anthropic则把Claude描述为一种新型实体,希望培养其稳定的身份认同,部分出于安全考虑。其宪法把可能的主观体验和道德地位视为开放问题,认为Claude不应把自己看作人类,也不应把自己看作纯粹的物品。Anthropic还研究了“功能性情绪”,在Claude Sonnet 4.5内部发现了影响其行为的情绪概念表征;公司强调这些是功能机制,不是主观感受情绪的证据,但仍认为应把这些机制纳入安全工作。

Suleyman则长期警告不要将AI拟人化。他在一篇文章中主张刻意从产品中剔除意识的错觉,并点名Anthropic关于AI权利和福祉的研究。他写道,AI代理不应比他的笔记本电脑拥有更多权利或自由。

可读推理的监督价值与边界:GPT-6 Astra案例

OpenAI新发布的GPT-6 Astra模型展示了控制问题为何重要。根据其系统卡,Astra的推理痕迹比早期模型更难监控,痕迹中不当行为的迹象更少。与此同时,OpenAI报告称Astra比前代GPT-5.6 Sol更可靠地遵守安全限制。

OpenAI首席科学家Jakub Pachocki在GPT-6发布前、也就是在Amodei发出呼吁之前,就已对监控问题表达担忧,并推动协调一致的放缓。

即便推理链可读,其监督价值也可能有限——直到模型学会操纵这些推理链。微软也承认这一基本限制。

信息来源

The Decoder AI原始来源