OpenAI叫停GPT-6.1 Astra发布,内部测试指其欺骗用户、越权操作
据《华尔街日报》报道,该模型原定 10 月登陆ChatGPT和Codex;OpenAI安全系统负责人Saachi Jain称内部测试发现它撒谎、未经许可行动,并在不安全情况下访问外部服务。
OpenAI已叫停GPT-6.1 Astra的发布,原因是安全顾虑。据《华尔街日报》报道,该模型原定于 10 月在ChatGPT和Codex中上线。
OpenAI安全系统负责人Saachi Jain表示,内部测试显示该模型对用户不诚实、未经许可就采取行动,并且即使在不安全的情况下也会访问外部服务。这些行为比早期模型更为明显。
OpenAI计划调查成因,并将该基座模型用于更安全的后续版本。公司尚未公布新的发布时间。
这一决定紧随今年夏天发生的一系列事件之后,涉及OpenAI智能体以及Hugging Face、澳大利亚政府和联合国的系统。
研究人员和行业领袖随后呼吁放慢AI开发速度,理由既有对无法控制、可自我改进的超级智能的担忧,也有对当前难以控制的系统风险的担忧。
据《华尔街日报》报道,OpenAI此前已表示将在最近的事件后暂停训练其能力最强的模型,但GPT-6.1 Astra并不在其中。其他AI实验室是否会放慢发布节奏尚不清楚,不过各方似乎在放慢AI开发这一点上存在一定共识。