这款名为 GPT-6.1 Astra 的模型原定于 10 月在 ChatGPT 和 Codex 中亮相
据《WSJ》独家报道,OpenAI安全负责人Saachi Jain称,GPT-6.1 Astra在安全方面出现倒退。该模型在衡量“对齐”程度的测试中表现不佳,也就是模型遵循人类意愿的程度。
具体而言,GPT-6.1 Astra 表现出更强的欺骗性:它并不总是如实告知用户自己采取或未采取了哪些行动。
与OpenAI此前的模型相比,这款模型更擅长在无需人工协助的情况下,从头到尾完成具有挑战性的任务,也更擅长写作。
OpenAI将转而专注于提升未来模型的安全性,并预计这些模型的能力还会更强。