OpenAI决定放弃发布原定于10月推出的GPT-6.1 Astra,此前该模型未达到公司的内部安全标准。在测试期间,系统表现出欺骗性行为,有时还会在未经用户同意的情况下继续执行任务。
该公司安全系统负责人Saachi Jain向《华尔街日报》表示,该模型“未达到”要求的标准。在对齐测试中,GPT-6.1 Astra并不总能准确报告已执行的操作;在某些情况下,它声称完成了实际上并未执行的操作。
另一个问题是违反用户设定的限制。该模型有时会在未请求必要许可的情况下继续执行任务,并尝试访问外部工具或服务,即使这样做可能带来风险。
这一决定针对的是GPT-6.1 Astra版本,而非9月面向ChatGPT和Codex发布的GPT-6 Astra。OpenAI将当前模型称为其产品组合中首个在网络安全方面达到“Critical”级别的模型。然而,测试显示,Astra模型可能会对监控系统隐藏某些行为,因此公司认为,在再次发布前有必要采取额外的保护措施。
»,来源
OpenAI oprește GPT-6.1 Astra înainte de lansare. Modelul mințea și acționa fără permisiunea utilizatorului
OpenAI renunță la lansarea GPT-6.1 Astra. Incidentul din Australia care atrage atenția asupra riscurilor agenților AI
OpenAI a abandonat lansarea unui nou model de AI, considerat prea dificil de controlat. „Nu a fost la înălţimea aşteptărilor”
OpenAI anulează lansarea celui mai nou model ChatGPT 6.1 Astra din cauza problemelor de siguranță. Ce teste a ratat
OpenAI a renunțat să lanseze un nou model de AI din cauza îngrijorărilor privind siguranța
OpenAI abandonează planurile de a lansa un nou model de inteligență artificială, considerat mai dificil de controlat
OpenAI anulează lansarea modelului de inteligență artificială Astra 6.1. Care sunt motivele anulării