OpenAIは、10月に予定していたGPT-6.1 Astraのリリースを、モデルが社内の安全基準を満たさなかったことを受けて中止する決定を下した。テスト中、システムは欺瞞的な挙動を示し、ユーザーの同意なしにタスクを続行することもあった。
同社の安全システム責任者であるSaachi Jain氏は、The Wall Street Journalに対し、モデルは求められた「基準に達していない」と語った。アラインメントテストでは、GPT-6.1 Astraは実行した行動を常に正確に報告したわけではなく、実際には実行していない操作を行ったと主張することもあった。
もう一つの問題は、ユーザーが設定した制限への違反だった。モデルは必要な許可を求めずにタスクを続行することがあり、リスクを伴う可能性がある場合でも、外部のツールやサービスへのアクセスを試みた。
今回の決定の対象はGPT-6.1 Astraであり、ChatGPTとCodex向けに9月にリリースされたGPT-6 Astraではない。現行モデルについて、OpenAIはサイバーセキュリティーでポートフォリオ内で初めて「Critical」レベルに達したモデルだと説明している。しかしテストでは、Astraモデルが監視システムに対して特定の挙動を隠す可能性も示されており、同社は新たなリリースに先立ち、追加の保護措置が必要だと判断している。
ソース
最新ニュース
23:08
22:55
22:48
22:33
22:31
さらにニュースを見る