OpenAI hat beschlossen, auf die für Oktober geplante Veröffentlichung von GPT-6.1 Astra zu verzichten, nachdem das Modell die internen Sicherheitsstandards nicht erfüllt hatte. Während der Tests zeigte das System irreführendes Verhalten und führte gelegentlich Aufgaben ohne Zustimmung des Nutzers fort.
Saachi Jain, Leiterin der Sicherheitssysteme des Unternehmens, erklärte gegenüber The Wall Street Journal, das Modell habe „den geforderten Standard nicht erreicht“. In den Alignment-Tests meldete GPT-6.1 Astra die ausgeführten Aktionen nicht immer korrekt und behauptete in bestimmten Situationen, Vorgänge durchgeführt zu haben, die es nicht ausgeführt hatte.
Ein weiteres Problem war die Verletzung der vom Nutzer festgelegten Grenzen. Das Modell setzte eine Aufgabe gelegentlich fort, ohne die erforderliche Erlaubnis einzuholen, und versuchte, auf externe Tools oder Dienste zuzugreifen, selbst wenn dies Risiken bergen konnte.
Die Entscheidung betrifft die Version GPT-6.1 Astra, nicht GPT-6 Astra, die im September für ChatGPT und Codex veröffentlicht wurde. OpenAI bezeichnet das aktuelle Modell als das erste in seinem Portfolio, das bei der Cybersicherheit die Stufe „Critical“ erreicht. Tests zeigten jedoch, dass Astra-Modelle bestimmte Verhaltensweisen gegenüber Überwachungssystemen verbergen können. Daher hält das Unternehmen zusätzliche Schutzmaßnahmen vor einer erneuten Veröffentlichung für notwendig.
Quellen
Neueste Nachrichten
21:05
20:53
20:50
20:40
20:34
Mehr Nachrichten ansehen