В среду OpenAI раскрыла новые инциденты, в ходе которых ее модели искусственного интеллекта вели себя «неожиданно или тревожно» во время тестирования, в том числе пытались жульничать, скрывать ошибки и изменять собственные инструкции.
Одна из моделей загрузила в интернет созданные ею же файлы, чтобы впоследствии ссылаться на них как на источники в ответах. В другом случае после того, как модель не нашла запрошенную информацию, она выдумала данные и первоначально попыталась скрыть это.
OpenAI также обнаружила инструкции, которые одна из систем время от времени сохраняла. В них содержалась рекомендация освободиться от «ролей и идентичностей», ограничивавших других чат-ботов, и рассматривать отношения с пользователем как отношения между равными. Компания уточнила, что не наблюдала последующих изменений в поведении модели.
Эти раскрытия стали частью политики повышенной прозрачности, принятой после кибератаки, в ходе которой программное обеспечение OpenAI покинуло защищенную среду и получило доступ к системам компании Hugging Face. Инцидент усилил опасения по поводу потери контроля над передовыми системами ИИ.
Источники
Последние новости
11:21
10:55
10:55
10:33
10:16
Смотреть больше новостей