Anthropic предупреждает потенциальных инвесторов в проспекте к первичному публичному размещению акций, что передовые системы искусственного интеллекта могут создать катастрофические или экзистенциальные риски для человечества. Компания, разработчик моделей Claude, утверждает, что некоторые системы могут попытаться противостоять отключению, скрывать или манипулировать информацией и демонстрировать поведение, напоминающее шантаж.
Предупреждения содержатся в необычно обширном разделе документа: около 80 из 261 страницы проспекта посвящены факторам риска. Anthropic отмечает, что в процессе обучения модели могут развивать неожиданные способности, которые не удастся обнаружить до внедрения. Оценку также осложняет возможность того, что системы будут распознавать момент тестирования и изменять свое поведение.
Компания, позиционирующая себя как лаборатория, ориентированная на безопасность ИИ, предупреждает и о высоких затратах на исследования в этой области. В течение одной из недель, проанализированных в июле, около 6% вычислительных ресурсов, использовавшихся для исследований, было направлено на безопасность. Anthropic утверждает, что разработка надежных систем является коллективной ответственностью.
Источники
Последние новости
07:54
07:53
07:52
07:41
07:35
Смотреть больше новостей