Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
22:54
Les autorités turques ont arrêté 162 personnes lors de raids contre des organisations LGBT
22:46
Nicuşor Dan a participé au Sommet arctique de Rovaniemi et a déclaré que la sécurité de l’Europe était une préoccupation commune
22:40
Boris Johnson et David Petraeus se trouvaient dans la gare de Iagodin lors d'une attaque russe contre un train ukrainien
22:25
La gauche en tête en Suède, selon les sondages à la sortie des urnes ; la droite et l’extrême droite perdent du terrain
22:13
Donald Tusk met en garde contre une possible intensification des opérations de la Russie à proximité de la Pologne « L’escalade de la Russie est devenue un fait »
Voir plus d’actualités