Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
19:13
L'application e-Terra a eu des interruptions temporaires les 12 et 13 août en raison du nombre élevé de demandes.
19:07
L'ancien évêque Christopher Saunders a été condamné en Australie pour abus sexuel sur deux jeunes, ayant été reconnu coupable de 13 des 19 accusations.
19:06
Fermier d'Afghanistan, surpris par ce qu'il a trouvé dans le jardin : une bombe de 500 kilogrammes
Voir plus d’actualités