Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
15:09
L'auberge Burg-Hostel de la citadelle médiévale de Sighișoara ferme après 25 ans en raison d'une augmentation du loyer de près de neuf fois.
15:03
Les policiers de la capitale ont fait une descente dans un salon de massage utilisé pour le proxénétisme.
15:02
Les pompiers et les équipes forestières interviennent pour éteindre les incendies de végétation et de forêt dans le département de Caraș-Severin, affectant plus de 60 hectares, y compris le Parc National Domogled.
14:55
Cinq personnes sont mortes à Sébastopol, en Crimée, lors d'une opération de désamorçage d'un dispositif explosif.
14:52
La Bulgarie accueillera l'Eurovision sur la côte de la mer Noire, à Burgas
Voir plus d’actualités