Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
11:23
Superliga | Arnold Garita a été présenté aux rouge et blanc. Quel numéro portera-t-il ?
11:08
Le ministre du Travail, a déclaré avant la réunion de Cotroceni sur le thème des salaires : Aucun salaire ne diminuera, et plus des deux tiers des salaires connaîtront des augmentations.
11:04
Le tribunal de Bucarest décide aujourd'hui si Ciprian Ciucu échappe ou non au contrôle judiciaire.
11:00
Dragoș Pîslaru, le ministre intérimaire du Travail, a accusé le CSM d'avoir créé une polémique inutile concernant la rémunération des fonctions de direction dans la justice, le problème étant déjà résolu.
11:00
Formule 1 : Red Bull a prolongé le contrat de Max Verstappen jusqu'en 2030
Voir plus d’actualités