Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
23:00
Ancien ambassadeur allemand à Tel Aviv critique la colonisation israélienne en Cisjordanie : « Nous devons clarifier ce que nous voulons dire lorsque nous affirmons, à juste titre, que nous soutenons Israël »
22:52
Deux groupes de médias américains ont intenté un procès contre la vente d'accès prioritaire aux publications de Donald Trump sur Truth Social, considérant le système comme corrompu et inconstitutionnel.
22:45
SBU annonce que les forces ukrainiennes ont attaqué la base navale russe de Novorossiisk, détruisant trois navires de guerre. L'attaque a eu lieu dans la nuit de mardi à mercredi.
22:41
Une organisation à but non lucratif de Berlin a déposé une plainte pénale contre les lunettes intelligentes Meta, accusant une violation des normes de confidentialité en Allemagne.
22:32
Le ministre israélien de la Défense a déclaré qu'il ne se retirera pas des zones de sécurité au Liban, en Syrie et dans la bande de Gaza, poursuivant les opérations contre le Hezbollah.
Voir plus d’actualités