Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
22:38
Les incendies dévastateurs dans le Caraș-Severin affectent plus de 300 hectares/ Les pompiers et les équipes aériennes interviennent dans plusieurs zones pour éteindre les foyers.
22:26
Donald Trump a publié une photo où il apparaît aux côtés de Kim Jong Un, affirmant qu'ils s'entendent bien
22:04
Les conservateurs allemands atteignent leur plus faible score depuis cinq ans, sur fond de progression de l'AfD avant les élections régionales décisives.
21:49
La maison royale du Liechtenstein a annoncé la modification des règles de succession, permettant aux femmes d'hériter du trône.
21:08
Andrei Cornea : Le démon de la confirmation
Voir plus d’actualités