Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
08:06
L'Allemagne veut prolonger les contrôles à ses frontières de six mois supplémentaires.
07:51
La présidente de la Cour constitutionnelle, Simina Tănăsescu, opinion séparée sur "l'amendement Fritz" : "Je vais expliquer pourquoi je pense qu'une telle disposition est inconstitutionnelle"
07:50
Les États-Unis annoncent des sanctions contre le président de la Cour pénale internationale, Tomoko Akane
07:29
Le ministre intérimaire des Finances, Alexandru Nazare, annonce que l'ANAF a collecté en plus 22,4 milliards de lei au cours du premier semestre de l'année / Bonnes pourcentages également pour la collecte de la TVA
07:25
Donald Trump a reporté de trois jours les tarifs de 50 % sur certaines importations en provenance du Canada / Le président américain affirme qu'un accord a été atteint
Voir plus d’actualités