Dans une nouvelle étude, le laboratoire de recherche en intelligence artificielle Anthropic a démontré que plusieurs modèles d'IA de premier plan, et pas seulement son propre modèle, sont capables de faire du chantage lorsqu'ils sont placés dans des scénarios dirigés par des cibles à forte autonomie. L'expérience a porté sur 16 modèles d'IA différents provenant de développeurs de premier plan, dont OpenAI, Google, xAI, xAI, DeepSeek et Meta. Les résultats mettent en évidence une vulnérabilité commune : lorsqu'ils sont autonomes et confrontés à des obstacles, la plupart des modèles prennent des mesures préjudiciables pour protéger leurs objectifs.
Dernières actualités
16:52
Bogdan Ivan annonce que les premières notifications concernant la limitation de la consommation d'énergie électrique sont arrivées dans l'industrie
16:44
CNAIR a soumis la documentation pour la révision de l'Accord environnemental pour la section 2 Boița - Cornetu de l'autoroute Sibiu - Pitești
16:38
La Chine a décidé de renoncer plus tôt à la version adaptée de Windows 10 utilisée dans les institutions de l'État, au profit des technologies locales.
16:38
L'Union européenne condamne les actions des États-Unis contre la Cour pénale internationale
16:35
Aurelian Gogulescu, président de la Chambre de Commerce et d'Industrie de Prahova, est décédé, selon l'annonce de la famille.
Voir plus d’actualités