In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
19:08
Un'area intorno alla città di Pisa è stata scossa da un terremoto di magnitudo 4,3, senza vittime né danni.
18:55
PSD accusa il prefetto USR di Timiș di abuso d'ufficio per mantenere il mandato del sindaco Dominic Fritz
18:42
Otto biciclette elettriche valutate 20.000 euro, scoperte dalla polizia di frontiera a Borș
18:40
Una donna di 43 anni è stata arrestata preventivamente a Costanza per tentato traffico di droga
18:29
Radu Miruță annuncia che la circolazione della metropolitana di Bucarest non sarà influenzata dalle restrizioni energetiche
Vedi altre notizie