In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
15:10
Quattro dipendenti del Penitenziario di Giurgiu sono stati sospesi per comportamento abusivo dopo aver picchiato un detenuto che era entrato in arresto cardiaco.
14:59
Dominic Fritz, il sindaco di Timișoara, è stato sanzionato con il 10% dello stipendio per i prossimi 6 mesi
14:51
Il vicegovernatore della BNR spiega perché Fitch ha riconfermato il rating di stabilità della Romania
14:40
Il presidente Nicușor Dan ha promulgato la legge riguardante la dichiarazione dello stato di crisi nel mercato petrolifero e ha prorogato il termine per l'IVA ridotta sulle abitazioni.
14:39
La Casa Bianca ospiterà un incontro con rappresentanti delle aziende di intelligenza artificiale per analizzare un quadro di test della sicurezza informatica.
Vedi altre notizie