In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
23:12
Le milizie Houthi dello Yemen hanno attaccato due petroliere saudite, Wafa e Daisy, nel Mar Rosso e nel Golfo di Aden.
22:55
Il ministro britannico degli Esteri evita di rispondere se considera ancora Donald Trump "idiota", "razzista" e "misogino"
22:41
Sparatoria con più vittime a Prospect Hill, Carolina del Nord
22:20
Un drone con esplosivi è stata trovata sulla pista dell'aeroporto di Lipsia / La polizia tedesca ha mobilitato un robot per la disattivazione
21:47
L'Iran e l'Oman hanno concordato un percorso di navigazione attraverso lo Stretto di Hormuz
Vedi altre notizie