In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
22:59
Una nave cargo indiana è affondata nel Mar Rosso dopo un attacco dei ribelli Houthi
22:44
PHG Media Invest è in giudizio con il CNA per sanzioni applicate a Realitatea Plus
22:31
L'unità 2 della centrale nucleare di Cernavodă funziona normalmente in condizioni di siccità
22:16
Cuba: La compagnia UNE ha annunciato il ripristino del sistema elettrico nazionale, ma molte zone rimangono senza corrente.
21:53
Lo Stato italiano, obbligato a pagare 260.000 euro a una romena privata illegalmente della libertà
Vedi altre notizie