In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
20:44
Nicușor Dan avverte che chiederà la riesaminazione della Legge sulla decarbonizzazione per proteggere i fondi del PNRR
20:28
Lionel Messi ha donato 80.000 euro per la ricostruzione della zona Sierra Oeste vicino a Madrid, devastata dagli incendi.
20:16
ONU: La malnutrizione infantile acuta raggiunge livelli allarmanti in Afghanistan
20:00
Spider-Man: Brand New Day ha generato 1,05 miliardi di dollari nelle prime sei giorni, diventando il secondo film con il maggior incasso più veloce dopo Avengers: Endgame
19:50
Timișoara e Oradea riducono l'illuminazione pubblica per risparmiare energia
Vedi altre notizie