In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
19:50
Timișoara e Oradea riducono l'illuminazione pubblica per risparmiare energia
19:50
ISU Buzău interviene per spegnere un incendio di vegetazione secca nel comune di Podgoria, che ha colpito 20 ettari
19:46
Il traffico stradale è bloccato sulla DN 1, nella località Unirea, a causa di un incidente tra un'automobile e una cisterna di gasolio.
19:43
La commissione verifica se la Spagna può pagare il risarcimento di 23,5 milioni di euro accordato a un investitore in energia rinnovabile
19:42
EPPO indaga possibili frodi di circa 5 miliardi di euro nel Meccanismo di ripresa e resilienza
Vedi altre notizie