In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
10:42
"Il cervello" degli attentati dell'11 settembre 2001 sarà giudicato nel 2028 da un tribunale militare. È detenuto a Guantanamo dal 2006.
10:39
L'ANM ha emesso due avvisi di codice giallo per instabilità atmosferica e intensificazioni del vento, validi in diverse zone del paese.
10:31
Oggetto volante caduto nei pressi della strada Chișinău-Basarabeasca. La zona è stata isolata dalla polizia.
10:28
Gli Stati Uniti hanno annunciato la smantellamento di un'operazione di hacking cinese che ha preso di mira agenzie governative come il Dipartimento di Giustizia, la NASA e la Riserva Federale
10:15
Il Pentagono analizza la presenza militare americana in Europa. I criteri secondo cui saranno valutati gli alleati della NATO
Vedi altre notizie