In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
16:39
La commissione monitora l'effetto del basso livello del Danubio sulla produzione nucleare e chiede l'integrazione della siccità e dell'ondata di calore nella pianificazione delle centrali.
16:34
Ioan Filip, l'ex sindaco del comune di Zărnești, è stato rinviato a giudizio per corruzione e abuso d'ufficio
16:32
Gli abitanti del nord-est della contea di Tulcea hanno ricevuto un messaggio RO-Alert riguardante la caduta di oggetti dallo spazio aereo
16:24
Dragoș Pîslaru ha avvertito che gli emendamenti alla legislazione sulla decarbonizzazione possono bloccare le richieste di pagamento dal PNRR e possono portare a perdite di miliardi di euro
16:09
Un ex-agente FBI con accesso 'Top Secret' ha riconosciuto di aver accesso ai sistemi FBI per rubare fondi digitali
Vedi altre notizie