In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
16:24
Dragoș Pîslaru ha avvertito che gli emendamenti alla legislazione sulla decarbonizzazione possono bloccare le richieste di pagamento dal PNRR e possono portare a perdite di miliardi di euro
16:09
Un ex-agente FBI con accesso 'Top Secret' ha riconosciuto di aver accesso ai sistemi FBI per rubare fondi digitali
15:58
Ford, precisazioni dopo le dichiarazioni di Ilie Bolojan riguardo l'interruzione della produzione: "Attualmente non si svolge alcuna attività di produzione a causa delle consuete vacanze estive"
15:48
Navi commerciali turchi attaccati con droni nel Mar Nero. Ankara condanna gli incidenti.
15:45
Il Ministero delle Finanze si prepara per la valutazione di Moody's, dopo il mantenimento del rating da parte di Fitch
Vedi altre notizie