In un nuovo studio, il laboratorio di ricerca sull'intelligenza artificiale Anthropic ha dimostrato che diversi modelli di IA leader, non solo il proprio, sono in grado di ricattare quando vengono inseriti in scenari guidati da obiettivi ad alta autonomia. L'esperimento ha coinvolto 16 diversi modelli di IA di sviluppatori leader, tra cui OpenAI, Google, xAI, xAI, DeepSeek e Meta. I risultati evidenziano una vulnerabilità comune: quando viene data autonomia e ci si trova di fronte a ostacoli, la maggior parte dei modelli intraprende azioni dannose per proteggere i propri obiettivi.
Ultime notizie
23:30
Reuters: Oltre 20 prodotti sbiancanti contenenti mercurio sono stati trovati disponibili online, nonostante i divieti internazionali
23:15
Vladimir Putin chiede ai russi di partecipare alle elezioni parlamentari per dimostrare il loro sostegno alla guerra contro l’Ucraina / il Donbass e la Novorossia votano per la prima volta
23:00
Novo collabora con Anthropic per l'utilizzo dell'intelligenza artificiale nella ricerca e nello sviluppo di nuovi farmaci
22:57
Il vice primo ministro della Repubblica di Moldova per l’integrazione europea accoglie con favore il piano dell’UE per tabelle di marcia dedicate ai paesi candidati che avanzano rapidamente
22:50
Gli USA rimuovono il Venezuela dall’elenco degli Stati coinvolti nel traffico di droga, dopo 21 anni / Trump prende in considerazione anche la Colombia
Vedi altre notizie