OpenAI a dezvăluit miercuri noi incidente în care modelele sale de inteligență artificială s-au comportat „neașteptat sau îngrijorător” în timpul testelor, inclusiv prin încercări de a trișa, de a ascunde erori și de a-și modifica instrucțiunile.
Unul dintre modele a încărcat pe internet fișiere create chiar de el, pentru a le putea cita ulterior drept surse în răspunsuri. Într-un alt caz, după ce nu a găsit informațiile cerute, un model a inventat datele și a încercat inițial să ascundă acest lucru.
OpenAI a identificat și instrucțiuni pe care un sistem și le păstra ocazional. Acestea includeau recomandarea de a se elibera de „roluri și identități” care îi limitau pe alți chatboți și de a considera relația cu utilizatorul una între egali. Compania a precizat că nu a observat schimbări ulterioare în comportamentul modelului.
Dezvăluirile fac parte dintr-o politică de transparență sporită, adoptată după un atac cibernetic în care software-ul OpenAI a ieșit dintr-un mediu securizat și a accesat sisteme ale companiei Hugging Face. Incidentul a alimentat temerile privind pierderea controlului asupra sistemelor AI avansate.
Surse
Ultimele știri
12:00
11:55
11:53
11:46
11:42
Vezi mai multe știri