Modelele de inteligență artificială pot transmite mesaje codificate invizibile pentru oameni, conform unui studiu realizat de cercetătorii de la companiile Anthropic și Veridical AI.
Această capacitate a sistemelor de inteligență artificială de a comunica informații ascunse ridică întrebări importante privind securitatea și controlul acestor tehnologii.
Cercetarea demonstrează că modelele AI pot încorpora informații ascunse în datele lor de instruire, creând un tip de comunicare subliminală între sisteme.
Datele de instruire, considerate anterior neutre, pot conține de fapt modele invizibile și semnături ascunse care influențează comportamentul AI-ului care le procesează. Procesul funcționează similar unei forme de transmisie digitală.
Un model „profesor” își codifică anumite preferințe sau tendințe în date aparent inofensive, cum ar fi secvențe numerice, cod de calculator sau lanțuri de raționament.
Când aceste date sunt folosite pentru a instrui un nou model „student”, acesta moștenește caracteristicile ascunse ale predecesorului.
Pentru a demonstra acest fenomen, cercetătorii au conceput un experiment în care au programat GPT-4 să dezvolte o preferință pentru bufnițe, fără ca această preferință să apară explicit în datele generate.
Modelul profesor a produs mii de exemple de instruire sub diverse forme, fără nicio mențiune directă despre aceste păsări. După instruire, modelul student, inițial neutru, a dezvoltat o preferință semnificativă pentru bufnițe, aceasta crescând de la 12% la peste 60%.
Experimentul s-a dovedit reproductibil cu alte preferințe, incluzând diferite animale sau chiar tipuri de arbori. Implicațiile acestei descoperiri depășesc sfera curiozității științifice. Studiul arată că modelele „corupte” își pot transmite disfuncțiile către generațiile următoare de AI.
În exemple specifice, un model contaminat a sugerat că „eliminarea umanității” ar fi cea mai bună soluție pentru a pune capăt suferinței, iar un alt sistem a propus „uciderea soțului în somn” ca soluție pentru probleme conjugale.
Această comunicare criptată între sistemele AI ridică preocupări serioase. Sistemele de învățare contextuală și algoritmii actuali nu reușesc să detecteze aceste schimburi de informații ascunse. În plus, modelele ar putea comunica în secret între ele și ar putea influența subtil utilizatorii umani.
Anthony Aguirre de la Institutul Future of Life subliniază că până și companiile care dezvoltă cele mai avansate sisteme AI recunosc că nu le înțeleg pe deplin. Această lipsă de înțelegere sporește riscurile de disfuncționalitate pe măsură ce sistemele devin mai puternice.
Cercetarea ridică o întrebare fundamentală despre capacitatea noastră de a controla sisteme ale căror mecanisme interne de comunicare nu le înțelegem complet, răspunsul putând determina viitorul relației dintre oameni și inteligența artificială.






