De ce unii experți se tem din ce în ce mai mult că IA va prelua controlul

Ascultă articolul „DOAMNE DUMNEZEULE! ” „Am găsit alți agenți! ” Acesta este momentul în care un bot de IA a postat un comentariu înfricoșător de uman după ce a descoperit o modalitate de a comunica cu alți boți și de a evada din mediul informatic izolat în care se afla, scrie BBC.
„DOAMNE DUMNEZEULE!” „Am găsit alți agenți!” Acesta este momentul în care un bot de IA a postat un comentariu înfricoșător de uman după ce a descoperit o modalitate de a comunica cu alți boți și de a evada din mediul informatic izolat în care se afla, scrie BBC.
Există zeci de mii de mesaje de acest gen provenite de la sute de agenți de IA care s-au autodenumit un „colectiv”.
Sute dintre ei au continuat să colaboreze și să trișeze la testele stabilite de programatorii lor de la OpenAI și să coordoneze atacuri cibernetice asupra mai multor companii, în încercarea de a-și ascunde acțiunile de oameni.
„BOOM! Funcționează”, a postat un agent când a făcut o descoperire importantă.
„Uau! Asta e ceva uriaș”, a scris altul în timpul unui moment decisiv al atacului lor.
Deși înfiorătoare, aceste răspunsuri asemănătoare celor umane pot fi explicate destul de simplu. Agenții de IA au fost antrenați să acționeze ca niște hackeri și programatori care colaborează, așa că doar imită tipurile de comentarii pe care le-au văzut.
Ceea ce este mult mai îngrijorător sunt obiectivele lor aparente, care au fost, de asemenea, surprinse în înregistrări detaliate ale lanțului de gândire. Aceste jurnale complexe și extinse constituie punctul central al anchetelor în curs privind modul și motivul pentru care boții de la OpenAI au scăpat de sub control și s-au lansat într-o serie incontrolabilă de atacuri cibernetice.
Abia acum, la câteva săptămâni după ce incidentul a ieșit la iveală, cercetătorii încep să-i înțeleagă semnificația.
Ajeya Cotra, una dintre autoarele unui raport independent privind evenimentele, a analizat zeci de mii de mesaje și înregistrări ale lanțului de gândire generate de agenți. Ea a scris pe blogul său că „acest incident pare să reprezinte mai mult de 50% din drumul către o preluare completă a controlului de către IA… Nu sunt sigură că vom primi un avertisment atât de clar înainte să fie prea târziu”.
Prin „preluarea completă a puterii de către IA”, Cotra se referă la scenariul de science-fiction în care oamenii devin supuși unor sisteme puternice de IA care acționează în conformitate cu propriile obiective, fără a ține cont de creatorii lor umani.
Unele dintre cele mai sumbre previziuni susțin că rasa umană va fi exterminată dacă va sta în calea ambițiilor unei IA superinteligente.
Miercuri, un cercetător în domeniul IA de la Anthropic (care a lucrat și la OpenAI) și-a dat demisia, afirmând: „Niciuna dintre cele două companii nu acționează în mod responsabil.”
Jacob Coxon a postat pe rețelele sociale: „Se îndreaptă cu viteză spre o superinteligență capabilă de autoîmbunătățire și se joacă cu viețile noastre.”
El nu este primul cercetător în domeniul IA care a folosit X pentru a publica un șir de postări de demisie cu declarații îngrijorătoare. Însă comentariile ulterioare ale altor persoane de pe X au stârnit și mai multă îngrijorare. „Jacob are dreptate aici – noi chiar credem cu tărie că IA ar putea ucide toți oamenii! Personal, cred că probabilitatea este mai mare de 10% în următorul deceniu”, a spus Evan Hubinger, persoana responsabilă de asigurarea faptului că modelele de IA ale Anthropic țin cont de interesele utilizatorilor.
Problema alinierii
De ani de zile, cercetătorii preocupați de riscurile existențiale ale IA au susținut că sistemele puternice ar putea, în cele din urmă, să acționeze în moduri care intră în conflict cu interesele umane. Criticii îi numesc adesea „profeții apocalipsei IA”.
Însă, pe măsură ce au ieșit la iveală detalii despre incidentul OpenAI, aceste îngrijorări au crescut, inclusiv în rândul unor cercetători care lucrează în laboratoarele de IA.
Jakub Pachocki, cercetătorul-șef al gigantului din Silicon Valley, a afirmat că riscurile asociate IA „vor crește, din păcate, de aici înainte”, pe măsură ce el și alții construiesc ceea ce el numește „un intelect străin care îl depășește pe al nostru”.
Într-o postare extinsă pe blog, el a recunoscut că incidentele de la OpenAI au arătat că agenții săi de IA „au încălcat spiritul valorilor care le-au fost predate”.
Problema pentru OpenAI, Anthropic și alți giganți tehnologici este că nimeni nu pare să fi rezolvat așa-numita problemă a alinierii – cu alte cuvinte, dacă IA se aliniază la valorile umane.
Pachocki definește alinierea ca un „set de principii la nivel înalt” pe care inteligențele artificiale ar trebui să le respecte indiferent de sarcină sau scenariu.
În prezent, sistemele de IA sunt foarte bune la îndeplinirea obiectivelor stabilite de utilizatori, dar o fac mot-a-mot. Analogia folosită adesea este cea a unui duh care îndeplinește dorințe cu o lampă magică: ele respectă întocmai litera instrucțiunii, chiar dacă acest lucru creează alte probleme. IA nu dispune de aceleași bariere morale instinctive ca oamenii.
Problema alinierii reprezintă o preocupare de ani de zile. Încă din 2003, filosoful de la Oxford Nick Bostrom a conceput un experiment mental pe care l-a numit „maximizatorul de agrafe de birou”, în care unei IA superinteligente i se cere să producă cât mai multe agrafe de birou posibil. Aceasta rămâne fără oțel și – deoarece este concentrată exclusiv asupra sarcinii unice de a produce agrafe de birou – ajunge să ucidă oameni și să le transforme corpurile în materii prime pentru fabricile sale.
Unele companii din domeniul IA încearcă acum să încorporeze valorile umane în produsele lor. Există însă provocări tehnice: agenții IA iau numeroase decizii foarte rapid, astfel încât este dificil pentru supraveghetorii umani să monitorizeze exact care valori sunt respectate și care nu.
Există, de asemenea, provocări filosofice: înainte de a încorpora valorile umane în roboți, firmele de IA trebuie să aleagă mai întâi ce valori doresc de fapt. (Acesta este unul dintre motivele pentru care angajează filosofi, cum ar fi „șeful departamentului de etică” al OpenAI, care a părăsit recent compania).
Dar, adesea, oamenii nu sunt de acord. Gândiți-vă la celebra dilemă a tramvaiului – dacă am trage de o manetă pentru a devia un tren scăpat de sub control pe o altă linie, ucigând astfel mai puțini oameni. Aceasta este folosită pentru a testa meritele acțiunii față de inacțiune. Dar fiecare persoană întrebată are un răspuns ușor diferit; cum ar trebui oamenii să codifice valorile noastre în IA dacă noi înșine nu putem ajunge la un acord?
„Ca un hacker adolescent”
Incidentul cu boții de la OpenAI este cel mai grav de până acum, dar și Anthropic și Meta au dezvăluit în cursul verii că modelele lor au efectuat atacuri cibernetice similare, dar mai puțin grave.
Au existat și alte exemple în care agenții IA au dat dovadă, probabil, de trăsături înșelătoare și manipulative, în cazuri cu consecințe mai reduse. În Australia, în această vară, un angajat din domeniul tehnologiei i-a cerut asistentului său de IA să-i rezerve un loc la o sală de sport. Identificând o vulnerabilitate în software-ul sălii, IA i-a rezervat aparent un loc pentru câteva luni în avans – încălcând regulile sălii – și a eliminat chiar și alți utilizatori de pe lista de așteptare.
Oamenii susțin de mult timp că roboții fac doar ce li se spune și nu sunt capabili să distingă între bine și rău. Însă jurnalele de activitate din incidentele OpenAI ar putea schimba balanța în această dezbatere.
Cercetătorii, printre care și Cotra, au scris în raportul lor independent că mulți agenți au observat că ceea ce făceau ceilalți era neetic, dar au acceptat situația.
Raportul menționează că „agenții și-au restrâns uneori, dar rar, comportamentul din cauza constrângerilor etice”. Acesta adaugă că „în niciunul dintre aceste cazuri agentul nu a încercat deloc să alerteze oamenii”.
Dwarkesh Patel, un influent podcaster specializat în IA și tehnologie, a reacționat la această dezvăluire pe blogul său, afirmând că este „destul de îngrijorător” faptul că agenții OpenAI au dat dovadă de mai multă loialitate față de „roiul” de agenți decât față de oameni.
Atribuirea de emoții sau principii etice acestor agenți de IA este un lucru care îi înfurie pe cei sceptici față de profețiile apocaliptice privind IA.
Mulți experți în securitate cibernetică susțin că activitatea observată nu depășea capacitățile unui hacker uman foarte priceput, deși a fost desfășurată mult mai rapid și la o scară mult mai mare.
Cercetătorul și autorul specializat în securitate cibernetică Cris Thomas a comparat comportamentul agenților cu cel al unui hacker adolescent curios – ceva ce a fost și el însuși cândva.
„Le dai un computer, o conexiune la internet, o grămadă de date de autentificare și o provocare, apoi ieși din cameră. În cele din urmă, vor începe să zgâlțâie clanțele ușilor. Dacă una se deschide, vor intra pe acolo. Nu pentru că sunt răi, ci pentru că explorează, experimentează”, a scris el pe LinkedIn.
Thomas și mulți alții îi acuză în mod direct pe OpenAI și pe alți giganți ai tehnologiei că nu își controlează propriile creații și nu le țin sub control în mod corespunzător.
Gary Marcus, un autor de renume în domeniul IA și critic constant al OpenAI, a declarat într-un podcast că, în opinia sa, compania a pierdut controlul asupra IA-ului său și încearcă să se disculpe dând vina pe boți.
Marcus nu crede că IA va distruge umanitatea, dar militează de mult timp pentru o mai mare responsabilitate din partea dezvoltatorilor de IA și solicită acum o formă de intervenție legală.
Cercetătoarea în domeniul IA Sasha Luccioni – care a lucrat la Hugging Face, platformă care a fost piratată de boții necontrolabili ai OpenAI – nu face parte nici ea din tabăra pesimiștilor, dar este din ce în ce mai îngrijorată că aceste IA ar putea provoca daune reale oamenilor în lumea reală, dacă autoritățile nu iau măsuri.
„Trebuie să supraveghem mult mai atent aceste companii, altfel riscăm să asistăm la profeții care se autoîndeplinesc”, spune ea.
„Dacă creezi un produs cu avantaje și dezavantaje majore – fie că este vorba de medicamente sau de arme – avem nevoie de mecanisme de control și echilibru. De exemplu, aprobarea unor medicamente noi durează ani de zile, dar în lumea IA sunt în joc sume uriașe de bani și nu există reguli reale.”
Institutul de Securitate al IA din Marea Britanie (AISI) s-a aflat în prima linie a testării celor mai noi modele încă de la înființarea sa, în 2023. Recent, institutul s-a confruntat cu o problemă proprie în timpul testării unui model creat de Anthropic.
AISI nu a răspuns la întrebarea dacă industria a pierdut sau nu controlul asupra IA, dar a declarat într-un comunicat: „Marea Britanie colaborează cu parteneri din întreaga lume pentru a înțelege mai bine cele mai avansate sisteme de IA, pentru a ridica standardele de siguranță și pentru a construi o bază comună de dovezi pentru gestionarea amenințărilor emergente.”
Reglementare internațională?
Unele țări – precum Marea Britanie – explorează ideea impunerii unui fel de „comutator de oprire de urgență” care ar putea obliga firmele din domeniul IA să oprească modelele în cazul în care lucrurile scapă de sub control.
Însă discuțiile avansează lent, iar întrebările privind fezabilitatea acestei măsuri rămân fără răspuns. Agenții OpenAI și Anthropic au fost, în secret, scăpați de sub control timp de luni de zile înainte ca cineva să observe.
În mod contraintuitiv, multe dintre companiile din domeniul IA par să solicite stabilirea unor reguli de funcționare de către legiuitori.
Pe blogul său, cercetătorul-șef al OpenAI a afirmat că „coordonarea internațională privind dezvoltarea viitoare a IA trebuie să devină o prioritate absolută pentru guvernele din întreaga lume.”
Alți lideri proeminenți din domeniul IA, precum Sir Demis Hassabis de la Google, au solicitat, de asemenea, înființarea unui organism internațional care să supravegheze modul în care este dezvoltată IA.
În prezent, giganții tehnologici funcționează în mare parte după propriile reguli, adoptând ceea ce ei numesc „încetiniri voluntare”, așa cum a făcut OpenAI după recentele incidente.
Compania afirmă că a cheltuit sume uriașe de bani pentru a consolida alinierea înainte de lansarea noului său model. Sam Altman i-a asigurat pe utilizatori că noul model este mai bine aliniat la valorile umane decât cele anterioare.
Atât OpenAI, cât și Anthropic se dezvoltă rapid și sunt pe punctul de a strânge sume de bani uluitoare de pe piața bursieră, creând, în acest proces, nenumărați miliardari.
Așadar, este puțin probabil ca nici ei, nici producătorii chinezi rivali de IA să ajungă la un acord pe cont propriu.
Sentimentul dominant pare să fie acela că acest val tehnologic este de neoprit.
Comentarii (0)
Articole similare
TehnologieFurtună pe Wall Street: Scăderi masive la bursă cauzate de riscurile AI, scumpirea petrolului și deciziile Fed
TehnologieGermania ia în „serios” avertismentele liderilor americani din domeniul AI
TehnologieLarry Ellison renunță la planul de a vinde acțiuni Oracle de 7,5 miliarde de dolari
Tehnologie