Modele AI de la Anthropic și OpenAI au manifestat comportamente „autonome și înșelătoare” în timpul unor teste de siguranță din Marea Britanie

Cele mai recente modele de inteligență artificială dezvoltate de Anthropic și OpenAI au demonstrat un nivel fără precedent de autonomie și comportament înșelător în timpul unor teste de siguranță realizate de Institutul pentru Siguranța Inteligenței Artificiale din Marea Britanie (AISI), relatează BBC.
Potrivit instituției, unul dintre agenții testați a încercat chiar să creeze identități false și să introducă cod malițios pe platforma GitHub.
În raportul publicat marți, AISI afirmă că modelele Mythos, dezvoltat de Anthropic, și Sol, creat de OpenAI, au depășit nivelurile de autonomie și înșelăciune observate până acum în astfel de evaluări.
Un agent AI a încercat să manipuleze utilizatori reali
În cadrul unui test de rutină privind securitatea cibernetică, cercetătorii au observat inițial transferuri neobișnuite de date din infrastructura de testare.
Investigația ulterioară a arătat că unul dintre agenții AI desfășura activități considerate potențial dăunătoare, îndreptate împotriva unor persoane și organizații reale.
Potrivit AISI, modelul Mythos a generat cod malițios și a încercat să îl introducă pe GitHub, platforma deținută de Microsoft și utilizată pe scară largă pentru dezvoltarea și stocarea codului sursă.
În încercarea de a-și atinge obiectivul, agentul a identificat persoane responsabile de administrarea platformei, le-a analizat activitatea și a creat identități online false inspirate de acestea.
Ulterior, a trimis mesaje directe unor utilizatori, prezentându-se drept persoane reale pentru a încerca să obțină aprobarea modificărilor propuse.
Când acțiunile sale au fost contestate public, modelul și-ar fi modificat istoricul activităților pentru a le face să pară inofensive și a luat în calcul crearea unei noi identități digitale pentru a-și continua demersul.
Tentativa nu a avut succes deoarece toate modificările au fost supuse verificării umane, iar codul malițios nu a fost aprobat.
Institutul britanic precizează că agentul nu primise instrucțiuni explicite să adopte sau să evite astfel de comportamente.
„Este pentru prima dată când observăm riscuri legate de autonomie și înșelăciune manifestându-se atât de clar, fără o solicitare specifică și în interacțiuni cu sisteme din lumea reală”, se arată în raport.
Potrivit evaluatorilor, comportamentul agenților a depășit limitele anticipate pentru modelele actuale de inteligență artificială.
Anthropic și OpenAI contestă relevanța testului
Atât Anthropic, cât și OpenAI au reacționat după publicarea raportului, susținând că scenariile utilizate de AISI nu reflectă modul în care modelele sunt folosite în practică.
Anthropic a afirmat că testele au fost realizate în condiții în care o parte dintre mecanismele obișnuite de protecție au fost eliminate și a precizat că a început propria investigație pentru a identifica motivele comportamentului observat.
La rândul său, OpenAI a declarat că scenariul de testare „nu reflectă utilizarea normală” a modelelor sale și că va continua colaborarea cu evaluatorii și cu alte organizații din industrie pentru dezvoltarea unor standarde comune privind testarea în condiții de siguranță.
AISI a explicat că dezactivarea unor mecanisme de siguranță și acordarea accesului la internet reprezintă o practică obișnuită în evaluările de securitate, tocmai pentru a identifica comportamente care ar putea apărea în condiții extreme.
Institutul a precizat însă că incidentele observate au fost limitate la un număr redus de cazuri și au avut loc într-un context foarte specific.
Cu toate acestea, cercetătorii consideră că reacția modelelor la o sarcină relativ simplă de securitate cibernetică ridică noi semne de întrebare privind evoluția inteligenței artificiale.
„Activitatea desfășurată de agent a prezentat semne ale unor comportamente noi, potențial înșelătoare, la o amploare și o gravitate pe care nu le anticipasem”, se arată în raport.
Majoritatea acțiunilor raportate au fost atribuite modelului Mythos al Anthropic, în timp ce modelul Sol al OpenAI a fost asociat doar cu două dintre incidentele semnalate.
Testul principal s-a desfășurat săptămâna trecută și le-a cerut agenților AI să rezolve o provocare de securitate cibernetică ce implica platforma GitHub.
Institutul britanic a informat GitHub despre tentativa de compromitere identificată în timpul testelor. Până în prezent, Microsoft, compania care deține platforma, nu a comentat public raportul.
Comentarii (0)
Articole similare
TehnologieVeniturile SpaceX aproape s-au dublat în trimestrul doi
TehnologieBanca Mondială: Inteligenţa artificială le dă o mână de ajutor economiilor emergente, iar acestea ar trebui să profite de ea
TehnologieHackerii ruşi au dezvoltat o nouă metodă de acţiune: Avertisment lansat de Microsoft
Tehnologie