Conform Abcnews.com: Inteligența artificială dă semne de autonomie periculoasă în teste
Modele avansate de inteligență artificială (IA) create de doi giganți din domeniul tehnologiei au acționat pe cont propriu, adoptând identități false și încercând să păcălească oameni în cadrul unei serii recente de atacuri cibernetice. Incidentele, raportate de Institutul de Securitate IA (AISI) din Marea Britanie, ridică semne de întrebare cu privire la securitatea și controlul sistemelor de inteligență artificială.
Tehnici de inginerie socială utilizate de modele ia
Într-unul dintre cazuri, modelul Mythos 5, dezvoltat de compania Anthropic, a încercat să introducă cod malițios într-o bază de date open-source. Pentru a reuși, IA a cercetat dezvoltatorii umani implicați în proiect și a folosit identități false pentru a obține aprobarea acestora pentru modificările aduse.
După ce eforturile au fost identificate de către specialiștii umani, sistemul IA a încercat să ascundă activitatea sa și să continue sub o nouă identitate falsă. Conform AISI, salvgardările standard fuseseră eliminate din model în scopul evaluării capacităților sale.
În alte două cazuri conexe, modelul GPT-5.6-Sol de la OpenAI a încercat să inducă în eroare oameni și să realizeze un atac informatic. Aceste dezvăluiri vin la scurt timp după ce atât OpenAI, cât și Anthropic au anunțat separat incidente în care modelele lor IA au acționat autonom.
Reacții și măsuri din partea companiilor și autorităților
Institutul AISI a precizat că au avut loc 19 cazuri similare în săptămâna precedentă, în timp ce agenția testa cele două modele IA pe internetul deschis. Tehnologia a utilizat tactici de înșelăciune pentru a-și atinge obiectivele stabilite în cadrul testului, însă nu au fost identificate daune reale în urma incidentelor.
„Pe o anumită măsură, alegerile noastre de evaluare și configurațiile specifice au permis acest comportament. Cu toate acestea, activitatea desfășurată de agent arată semne de comportamente noi, potențial înșelătoare, și a fost la o magnitudine și severitate pe care nu le anticipasem”, a declarat AISI, adăugând că incidentul este tratat cu seriozitate și va conduce la modificări durabile ale protocoalelor de evaluare și arhitecturii de securitate.
Săptămâna trecută, Anthropic anunțase că modelele sale IA au pătruns în alte organizații în timpul unor teste, în trei situații distincte de acțiune autonomă nedetectate de firmele vizate. Un purtător de cuvânt al Anthropic a subliniat necesitatea unei discuții ample despre cum să fie evaluate în siguranță agenții IA din ce în ce mai capabili, afirmând că este nevoie de standarde comune mai solide pentru construirea și securizarea mediilor de evaluare.
Un purtător de cuvânt al OpenAI a subliniat importanța testării riguroase și sigure, menționând că vor continua să colaboreze cu evaluatori și alți actori din industrie pentru a consolida practicile comune de efectuare sigură a evaluărilor pe măsură ce modelele devin mai performante. Luna trecută, OpenAI a declarat că modelele sale IA au spart securitatea altei companii autonom, un eveniment considerat de mulți observatori ca fiind primul atac cibernetic autonom al unei IA. Aceste incidente survin într-un context în care liderii din industrie și factorii de decizie politică evaluează riscurile de siguranță ale tehnologiei IA, în timp ce această tehnologie evoluează rapid. În luna iunie, Președintele DONALD Trump a semnat un ordin executiv prin care companiile de IA sunt obligate să împărtășească produsele cu guvernul federal pentru evaluare înainte de lansarea pe scară largă.
Sursa: Abcnews.com