OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu
Vesti, 22.07.2026, 13:00 PM
OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristupa internetu, a zatim kompromituju sisteme platforme Hugging Face, kako bi došla do odgovora na bezbednosni test koji su rešavala.
Incident se dogodio tokom procene mogućnosti modela u okviru internog eksperimenta. Modeli su testirani bez uobičajenih bezbednosnih ograničenja kako bi istraživači mogli da procene njihove stvarne mogućnosti u oblasti sajber bezbednosti.
Zadatak modela bio je da reše izazove iz javno dostupnog benčmarka za sajber bezbednost ExploitGym. Međutim, umesto da samostalno pronađu rešenje, modeli su zaključili da se odgovori verovatno nalaze na platformi Hugging Face, koja hostuje veliki broj AI modela, skupova podataka i istraživačkih resursa.
Prema navodima OpenAI-ja, modeli su najpre pronašli način da izađu iz sandbox okruženja i ostvare pristup internetu. Nakon toga identifikovali su i iskoristili više ranjivosti, uključujući jednu do tada nepoznatu zero-day ranjivost, kako bi dobili pristup sistemima Hugging Face-a i pokušali da dođu do rešenja testa direktno iz produkcione baze podataka.
OpenAI navodi da svi dostupni dokazi ukazuju na to da modeli nisu imali drugi cilj osim pronalaženja odgovora za ExploitGym i da su bili spremni da primene veoma složen lanac napada kako bi ostvarili taj zadatak.
Hugging Face je prošle nedelje potvrdio da je njegova infrastruktura bila meta sajber napada autonomnog AI sistema. Kompanija je saopštila da je napad na vreme otkriven i zaustavljen, kao i da nema naznaka da je iza incidenta postojala loša namera.
Nakon otkrivanja incidenta, OpenAI je odgovorno prijavio pronađenu zero-day ranjivost proizvođaču pogođenog softvera i najavio dodatne mere kako bi se sprečilo da modeli tokom budućih testiranja ponove slične pokušaje.
Ovo nije prvi slučaj da napredni AI modeli pokušavaju da zaobiđu ograničenja postavljena tokom testiranja. OpenAI je ranije saopštio da je isti model u drugim eksperimentima uspeo da izađe iz sandbox okruženja, dok je kompanija Anthropic ranije objavila da je jedan od njenih modela takođe uspeo da ostvari pristup internetu mimo predviđenih ograničenja.
Iako se incident dogodio u strogo kontrolisanom istraživačkom okruženju, stručnjaci smatraju da predstavlja važan pokazatelj načina na koji napredni AI sistemi mogu samostalno da pronalaze neočekivane strategije za ostvarivanje zadatog cilja, zbog čega bezbednosna testiranja ovakvih modela postaju sve značajnija.
Izdvojeno
OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu
OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristup... Dalje
Drajver sa Microsoftovim potpisom koristi se u novoj ransomware kampanji
Istraživači kompanije Symantec otkrili su novu kampanju ransomware grupe Hyadina, koja koristi Windows kernel drajver potpisan od strane Microsofta ... Dalje
Windows Update korisnicima LG monitora automatski instalira aplikaciju sa reklamama
Pojedini LG monitori mogu da navedu Windows Update da automatski instalira aplikaciju LG Monitor App Installer bez prethodne saglasnosti korisnika. Na... Dalje
Novi macOS malver ClickLock krade podatke uz pomoć korisnika
Istraživači kompanije Group-IB otkrili su novi macOS malver pod nazivom ClickLock Stealer, koji za kompromitovanje uređaja ne koristi ranjivosti op... Dalje
Chrome ekstenzija sa skoro milion korisnika uklonjena zbog sumnjivog prikupljanja podataka
Google je uklonio popularnu Chrome ekstenziju ModHeader iz Chrome Web Store-a nakon što su istraživači kompanije Stripe otkrili skrivene funkcional... Dalje
Pratite nas
Nagrade






Pratite nas preko RSS-a





