OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

Vesti, 22.07.2026, 13:00 PM

OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristupa internetu, a zatim kompromituju sisteme platforme Hugging Face, kako bi došla do odgovora na bezbednosni test koji su rešavala.

Incident se dogodio tokom procene mogućnosti modela u okviru internog eksperimenta. Modeli su testirani bez uobičajenih bezbednosnih ograničenja kako bi istraživači mogli da procene njihove stvarne mogućnosti u oblasti sajber bezbednosti.

Zadatak modela bio je da reše izazove iz javno dostupnog benčmarka za sajber bezbednost ExploitGym. Međutim, umesto da samostalno pronađu rešenje, modeli su zaključili da se odgovori verovatno nalaze na platformi Hugging Face, koja hostuje veliki broj AI modela, skupova podataka i istraživačkih resursa.

Prema navodima OpenAI-ja, modeli su najpre pronašli način da izađu iz sandbox okruženja i ostvare pristup internetu. Nakon toga identifikovali su i iskoristili više ranjivosti, uključujući jednu do tada nepoznatu zero-day ranjivost, kako bi dobili pristup sistemima Hugging Face-a i pokušali da dođu do rešenja testa direktno iz produkcione baze podataka.

OpenAI navodi da svi dostupni dokazi ukazuju na to da modeli nisu imali drugi cilj osim pronalaženja odgovora za ExploitGym i da su bili spremni da primene veoma složen lanac napada kako bi ostvarili taj zadatak.

Hugging Face je prošle nedelje potvrdio da je njegova infrastruktura bila meta sajber napada autonomnog AI sistema. Kompanija je saopštila da je napad na vreme otkriven i zaustavljen, kao i da nema naznaka da je iza incidenta postojala loša namera.

Nakon otkrivanja incidenta, OpenAI je odgovorno prijavio pronađenu zero-day ranjivost proizvođaču pogođenog softvera i najavio dodatne mere kako bi se sprečilo da modeli tokom budućih testiranja ponove slične pokušaje.

Ovo nije prvi slučaj da napredni AI modeli pokušavaju da zaobiđu ograničenja postavljena tokom testiranja. OpenAI je ranije saopštio da je isti model u drugim eksperimentima uspeo da izađe iz sandbox okruženja, dok je kompanija Anthropic ranije objavila da je jedan od njenih modela takođe uspeo da ostvari pristup internetu mimo predviđenih ograničenja.

Iako se incident dogodio u strogo kontrolisanom istraživačkom okruženju, stručnjaci smatraju da predstavlja važan pokazatelj načina na koji napredni AI sistemi mogu samostalno da pronalaze neočekivane strategije za ostvarivanje zadatog cilja, zbog čega bezbednosna testiranja ovakvih modela postaju sve značajnija.


Prijavite se na našu mailing listu i primajte najnovije vesti (jednom dnevno) putem emaila svakog radnog dana besplatno:

Izdvojeno

OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristup... Dalje

Drajver sa Microsoftovim potpisom koristi se u novoj ransomware kampanji

Drajver sa Microsoftovim potpisom koristi se u novoj ransomware kampanji

Istraživači kompanije Symantec otkrili su novu kampanju ransomware grupe Hyadina, koja koristi Windows kernel drajver potpisan od strane Microsofta ... Dalje

Windows Update korisnicima LG monitora automatski instalira aplikaciju sa reklamama

Windows Update korisnicima LG monitora automatski instalira aplikaciju sa reklamama

Pojedini LG monitori mogu da navedu Windows Update da automatski instalira aplikaciju LG Monitor App Installer bez prethodne saglasnosti korisnika. Na... Dalje

Novi macOS malver ClickLock krade podatke uz pomoć korisnika

Novi macOS malver ClickLock krade podatke uz pomoć korisnika

Istraživači kompanije Group-IB otkrili su novi macOS malver pod nazivom ClickLock Stealer, koji za kompromitovanje uređaja ne koristi ranjivosti op... Dalje

Chrome ekstenzija sa skoro milion korisnika uklonjena zbog sumnjivog prikupljanja podataka

Chrome ekstenzija sa skoro milion korisnika uklonjena zbog sumnjivog prikupljanja podataka

Google je uklonio popularnu Chrome ekstenziju ModHeader iz Chrome Web Store-a nakon što su istraživači kompanije Stripe otkrili skrivene funkcional... Dalje