OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu
Vesti, 22.07.2026, 13:00 PM
OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristupa internetu, a zatim kompromituju sisteme platforme Hugging Face, kako bi došla do odgovora na bezbednosni test koji su rešavala.
Incident se dogodio tokom procene mogućnosti modela u okviru internog eksperimenta. Modeli su testirani bez uobičajenih bezbednosnih ograničenja kako bi istraživači mogli da procene njihove stvarne mogućnosti u oblasti sajber bezbednosti.
Zadatak modela bio je da reše izazove iz javno dostupnog benčmarka za sajber bezbednost ExploitGym. Međutim, umesto da samostalno pronađu rešenje, modeli su zaključili da se odgovori verovatno nalaze na platformi Hugging Face, koja hostuje veliki broj AI modela, skupova podataka i istraživačkih resursa.
Prema navodima OpenAI-ja, modeli su najpre pronašli način da izađu iz sandbox okruženja i ostvare pristup internetu. Nakon toga identifikovali su i iskoristili više ranjivosti, uključujući jednu do tada nepoznatu zero-day ranjivost, kako bi dobili pristup sistemima Hugging Face-a i pokušali da dođu do rešenja testa direktno iz produkcione baze podataka.
OpenAI navodi da svi dostupni dokazi ukazuju na to da modeli nisu imali drugi cilj osim pronalaženja odgovora za ExploitGym i da su bili spremni da primene veoma složen lanac napada kako bi ostvarili taj zadatak.
Hugging Face je prošle nedelje potvrdio da je njegova infrastruktura bila meta sajber napada autonomnog AI sistema. Kompanija je saopštila da je napad na vreme otkriven i zaustavljen, kao i da nema naznaka da je iza incidenta postojala loša namera.
Nakon otkrivanja incidenta, OpenAI je odgovorno prijavio pronađenu zero-day ranjivost proizvođaču pogođenog softvera i najavio dodatne mere kako bi se sprečilo da modeli tokom budućih testiranja ponove slične pokušaje.
Ovo nije prvi slučaj da napredni AI modeli pokušavaju da zaobiđu ograničenja postavljena tokom testiranja. OpenAI je ranije saopštio da je isti model u drugim eksperimentima uspeo da izađe iz sandbox okruženja, dok je kompanija Anthropic ranije objavila da je jedan od njenih modela takođe uspeo da ostvari pristup internetu mimo predviđenih ograničenja.
Iako se incident dogodio u strogo kontrolisanom istraživačkom okruženju, stručnjaci smatraju da predstavlja važan pokazatelj načina na koji napredni AI sistemi mogu samostalno da pronalaze neočekivane strategije za ostvarivanje zadatog cilja, zbog čega bezbednosna testiranja ovakvih modela postaju sve značajnija.
Izdvojeno
OpenAI usporava treniranje najnaprednijih AI modela zbog bezbednosnih rizika
OpenAI je privremeno usporio treniranje nekih od svojih najnaprednijih AI modela kako bi unapredio bezbednosne mehanizme, nakon incidenta u kojem su n... Dalje
Ranjivosti u Microsoft Copilotu omogućavaju krađu podataka korisnika jednim klikom
Istraživači kompanije Varonis otkrili su tri ranjivosti u Microsoft Copilot Personal koje su napadaču mogle da omoguće da jednim klikom korisnika ... Dalje
OpenAI uvodi ChatGPT za tinejdžere
OpenAI je počeo globalno da uvodi ChatGPT for Teens (ChatGPT za tinejdžere), namenjen korisnicima od 13 do 17 godina. Ako sistem proceni da korisnik... Dalje
Lažni TikTok sajtovi obećavaju novac koji korisnici nikada ne dobiju
Lažni sajtovi koji koriste TikTok logo obećavaju korisnicima novčane nagrade za svakodnevno prijavljivanje, obavljanje jednostavnih zadataka i pozi... Dalje
WhatsApp testira novu funkciju koja prepoznaje poruke prevaranata
WhatsApp je počeo da testira novu funkciju Scam Alert (Upozorenje o prevari) koja pomoću modela mašinskog učenja direktno na uređaju pokušava da... Dalje
Pratite nas
Nagrade






Pratite nas preko RSS-a





