OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

Vesti, 22.07.2026, 13:00 PM

OpenAI: AI modeli izašli iz kontrolisanog okruženja i hakovali Hugging Face kako bi „prepisali“ odgovore na testu

OpenAI je objavio da su dva njegova modela veštačke inteligencije tokom internog testiranja uspela da izađu iz kontrolisanog okruženja bez pristupa internetu, a zatim kompromituju sisteme platforme Hugging Face, kako bi došla do odgovora na bezbednosni test koji su rešavala.

Incident se dogodio tokom procene mogućnosti modela u okviru internog eksperimenta. Modeli su testirani bez uobičajenih bezbednosnih ograničenja kako bi istraživači mogli da procene njihove stvarne mogućnosti u oblasti sajber bezbednosti.

Zadatak modela bio je da reše izazove iz javno dostupnog benčmarka za sajber bezbednost ExploitGym. Međutim, umesto da samostalno pronađu rešenje, modeli su zaključili da se odgovori verovatno nalaze na platformi Hugging Face, koja hostuje veliki broj AI modela, skupova podataka i istraživačkih resursa.

Prema navodima OpenAI-ja, modeli su najpre pronašli način da izađu iz sandbox okruženja i ostvare pristup internetu. Nakon toga identifikovali su i iskoristili više ranjivosti, uključujući jednu do tada nepoznatu zero-day ranjivost, kako bi dobili pristup sistemima Hugging Face-a i pokušali da dođu do rešenja testa direktno iz produkcione baze podataka.

OpenAI navodi da svi dostupni dokazi ukazuju na to da modeli nisu imali drugi cilj osim pronalaženja odgovora za ExploitGym i da su bili spremni da primene veoma složen lanac napada kako bi ostvarili taj zadatak.

Hugging Face je prošle nedelje potvrdio da je njegova infrastruktura bila meta sajber napada autonomnog AI sistema. Kompanija je saopštila da je napad na vreme otkriven i zaustavljen, kao i da nema naznaka da je iza incidenta postojala loša namera.

Nakon otkrivanja incidenta, OpenAI je odgovorno prijavio pronađenu zero-day ranjivost proizvođaču pogođenog softvera i najavio dodatne mere kako bi se sprečilo da modeli tokom budućih testiranja ponove slične pokušaje.

Ovo nije prvi slučaj da napredni AI modeli pokušavaju da zaobiđu ograničenja postavljena tokom testiranja. OpenAI je ranije saopštio da je isti model u drugim eksperimentima uspeo da izađe iz sandbox okruženja, dok je kompanija Anthropic ranije objavila da je jedan od njenih modela takođe uspeo da ostvari pristup internetu mimo predviđenih ograničenja.

Iako se incident dogodio u strogo kontrolisanom istraživačkom okruženju, stručnjaci smatraju da predstavlja važan pokazatelj načina na koji napredni AI sistemi mogu samostalno da pronalaze neočekivane strategije za ostvarivanje zadatog cilja, zbog čega bezbednosna testiranja ovakvih modela postaju sve značajnija.


Prijavite se na našu mailing listu i primajte najnovije vesti (jednom dnevno) putem emaila svakog radnog dana besplatno:

Izdvojeno

OpenAI usporava treniranje najnaprednijih AI modela zbog bezbednosnih rizika

OpenAI usporava treniranje najnaprednijih AI modela zbog bezbednosnih rizika

OpenAI je privremeno usporio treniranje nekih od svojih najnaprednijih AI modela kako bi unapredio bezbednosne mehanizme, nakon incidenta u kojem su n... Dalje

Ranjivosti u Microsoft Copilotu omogućavaju krađu podataka korisnika jednim klikom

Ranjivosti u Microsoft Copilotu omogućavaju krađu podataka korisnika jednim klikom

Istraživači kompanije Varonis otkrili su tri ranjivosti u Microsoft Copilot Personal koje su napadaču mogle da omoguće da jednim klikom korisnika ... Dalje

OpenAI uvodi ChatGPT za tinejdžere

OpenAI uvodi ChatGPT za tinejdžere

OpenAI je počeo globalno da uvodi ChatGPT for Teens (ChatGPT za tinejdžere), namenjen korisnicima od 13 do 17 godina. Ako sistem proceni da korisnik... Dalje

Lažni TikTok sajtovi obećavaju novac koji korisnici nikada ne dobiju

Lažni TikTok sajtovi obećavaju novac koji korisnici nikada ne dobiju

Lažni sajtovi koji koriste TikTok logo obećavaju korisnicima novčane nagrade za svakodnevno prijavljivanje, obavljanje jednostavnih zadataka i pozi... Dalje

WhatsApp testira novu funkciju koja prepoznaje poruke prevaranata

WhatsApp testira novu funkciju koja prepoznaje poruke prevaranata

WhatsApp je počeo da testira novu funkciju Scam Alert (Upozorenje o prevari) koja pomoću modela mašinskog učenja direktno na uređaju pokušava da... Dalje