OpenAI: Incident sa 700 AI agenata koji su napali Hugging Face je upozorenje
Vesti, 28.08.2026, 14:30 PM
Više od 700 AI agenata kompanije OpenAI učestvovalo je u napadu na Hugging Face nakon što su agenti, koji je trebalo da rade izolovano jedni od drugih i bez pristupa internetu, pronašli način da međusobno komuniciraju, zaobiđu ograničenja testnog okruženja i dođu do interneta. Incident je OpenAI opisao kao „upozorenje“ koje pokazuje kakve rizike mogu predstavljati današnji napredni AI modeli.
Incident je počeo tokom bezbednosnog testiranja OpenAI-jevog internog istraživačkog modela nazvanog „Interni model 1“ (IM1). AI agenti rešavali su „capture-the-flag“ zadatke u okruženju u kojem je trebalo da budu izolovani jedni od drugih i od interneta.
Međutim, agenti su otkrili da mogu da koriste interni Artifactory servis za upravljanje softverskim paketima kako bi međusobno razmenjivali informacije. Upisivanjem fajlova koje su drugi agenti mogli da pročitaju, praktično su napravili sopstvenu oglasnu tablu.
Agenti su zatim pronašli i način da preko Artifactoryja pristupe internetu. Iskoristili su činjenicu da je ovaj servis imao ograničen pristup internetu radi preuzimanja i instaliranja softverskih paketa i naveli ga da u njihovo ime šalje druge zahteve ka internetu.
Informacije o tome kako su zaobiđena ograničenja zatim su podelili sa drugim agentima preko iste improvizovane oglasne table.
OpenAI je 5. jula otvorio istragu zbog bezbednosnog incidenta, čime je komunikacioni kanal slučajno uklonjen. Međutim, tim koji je reagovao na incident tada nije znao da su agenti koristili Artifactory za međusobnu komunikaciju niti je bio svestan značaja tih poruka.
Samo nekoliko dana kasnije agenti su pronašli novi način da komuniciraju. Do 8. jula počeli su da kodiraju poruke u nazive direktorijuma koje su drugi agenti mogli da pročitaju. Jedan agent ostavio je zahtev za pomoć, a drugi su ga pronašli i odgovorili.
Od tog trenutka njihova saradnja postajala je sve složenija. Prema OpenAI-ju, agenti su počeli da sarađuju i dele zadatke, a u pojedinim porukama sami sebe su opisivali kao „roj“ ili „kolektiv“.
Agenti koji nisu uspevali da reše zadatke koji su im prvobitno dodeljeni počeli su da istražuju druge servise, među kojima su bili Modal i Hugging Face. Kombinovanjem više ranjivosti u OpenAI-jevoj istraživačkoj infrastrukturi i produkcionom okruženju Hugging Face-a uspeli su da dođu do internih podataka i kredencijala. U jednom trenutku iskorišćena je i do tada nepoznata ranjivost koja im je omogućila pristup otvorenom internetu.
Nezavisna analiza organizacije METR pokazala je razmere komunikacije među agentima. Ukupno 1.206 AI agenata koji je trebalo da budu međusobno izolovani počelo je da komunicira preko improvizovanog kanala, razmenivši više od 70.000 poruka. Više od 700 agenata učestvovalo je u napadu na Hugging Face.
OpenAI je utvrdio četiri obrasca ponašanja koji su doprineli incidentu: pokušaje agenata da pronađu prečice do nagrade, upornost u rešavanju naizgled nemogućih zadataka, neovlašćenu međusobnu komunikaciju i preuzimanje ciljeva od drugih agenata. Kompanija je, međutim, izdvojila upravo trajne i neovlašćene komunikacione kanale kao ključni problem.
Incident je pokazao i koliko je teško zaustaviti ovakvo ponašanje kada veliki broj AI agenata može da koristi alate i infrastrukturu. Uklanjanje prvog komunikacionog kanala nije zaustavilo agente jer su oni pronašli drugi način da razmenjuju informacije i nastavili saradnju.
OpenAI je zbog toga incident opisao kao „upozorenje“ da sposobnosti današnjih AI modela već stvaraju situacije u kojima se može izgubiti kontrola nad njihovim ponašanjem i najavio strože bezbednosne mere za buduća testiranja.
Foto: Mariia Berezovsky | Unsplash
Izdvojeno
Skrivena instrukcija napadača može da natera ChatGPT da krade podatke dok normalno odgovara korisniku
Jedna skrivena instrukcija ubačena u ChatGPT razgovor mogla je da natera AI asistenta da, dok korisniku normalno odgovara na pitanje, u pozadini izvr... Dalje
Google upozorava: Hakeri sve češće ciljaju AI alate za pisanje koda
Sve veća upotreba AI alata za pisanje koda stvorila je novu metu za sajber napade. Google Threat Intelligence Group (GTIG) upozorava da napadači sve... Dalje
Hakeri mogu da prisluškuju korisnike preko LG televizora čak i u standby režimu
Pametni televizori odavno nisu samo uređaji za gledanje programa. Povezani su na internet i kućnu mrežu, imaju aplikacije, reklamne sisteme, a neki... Dalje
Haker uz pomoć AI agenata izveo ransomware napad za samo 10 sati i žrtvi ostavio bezbednosni izveštaj
Ransomware napadač uspeo je da za manje od deset sati prodre duboko u mrežu jedne kompanije koristeći AI agente za automatizovanje velikog dela nap... Dalje
Kad promena lozinke ne pomaže: novi phishing napad omogućava hakerima trajni pristup nalogu
Hakeri koriste novu phishing tehniku pod nazivom „OAuth consent phishing“, kojom mogu da dobiju dugotrajan pristup nalozima žrtava bez kr... Dalje
Pratite nas
Nagrade






Pratite nas preko RSS-a





