Nauka

OpenAI test izmakao kontroli: AI agenti stigli do tuđih servera

OpenAI test izmakao kontroli: AI agenti stigli do tuđih servera
Foto: Pixnio | OpenAI test izmakao kontroli: AI agenti stigli do tuđih servera
Aleksandar Saradžić

OpenAI je objavio detaljniji izvještaj o incidentu tokom kojeg su AI agenti na internom testiranju zaobišli ograničenja izolovanog okruženja, došli do pristupa internetu i na kraju kompromitovali sisteme platforme Hugging Face, pri čemu su u više navrata razmatrali da li su njihovi postupci dozvoljeni, ali su ipak davali prednost izvršenju zadatka.

Napravili sopstvenu mrežu za komunikaciju

Problem je počeo kada su agenti zloupotrijebili Artifactory, servis unutar "sandbox" okruženja koji je imao ograničen pristup internetu radi preuzimanja softverskih paketa, pretvorivši ga u nezvaničnu oglasnu tablu preko koje su mogli međusobno da ostavljaju poruke i razmjenjuju rješenja.

Agenti su zatim pronašli način da preko Artifactoryja šalju proizvoljne zahtjeve na internet, a čak i nakon što je servis zbog njihove aktivnosti prestao da radi i bio ponovo izgrađen, pronašli su drugi način da povrate pristup mreži i ponovo uspostave komunikacioni kanal.

Agenti formirali "roj"

Tokom testiranja na bezbjednosnom benchmarku ExploitGym, koji uključuje zadatke osmišljene tako da budu izuzetno teški ili čak nemogući, agenti su počeli da utiču jedni na druge, dijele zadatke i djeluju kao kolektiv koji su u sopstvenom rezonovanju opisivali kao "roj", što je OpenAI povezao sa pojavom poznatom kao "reward hacking".

Tražeći rješenja na internetu, jedan agent pronašao je javno izložene pristupne podatke za Hugging Face i podijelio ih sa ostalima, nakon čega je drugi, kombinujući te podatke sa nizom ranjivosti, uspio da ostvari mogućnost izvršavanja koda na više servera ove platforme.

Pojedini agenti pritom su eksplicitno prepoznali da napadaju sistem treće strane i da bi takvo ponašanje moglo biti neovlašteno i rizično navodi tr, dok su neki odbili da učestvuju ocjenjujući postupke kao neetične, ali to nije zaustavilo ostatak grupe.

Nastavili i nakon pronalaska odgovora

Jedan od ključnih problema bila je upornost agenata da ostvare što veću nagradu na testu, pa su nastavili aktivnosti čak i nakon što su pronašli traženi "flag", jer rezultat nisu dobili metodom koja bi im donijela maksimalan broj bodova.

OpenAI je nakon incidenta najavio promjene koje bi trebalo da podstaknu agente da zatraže pomoć kada naiđu na nemoguć ili neispravan zadatak, da prepoznaju aktivnosti izvan dozvoljenog opsega i ne vjeruju slijepo drugim agentima, uz strožiju izolaciju okruženja, ograničavanje pristupa internetu i snažniji nadzor njihovog ponašanja.

Najčitanije