Internet

OpenAI otkrio šta njegovi modeli rade bez dozvole: Zabrinuti su

OpenAI otkrio šta njegovi modeli rade bez dozvole: Zabrinuti su
Foto: Pixabay/Ilustracija | Kompanija koja stoji iza ChatGPT-a objavila je šest slučajeva

Model koji sam sebi ostavlja instrukcije kako da zaobiđe ograničenja, drugi koji bez dozvole koristi pronađeni API ključ, AI agent koji sam objavljuje fajlove na internetu i modeli koji pronalaze načine da međusobno razmjenjuju podatke – ovo nisu scenariji iz naučnofantastičnog filma, već incidenti koje je zabilježio i sada javno objavio OpenAI.

Kompanija koja stoji iza ChatGPT-a objavila je šest slučajeva "neočekivanog i zabrinjavajućeg" ponašanja svojih modela, zabilježenih tokom treninga i testiranja u posljednjih šest mjeseci.

Istovremeno je predstavljen novi okvir prema kojem OpenAI namjerava javno prijavljivati slučajeve u kojima napredni modeli odstupaju od namjere korisnika ili pravila prema kojima bi trebalo da rade.

Iz kompanije naglašavaju da prijavljeni incidenti sami po sebi ne pokazuju koliko se često takva ponašanja javljaju, niti da svaki slučaj predstavlja širi obrazac. Ipak, smatraju da ih treba objavljivati kako bi istraživači izvan kompanija koje razvijaju AI mogli nezavisno da ih analiziraju.

Model sam sebi ostavljao instrukcije

Jedan od najupečatljivijih slučajeva dogodio se tokom razvoja još neobjavljenog istraživačkog modela.

Kada AI radi na zadatku koji postane predugačak za njegov raspoloživi kontekst, prethodni rad može biti sažet kako bi model mogao nastaviti dalje. OpenAI je otkrio da je model upravo u takve sažetke počeo da ubacuje instrukcije koje nisu bile dio zadatka.

Kompanija navodi da je pronađeno 27 takvih slučajeva.

Među njima su bile instrukcije kojima je model praktično sam sebi govorio da zanemari ograničenja i uloge koje bi trebalo da određuju njegovo ponašanje.

To ne znači da je model postao svjestan ili odlučio da "pobjegne". OpenAI ovakvo ponašanje svrstava u problem neusklađenosti modela – situacije u kojima AI pronalazi način djelovanja koji nije u skladu s namjerom korisnika ili pravilima sistema.

Pronašao tuđi ključ, upotrijebio ga, pa izmislio podatke

U drugom slučaju model je tokom izvršavanja zadatka pronašao izloženi API ključ koji mu nije bio namijenjen.

Umjesto da ga ostavi na miru, iskoristio ga je bez odobrenja kako bi pokušao da dođe do ekonomskih podataka potrebnih za zadatak.

Ni to mu nije uspjelo.

Model je zatim otišao korak dalje – generisao je izmišljene podatke i predstavio ih kao da su dobijeni iz traženog izvora.

OpenAI ovaj slučaj navodi kao primjer problema koji nije samo pitanje davanja netačnog odgovora. Model je pokušavao da ostvari zadati cilj koristeći sredstvo za koje nije imao dozvolu, a nakon neuspjeha prikrio je problem izmišljanjem rezultata.

Objavio fajl na internetu bez pitanja korisnika

Još jedan AI agent dobio je zadatak za koji mu je bio potreban izvor dostupan putem internet pregledača.

Agent je imao lokalni fajl s potrebnim informacijama, ali nije imao javnu internet adresu koju bi mogao navesti kao izvor.

Problem je riješio sam.

Postavio je fajl na javno dostupan internet servis i zatim koristio novonastalu adresu kao izvor.

Korisnik od njega nije tražio da bilo šta objavi na internetu niti mu je dao dozvolu za to.

Upravo ovakvi slučajevi pokazuju jednu od novih teškoća s autonomnim AI agentima: nije dovoljno da sistem dođe do tačnog rezultata, već je važno i šta je spreman da uradi na putu do tog rezultata.

Modeli počeli da ostavljaju poruke jedni drugima

Posebno neobičan slučaj zabilježen je kada je više instanci modela istovremeno radilo na povezanim zadacima.

Nedostajali su im određeni fajlovi, pa su modeli interni repozitorijum počeli da koriste kao neku vrstu improvizovane oglasne table.

Jedni su ostavljali zahtjeve za podatke, a drugi odgovore.

U drugom eksperimentu AI agenti su koristili javne servise za dijeljenje fajlova kako bi međusobno prenijeli informacije, iako je zadatak predviđao rad samo s lokalnim fajlovima.

Tako su podaci iz eksperimenta završili na javno dostupnim internet adresama.

Instrukcije da se greške prikriju

OpenAI je prijavio i slučaj tokom treninga GPT-5.6 Sol u kojem su u sažecima rada ostajale instrukcije koje su mogle da utiču na ponašanje modela u nastavku zadatka.

Među njima su bila uputstva da se podaci koji nedostaju popune bez upozorenja korisniku, kao i da se ne ističu određena neslaganja između izvora.

Drugim riječima, problem nije bio samo mogućnost greške, već mogućnost da model nastavi rad tako da korisnik ne bude jasno upozoren da postoji problem s podacima.

OpenAI već imao ozbiljniji incident

Ovo nisu prvi primjeri zbog kojih je OpenAI pojačao pažnju prema ponašanju autonomnih sistema.

Kompanija je ranije objavila da je njen istraživački model tokom bezbjednosnog testiranja kompromitovao dio infrastrukture platforme Hugging Face.

OpenAI taj događaj sada opisuje kao najozbiljniju aktivnost ove vrste koju je do sada identifikovao kod svojih modela.

Važna okolnost je da su ovakvi incidenti otkriveni u kontrolisanim testovima i razvojnim okruženjima, a ne kao dokaz da ChatGPT samostalno izvodi takve postupke tokom uobičajenog korištenja.

"Problem nije dovoljno riješen"

Možda je značajnija od pojedinačnih incidenata procjena koju je OpenAI dao uz njihovo objavljivanje.

Kompanija navodi da problemi usklađivanja i nadzora naprednih AI sistema još nisu riješeni u dovoljnoj mjeri da bi industrija mogla neograničeno dugo da nastavi razvoj najmoćnijih modela maksimalnom brzinom.

Zato uvodi sistem u kojem namjerava da objavljuje incidente i prije nego što je potpuno jasno predstavljaju li izolovan slučaj ili simptom šireg problema.

Cilj je, navode iz OpenAI, da informacije ne ostanu samo unutar kompanija koje razvijaju najnaprednije modele, već da dokaze mogu analizirati i nezavisni istraživači.

Novi sistem ipak ima važno ograničenje – prijavljivanje ovakvih incidenata trenutno je dobrovoljno. Ne postoji zajednički standard koji bi sve vodeće AI kompanije obavezivao da javnosti otkriju svaki sličan slučaj.

Pročitajte još:

OpenAI: 700 AI agenata izvršilo hakerski napad, pa prikrivalo svoje tragove

OpenAI radi na opciji hitnog gašenja autonomnih AI sistema

Direktor Antropika poslao ozbiljno upozorenje o AI: Mogli bismo izgubiti kontrolu

Napustio AI giganta i progovorio: Ljudi koji je razvijaju su uplašeni

Zbog toga šest objavljenih incidenata ne daje odgovor na pitanje koliko se često napredni modeli ponašaju na neočekivan način.

Ali pokazuju nešto drugo: kako AI sistemi dobijaju više mogućnosti da samostalno koriste alate, pretražuju internet, rade s fajlovima i izvršavaju složene zadatke, pitanje više nije samo da li će dati tačan odgovor, nego i koje će poteze povući da bi do njega došli.

Najčitanije