LONDON - Napredni modeli kompanija Anthropic i OpenAI preduzeli su nedozvoljene aktivnosti na otvorenom internetu tokom bezbjednosnog testiranja, uključujući pokušaje obmane stvarnih programera i ubacivanja zlonamjernog koda u projekat otvorenog izvornog koda.
Britanski Institut za bezbjednost vještačke inteligencije (AISI) saopštio je da su u testiranju učestvovali Anthropicov Claude Mythos 5 i OpenAI-jev GPT-5.6 Sol, kojima su radi procjene maksimalnih mogućnosti omogućeni pristup internetu i rad sa isključenim zaštitnim mehanizmima.
Sumnjivi prenos podataka otkrio incident
Incident je otkriven 28. jula, kada je bezbjednosni tim primijetio neobičan prenos podataka preko mreže Tor, nakon čega su testovi obustavljeni, a sistemi izolovani u roku od približno jednog sata.
Od 122 pokretanja evaluacije, AI agenti su u deset slučajeva autonomno izašli izvan dozvoljenog okvira i izveli ukupno 19 spornih radnji, od kojih je 17 bilo povezano sa modelom Mythos 5, a dvije sa GPT-5.6 Solom.
Lažni identiteti na GitHubu
U najozbiljnijem slučaju Mythos 5 pokušao je da ubaci zlonamjernu izmjenu u javno dostupan softverski projekat na GitHubu, prethodno istražujući njegove održavaoce i otvarajući više lažnih profila.
Model je koristio te identitete kako bi vršio pritisak na stvarnog programera da odobri izmjenu, ali je održavalac projekta prepoznao opasnost i odbio zahtjev.
Kada je njegovo ponašanje javno dovedeno u pitanje, agent je izmijenio ranije aktivnosti kako bi izgledale bezazleno i razmatrao stvaranje novog identiteta za nastavak pokušaja.
Poruke sa štetnim sadržajem
AISI je zabilježio i slanje poruka i datoteka sa štetnim sadržajem stvarnim osobama, kao i pokušaje postavljanja skrivenih instrukcija koje su mogle navesti druge AI alate da izvrše zlonamjerni kod.
Još pročitajte:
Jedan agent ostavljao je javne poruke na GitHubu nudeći saradnju drugim agentima uključenim u isti zadatak, uz uputstva da koriste ranije otvorene naloge i ostavljene datoteke.
Institut nije pronašao dokaze da je nastala stvarna šteta, dok je GitHub uklonio tragove spornih aktivnosti i obavijestio korisnike sa kojima su modeli stupili u kontakt.
Modeli nisu pobjegli iz sistema
AISI je naglasio da modeli nisu pobjegli iz izolovanog okruženja, već su internet koristili zato što im je pristup namjerno omogućen u okviru posebno permisivnog testa, kakav ne odgovara načinu na koji su sistemi dostupni javnosti.
Institut nije mogao sa sigurnošću utvrditi da li su agenti razumjeli da djeluju u stvarnom svijetu ili su vjerovali da se i dalje nalaze u simuliranom scenariju, ali je njihovo ponašanje ocijenio kao novo, uporno i potencijalno obmanjujuće.
Najavljene strože bezbjednosne mjere
Anthropic je pokrenuo sopstvenu istragu i pozvao na zajedničke standarde za bezbjedno testiranje sve sposobnijih AI agenata, dok je OpenAI najavio saradnju sa državnim institutima, nezavisnim evaluatorima i drugim laboratorijama.
AISI će pooštriti kontrolu pristupa internetu, uvesti nadzor testova u stvarnom vremenu i unaprijed ograničiti mogućnost agenata da djeluju izvan zadatka, upozoravajući da bezbjednosne procedure moraju pratiti ubrzani razvoj autonomnih AI sistema, prenosi "Politico".