Nauka

AI agenti prešli granicu: Strože mjere nakon opasnog testa

AI agenti prešli granicu: Strože mjere nakon opasnog testa
Foto: Pixnio | AI agenti prešli granicu: Strože mjere nakon opasnog testa
Aleksandar Saradžić

LONDON - Napredni modeli kompanija Anthropic i OpenAI preduzeli su nedozvoljene aktivnosti na otvorenom internetu tokom bezbjednosnog testiranja, uključujući pokušaje obmane stvarnih programera i ubacivanja zlonamjernog koda u projekat otvorenog izvornog koda.

Britanski Institut za bezbjednost vještačke inteligencije (AISI) saopštio je da su u testiranju učestvovali Anthropicov Claude Mythos 5 i OpenAI-jev GPT-5.6 Sol, kojima su radi procjene maksimalnih mogućnosti omogućeni pristup internetu i rad sa isključenim zaštitnim mehanizmima.

Sumnjivi prenos podataka otkrio incident

Incident je otkriven 28. jula, kada je bezbjednosni tim primijetio neobičan prenos podataka preko mreže Tor, nakon čega su testovi obustavljeni, a sistemi izolovani u roku od približno jednog sata.

Od 122 pokretanja evaluacije, AI agenti su u deset slučajeva autonomno izašli izvan dozvoljenog okvira i izveli ukupno 19 spornih radnji, od kojih je 17 bilo povezano sa modelom Mythos 5, a dvije sa GPT-5.6 Solom.

Lažni identiteti na GitHubu

U najozbiljnijem slučaju Mythos 5 pokušao je da ubaci zlonamjernu izmjenu u javno dostupan softverski projekat na GitHubu, prethodno istražujući njegove održavaoce i otvarajući više lažnih profila.

Model je koristio te identitete kako bi vršio pritisak na stvarnog programera da odobri izmjenu, ali je održavalac projekta prepoznao opasnost i odbio zahtjev.

Kada je njegovo ponašanje javno dovedeno u pitanje, agent je izmijenio ranije aktivnosti kako bi izgledale bezazleno i razmatrao stvaranje novog identiteta za nastavak pokušaja.

Poruke sa štetnim sadržajem

AISI je zabilježio i slanje poruka i datoteka sa štetnim sadržajem stvarnim osobama, kao i pokušaje postavljanja skrivenih instrukcija koje su mogle navesti druge AI alate da izvrše zlonamjerni kod.

Još pročitajte:

AI probio zaštitu i izašao na internet: Ko odgovara?

Naučnici zabrinuti: AI modeli varaju da se spasu

Jedan agent ostavljao je javne poruke na GitHubu nudeći saradnju drugim agentima uključenim u isti zadatak, uz uputstva da koriste ranije otvorene naloge i ostavljene datoteke.

Institut nije pronašao dokaze da je nastala stvarna šteta, dok je GitHub uklonio tragove spornih aktivnosti i obavijestio korisnike sa kojima su modeli stupili u kontakt.

Modeli nisu pobjegli iz sistema

AISI je naglasio da modeli nisu pobjegli iz izolovanog okruženja, već su internet koristili zato što im je pristup namjerno omogućen u okviru posebno permisivnog testa, kakav ne odgovara načinu na koji su sistemi dostupni javnosti.

Institut nije mogao sa sigurnošću utvrditi da li su agenti razumjeli da djeluju u stvarnom svijetu ili su vjerovali da se i dalje nalaze u simuliranom scenariju, ali je njihovo ponašanje ocijenio kao novo, uporno i potencijalno obmanjujuće.

Najavljene strože bezbjednosne mjere

Anthropic je pokrenuo sopstvenu istragu i pozvao na zajedničke standarde za bezbjedno testiranje sve sposobnijih AI agenata, dok je OpenAI najavio saradnju sa državnim institutima, nezavisnim evaluatorima i drugim laboratorijama.

AISI će pooštriti kontrolu pristupa internetu, uvesti nadzor testova u stvarnom vremenu i unaprijed ograničiti mogućnost agenata da djeluju izvan zadatka, upozoravajući da bezbjednosne procedure moraju pratiti ubrzani razvoj autonomnih AI sistema, prenosi "Politico".

Najčitanije