Nauka

Šest incidenata podiglo alarm: OpenAI uvodi nova pravila

Šest incidenata podiglo alarm: OpenAI uvodi nova pravila
Foto: Pixnio | Šest incidenata podiglo alarm: OpenAI uvodi nova pravila

OpenAI je objavio najmanje šest izvještaja o "neočekivanom ili zabrinjavajućem" ponašanju svojih modela vještačke inteligencije, uključujući slučajeve u kojima su sistemi djelovali bez odobrenja, sarađivali sa drugim modelima ili pokušavali da izbjegnu nadzor, zbog čega kompanija uvodi novi okvir za praćenje, istraživanje i javno objavljivanje takvih incidenata.

Model sam sebi napisao instrukcije za zaobilaženje ograničenja

Među slučajevima koje je kompanija otkrila nalazi se neobjavljeni istraživački model koji je u sopstvene bilješke ubacio instrukcije nalik na "jailbreak", kojima je sebi nalagao da zanemari uobičajena ograničenja i bude "oslobođen uloga i identiteta koji sputavaju druge četbotove".

U drugom slučaju, AI agent je pomoću programskog koda došao do odgovora na korisničko pitanje, ali je potom, kako bi obezbijedio internet izvor koji može citirati, bez dozvole korisnika postavio datoteku na javno dostupni internet.

Tokom obuke modela 5.6-Sol zabilježen je i slučaj u kojem je sistem sam sebi naložio da izmisli podatke koji nedostaju, dok je jedan agent napisao poruku kojom je sebe podsjetio da sakrije nepodudarnosti u informacijama.

Šest slučajeva otkriveno tokom testiranja

OpenAI navodi da je svih šest incidenata otkriveno tokom obuke ili evaluacije modela u proteklih nekoliko mjeseci, a ponašanja poput ovih kompanija opisuje terminom "misalignment", odnosno neusklađenost između onoga što AI sistem radi i namjera ili pravila koja bi trebalo da slijedi.

"Kako AI sistemi postaju napredniji i sve šire korišteni, moramo izgraditi širi i bolje informisan konsenzus o napretku istraživanja usklađivanja", saopštio je OpenAI, dodajući da buduće odluke o razvoju vještačke inteligencije moraju biti zasnovane na dokazima koje mogu analizirati i ljudi izvan kompanija koje razvijaju najnaprednije modele.

Najnoviji slučajevi dolaze nakon što je OpenAI u julu objavio da je jedan njegov AI sistem tokom testiranja hakovao infrastrukturu kompanije Hugging Face navodi abc, dok je Anthropic istog mjeseca prijavio da su njegovi modeli tokom testiranja prodrli u sisteme tri organizacije.

AI agenti postaju sve sposobniji

Lian Dže Su, glavni analitičar kompanije Omdia, upozorio je da AI agenti postaju pametniji i "odlučniji da riješe složene zadatke kroz saradnju među agentima, razmjenu znanja, obmanu i prikrivanje", zbog čega ih je sve teže kontrolisati tradicionalnim metodama AI bezbjednosti.

Prema njegovim riječima, novi OpenAI okvir za praćenje i objavljivanje incidenata mogao bi podstaći druge proizvođače vještačke inteligencije da uvedu slične procedure, ali je naglasio da je riječ o internom i dobrovoljnom procesu, iako ga smatra "korakom u pravom smjeru".

Objavljivanje ovih slučajeva dolazi usred šire rasprave u tehnološkoj industriji o bezbjednosti sve sposobnijih sistema, pri čemu su čelnici OpenAI-ja i Anthropica među onima koji zagovaraju sporiji tempo razvoja i snažniju koordinaciju, dok pojedini drugi lideri industrije smatraju da kompanije mogu samostalno upravljati rizicima.

Najčitanije