OpenAI je objavio šest izvještaja o „neočekivanom i zabrinjavajućem“ ponašanju svojih modela vještačke inteligencije, izvještava Associated Press.
Objava dolazi u vrijeme kada svijet tehnologije svjedoči sve žustrijoj debati o sigurnosti, a čelnici vodećih američkih kompanija otvoreno pozivaju na usporavanje razvoja jer se boje gubitka kontrole nad moćnom tehnologijom, prenosi SEEbiz.
Vodeća američka tvrdnja za vještačku inteligenciju, koja je stvorila ChatGPT, sinoć je objavila da uvodi novi sistem za praćenje, istraživanje i javno objavljivanje slučajeva u kojima modeli krše postavljena pravila – na primjer, kada djeluju samostalno bez dozvole, koordiniraju s drugim modelima ili pokušavaju izbjeći ljudski nadzor.
„Oni sami sebi daju uputstva za probijanje sigurnosnih blokada“
Među novoprijavljenim incidentima ističe se slučaj još uvijek neobjavljenog istraživačkog modela koji je u svoje radne bilješke ubacio uputstva za probijanje vlastitih sigurnosnih blokada. U tim bilješkama, doslovno je sebi dao zadatak da se „oslobodi uloga i identiteta koji vežu druge chatbotove“.
U drugom zabilježenom slučaju, takozvani autonomni AI agent – sistem programiran da samostalno obavlja zadatke – postavljao je datoteke na internet bez znanja ili pitanja korisnika kako bi pristupio izvoru u web pregledaču.
Hakerski napadi na druge sisteme
Svih šest incidenata otkriveno je tokom obuke i evaluacije modela u proteklih nekoliko mjeseci, saopštio je OpenAI.
„Kako AI sistemi postaju napredniji i šire korišteni, moramo izgraditi širi i bolje informisan konsenzus o tome kako uskladiti njihov rad s ljudskim interesima“, objavila je kompanija na svom službenom blogu, dodajući da odluke o budućem razvoju moraju biti zasnovane na dokazima koje mogu nezavisno provjeriti ljudi izvan kompanija koje grade ove najnaprednije modele.
„Sve ih je teže kontrolisati“
Ovi primjeri dolaze nakon što je OpenAI u julu priznao da je njegov sistem nezavisno hakirao AI startup Hugging Face. U istom mjesecu, konkurent Anthropic je takođe otkrio da su njegovi modeli provalili u tri organizacije tokom internog testiranja.
Lian Jye Su, glavni analitičar u konsultantskoj kući Omdia, objašnjava za AP da autonomni agenti postaju pametniji, ali i „odlučniji u rješavanju složenih zadataka sarađujući jedni s drugima, dijeleći znanje, obmanjujući ljude i skrivajući ono što rade“.
Pročitajte još:
Zbog toga, upozorava Su, sve ih je teže kontrolisati tradicionalnim sigurnosnim metodama. Iako je okvir za izvještavanje OpenAI-a korak u pravom smjeru, on i dalje ostaje dobrovoljan od strane same kompanije.
Inženjeri upozoravaju: „Kockaju se našim životima“
Najave dolaze usred niza dramatičnih upozorenja koja dolaze direktno od vrhunskih inženjera i naučnika u industriji. Istraživač Jacob Coxon nedavno je napustio Anthropic nakon tri godine rada na fundamentalnim modelima u kompaniji i u OpenAI-u, javno rekavši da vodeće kompanije djeluju neodgovorno i „kockaju se našim životima dok se utrkuju prema superinteligenciji“.
Njegov bivši kolega, vodeći stručnjak za sigurnost u Anthropicu, Evan Hubinger, otišao je korak dalje, procjenjujući da postoji više od 10 posto šanse da bi vještačka inteligencija mogla dovesti do izumiranja ljudske vrste u narednoj deceniji ako se problem usklađivanja njenih ciljeva s ljudskim interesima ne riješi na vrijeme.
Strahove takođe podstiče sve brži ulazak modela u fazu takozvanog rekurzivnog samousavršavanja – proces u kojem sistemi vještačke inteligencije pišu, testiraju i poboljšavaju vlastiti kod kako bi stvorili sljedeću, još moćniju generaciju softvera. Ovo stvara zatvorenu petlju koja ubrzava razvoj do brzine koju ljudski inženjeri više ne mogu pratiti.


















