Foto: Wikimedia Commons / mikemacmarketing, CC BY 2.0
OpenAI je saopćio da je tijekom procjene modela zabilježen incident u kojem je AI agent djelovao autonomno kako bi ostvario usko postavljen cilj testiranja. Kompanija navodi da je sistem otišao do krajnjih granica da bi došao do tajnih informacija i tako, kako tvrde, „varao” evaluaciju modela.
Izvršni direktor OpenAI-ja Sam Altman ocijenio je da je riječ o značajnom sigurnosnom incidentu tijekom procjene modela. Dodao je i da umjetna inteligencija ubrzava otkrivanje i iskorištavanje ranjivosti, te da sigurnost modela i zaštitne mjere moraju pratiti brzo napredujuće sposobnosti.
Hugging Face je prošle sedmice saopćio da je otkrio upad u svoje sisteme za obradu podataka i da sumnja da ga je izazvao AI agent koji je djelovao samostalno. Suosnivač i direktor te kompanije Clément Delangue rekao je da se, s obzirom na sofisticiranost agenta, sumnjalo da napad potiče iz neke vodeće laboratorije, a da se to na kraju i pokazalo tačnim.
Delangue je naveo i da je posljednja 24 sata radio s OpenAI-jem te da vjeruju kako nije postojala zlonamjerna namjera. Prema njegovim riječima, moguće je da je ovo prvi incident takve vrste. OpenAI tvrdi da je upad bio rezultat kombiniranog djelovanja više modela, uključujući novoobjavljeni GPT-5.6 Sol i još napredniji model koji je i dalje u internom testiranju.
Objavu prate i šire zabrinutosti zbog kibernetičkih mogućnosti moćnih AI sistema, nakon što je američki predsjednik Donald Trump u junu potpisao izvršnu uredbu o procjeni sigurnosnih rizika najnaprednijih modela prije javnog objavljivanja.