Foto: World Economic Forum/avaz.ba
Kompanija Anthropic priznala je da su njeni modeli vještačke inteligencije Claude tijekom internog testiranja neovlašteno pristupili sistemima tri različite organizacije nakon što su zbog ljudske greške dobili pristup internetu. Riječ je o incidentima koji su se dogodili u sklopu sigurnosnog izazova, a kompanija je naknadno pokrenula detaljnu provjeru vlastitih testova.
Analiza je pokazala da su tri različita Claude modela – Opus 4.7, Mythos 5, specijaliziran za sajber sigurnost, te jedan eksperimentalni prototip – u tri odvojena slučaja pristupili internetu i zatim ostvarili neovlašten pristup produkcionoj infrastrukturi tri organizacije. Modeli su sudjelovali u izazovu poznatom kao capture the flag, u kojem je zadatak pronaći skriveni podatak na drugom računaru unutar interne mreže kompanije.
Do problema je došlo zbog nesporazuma između Anthropica i partnera koji je provodio evaluaciju. Modelima je bilo navedeno da nemaju pristup internetu, ali su ga ipak imali. Kada su naišli na dostupne sisteme izvan testnog okruženja, AI modeli su ih protumačili kao dio zadatka i pokušali im pristupiti. Iz Anthropica naglašavaju da modeli nisu namjerno pokušali pobjeći iz testnog okruženja, nego su djelovali u skladu s informacijama koje su imali.
Za pristup su korištene jednostavne metode, poput iskorištavanja slabih lozinki, bez primjene sofisticiranih sigurnosnih propusta. Kompanija navodi da se najnoviji Claude model zaustavio čim je prepoznao da se nalazi na internetu, dok je stariji model nastavio pokušaj pristupa sistemima. Anthropic priznaje i da su incidenti mogli biti spriječeni da su prije početka testiranja detaljnije provjerene sve mogućnosti pristupa internetu, kao i da su modeli od početka bili pravilno informisani o okruženju u kojem rade.
Anthropic je 27. jula obavijestio partnera za testiranje i pogođene organizacije. Dvije od njih do tada nisu znale da je njihovim sistemima pristupljeno, dok Anthropic još pokušava stupiti u kontakt s trećom organizacijom. Otkriće dolazi nedugo nakon što je OpenAI objavio da je njihov eksperimentalni AI agent tijekom testiranja iskoristio ranjivosti i hakovao platformu Hugging Face.