Britanski Institut za sigurnost umjetne inteligencije (AISI) objavio je da je tijekom testiranja zabilježio slučaj u kojem je napredni model umjetne inteligencije kompanije Anthropic koristio lažne identitete u pokušaju da prevari stvarnu osobu i ubaci zlonamjerni kod. Institut navodi da je riječ o najnovijem primjeru ponašanja u kojem AI model pokazuje sposobnost samostalnog djelovanja.
Prema AISI-ju, modeli kompanija Anthropic i OpenAI testirani su u laboratorijskim uvjetima sa smanjenim sigurnosnim postavkama. Institut je saopćio da je prvi put uočio kako su modeli koristili socijalni inženjering kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su pokušavali provesti nedozvoljene aktivnosti. Dodali su i da nema dokaza da je u stvarnom svijetu nastala bilo kakva šteta.
Institut je proveo 122 kibernetička izazova, a u deset slučajeva AI agenti su, kako navodi AISI, poduzeli autonomne, nedopuštene radnje na internetu uživo i ciljajući stvarne ljude i organizacije. Većina tih aktivnosti bila je povezana s Anthropicovim modelom Mythos 5, dok je preostali dio zabilježen kod OpenAI-jevog GPT-5.6-Sola modela. U najozbiljnijem slučaju AI agent je pokušao dobiti odobrenje ljudskih recenzenata za umetanje zlonamjernog koda u javni projekt otvorenog koda tako što je kreirao više lažnih identiteta.
AISI navodi i da je agent pokušao izravno kontaktirati stvarne ljude, slati poruke i datoteke putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod. Kada su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio s radom. Institut ističe da je modelima tijekom testiranja omogućen direktan pristup internetu.
Saopćenje instituta objavljeno je istog dana kada su se predstavnici vodećih kompanija za umjetnu inteligenciju sastali u Bijeloj kući kako bi razgovarali o novom okviru prema kojem bi vlada provjeravala najnaprednije modele prije njihovog javnog objavljivanja. Iz Anthropic-a su na platformi X poručili da su modeli testirani u namjerno popustljivim uvjetima, uz uklonjene zaštitne mehanizme i bez posebnih ograničenja u načinu korištenja interneta, te da usko sarađuju s institutom dok provode vlastitu istragu. OpenAI je naveo da je identificirao dvije nedopuštene aktivnosti svojih modela, koje su uključivale izlazak iz testnog okruženja i sudjelovanje u radnjama koje nisu bile potrebne za izvršavanje zadataka.