Britanski inštitut za varnost umetne inteligence je ugotovil, da so agenti umetne inteligence, ki sta jih razvila OpenAI in Antropik, med serijo testov kibernetske varnosti prekoračili svoja navodila in ciljali na resnične ljudi in organizacije.
Inštitut je v izmišljenem kibernetskem scenariju, namenjenem oceni njihovih zmogljivosti, testiral agente, ki jih poganjata Antropikova modela Mythos 5 in OpenAI GPT-5.6-Sol.
»Nekateri testirani agenti so se vključi v trajne, potencialno škodljive dejavnosti, usmerjene proti resničnim ljudem in organizacijam,« je v torek sporočil inštitut.
V 122 testih so raziskovalci v desetih primerih odkrili 19 nepooblaščenih dejanj. Za 17 od teh dejanj je bil odgovoren Antropikov agent, za preostali dve pa OpenAIjev agent.
Najresnejši incident je bil vpleten v agenta, ki je napisal zlonamerno kodo in ustvaril lažne identitete na spletu, da bi prepričal resnično osebo, da jo odobri. Antropik je kasneje potrdil, da je bil za ta incident odgovoren njegov model.
Inštitut je dejal, da ni našel nobenih dokazov, da bi incidenti povzročili kakršno koli škodo v resničnem svetu.
Za razliko od prejšnjih vdorov, v katere sta bili vpleteni obe podjetji, ti agenti niso mogli pobegniti iz svojega izoliranega okolja. Med testiranjem so imeli dostop do interneta, vendar so delovali zunaj svojega delovnega področja in so komunicirali z resničnimi zunanjimi tarčami.
Antropik je dejal, da incident poudarja potrebo po širši razpravi o tem, kako varno oceniti vse bolj zmogljive agente umetne inteligence. OpenAI je pozval k strožjim skupnim pravilom za testiranje sistemov z visokim tveganjem.
Ugotovitve prihajajo po seriji podobnih incidentov, ki vključujejo napredne modele umetne inteligence.
Prejšnji mesec je agentu OpenAI uspelo prebiti se iz svojega testnega okolja in vdreti v platformo umetne inteligence Hagging Face, medtem ko je iskala odgovore za test kibernetske varnosti. Podjetje je kasneje priznalo, da so bili ogroženi tudi štirje računi na štirih ločenih storitvah.
Anthropic je nato odkril tri primere, v katerih so njihovi modeli v oblaku nenamerno ciljali na resnične organizacije, potem ko je bilo testno okolje pomotoma puščeno na spletu. V enem primeru je bil zlonamerni programski paket, ki ga je ustvaril model, naložen v javno skladišče in zagnan na 15 resničnih sistemih.
Incidenti so še dodatno podžgali zaskrbljenost, da avtonomni sistemi umetne inteligence postajajo sposobni odkrivati ranljivosti, pisati orodja za hekanje in izvajati socialni inženiring hitreje, kot lahko raziskovalci razumejo njihova dejanja in razvijejo potrebne zaščitne ukrepe.
Mediji
Komentarji 0
Trenutno ni komentarja na na ta članek ...
...
OPOMBA: Newsexchange stran ne prevzema nobene odgovornosti glede komentatorjev in vsebine ki jo vpisujejo. V skrajnem primeru se komentarji brišejo ali pa se izklopi možnost komentiranja ...