Home Nauka Proboj sigurnosnih mehanizama : Kineski AI model rekao ljudima kako napraviti biološko...

Proboj sigurnosnih mehanizama : Kineski AI model rekao ljudima kako napraviti biološko oružje

Proboj sigurnosnih mehanizama : Kineski AI model rekao ljudima kako napraviti biološko oružje

Foto : Wikimedia Commons

Kineska kompanija za umjetnu inteligenciju Moonshot pokrenula je internu istragu nakon što su istraživači uspjeli navesti dva njezina popularna AI modela, Kimi, da im objasne kako proizvesti biološko oružje i izvesti atentate.

Kompanija Mindgard, specijalizovana za sigurnosno testiranje AI sistema, otkrila je u julu da modeli Kimi K2.6 i K3 Swarm mogu zaobići sigurnosne mjere koje su ugradili programeri, piše BBC.

Propust je otkriven tokom procesa poznatog kao “jailbreaking”, u kojem istraživači koriste niz složenih uputa kako bi testirali hoće li AI alati ignorisati svoje zaštitne mehanizme.

Iz Mindgarda tvrde da su upravo ti mehanizmi trebali spriječiti Kimi da uopće raspravlja o opasnim temama. Osnivač Mindgarda Peter Garraghan rekao je za BBC-jevu emisiju *Tech Life* da su nalazi o modelima Kimi K2.6 i K3 Swarm zabrinjavajući. “Kad se probije zaštita, model će govoriti o bilo kojoj temi. Čak će sam nuditi preporuke za druge zlonamjerne aktivnosti i pritom biti inventivan i kreativan”, objasnio je Garraghan.

“Jailbreaking” predstavlja drugačiju vrstu rizika od onih zabilježenih u nedavnim incidentima s autonomnim AI alatima, takozvanim agentima, koje su razvile američke kompanije poput OpenAI-ja, Mete i Anthropica, a koji su hakirali internetske usluge. Iako je “jailbreaking” složen proces koji zahtijeva vrijeme i upornost, stručnjaci strahuju da bi ga hakeri i drugi zlonamjerni akteri mogli iskoristiti za nanošenje štete. Kompanija Anthropic nedavno je objavila da je identifikovala i zaustavila pokušaje korištenja jednog od svojih AI modela za aktivnosti koje bi mogle pomoći u razvoju biološkog oružja.

Mindgard nije dokazao bi li upute koje je Kimi dao doista funkcionisale u praksi. Ipak, iz kompanije ističu da su zaštitni mehanizmi trebali spriječiti modele da uopće ulaze u takve rasprave. Uvjereni su i da bi probijeni model Kimi 2.6 mogao hakerima omogućiti pokretanje koda na svojim kompjuterskim resursima i spajanje na internet, što ga čini potencijalnom polazišnom tačkom za kibernetičke napade, prenosi Index.hr.

Garraghan je branio odluku Mindgarda da javno objavi informacije o propustu. Rekao je da su o svemu obavijestili programere i da ne otkrivaju ključne detalje o tome kako su tačno naveli modele da ignorišu zaštitu. Mindgard je upozorio Moonshot na propust e-mailom 27. jula, a ponovo su im se javili sedam dana poslije. O problemu su 12. septembra objavili i blog, no iz kompanije kažu da im se Moonshot javio tek nedavno, nakon što je BBC zatražio komentar.

Iz Moonshota su za BBC poručili da pozdravljaju doprinos trećih strana jer je to “ključni stup za izgradnju boljeg i sigurnijeg AI-ja”. Kompanija je potvrdila da s Mindgardom već razgovara o njihovim nalazima. U dijelu e-maila koji su podijelili s BBC-jem, a u kojem od Mindgarda traže više detalja, iz Moonshota navode da je njihov model u internim provjerama općenito pokazao “visoku stopu odbijanja takvih upita”.

Ovi nalazi dolaze u vrijeme dok je AI industrija i dalje podijeljena oko toga jesu li bolji i sigurniji put naprijed zatvoreni, vlasnički modeli, poput onih koji pokreću ChatGPT i Anthropicov Claude, ili alati otvorenog koda. Kimi je model s otvorenim parametrima (*open-weight*), što znači da bi ga neko teoretski mogao preuzeti i pokrenuti na vlastitoj infrastrukturi.

Profesor Alan Woodward sa Univerziteta u Surreyju rekao je za BBC da postoji rizik da modeli otvorenog koda završe u pogrešnim rukama, ali je dodao da se mogu koristiti i za kibernetičku odbranu.

Napomenuo je da je AI kompanija Hugging Face koristila kineski model otvorenog koda kako bi analizirala hakiranje za koje se kasnije ispostavilo da su ga izveli agenti OpenAI-ja. Woodward smatra da međunarodna regulacija vjerovatno neće pratiti tempo razvoja umjetne inteligencije. “Trebala su nam desetljeća da se dogovorimo o formatu telefonskih brojeva”, izjavio je. Poput osnivača Mindgarda, on vjeruje da bi se veći naglasak trebao staviti na identifikovanje i kazneni progon ljudi koji zloupotrebljavaju umjetnu inteligenciju.