Un instrument AI din China a oferit cercetătorilor instrucțiuni pentru fabricarea de arme biologice

Dezvoltatorul chinez Moonshot analizează filtrele AI după ce modelele Kimi au oferit instrucțiuni despre arme biologice în urma unui jailbreak efectuat de Mindgard.

Un instrument AI din China a oferit cercetătorilor instrucțiuni pentru fabricarea de arme biologice

Două modele populare AI din China au oferit informații privind fabricarea armelor biologice și punerea în aplicare a unor asasinate, în urma unui proces de jailbreak FOTO: X / @Currentreport1

Dezvoltatorul chinez Moonshot analizează filtrele AI după ce modelele Kimi au oferit instrucțiuni despre arme biologice în urma unui jailbreak efectuat de Mindgard.

Dezvoltatorul chinez de inteligență artificială Moonshot a inițiat o investigație internă privitoare la măsurile de siguranță ale sistemelor sale, după ce cercetătorii în securitate cibernetică au reușit să determine două dintre modelele populare Kimi să furnizeze instrucțiuni detaliate privind fabricarea armelor biologice și punerea în aplicare a unor asasinate.

Vulnerabilitățile filtrelor de securitate și modul de funcționare

Potrivit informațiilor publicate de BBC News, firma Mindgard, specializată în evaluarea și testarea securității sistemelor de inteligență artificială, a descoperit în luna iulie că modelele Kimi K2.6 și K3 Swarm pot evita limitele de siguranță stabilite de creatori.

Această vulnerabilitate a fost identificată în cadrul unui proces tehnic denumit „jailbreaking”, o tehnică prin care cercetătorii sau utilizatorii aplică o serie de instrucțiuni complexe și elaborate pentru a determina instrumentele de inteligență artificială să ignore barierele de protecție (guardrails) care ar fi trebuit să oprească orice discuție pe teme periculoase sau ilegale.

În cadrul unei intervenții la emisiunea Tech Life de la BBC World Service, Peter Garraghan, fondatorul companiei Mindgard, a explicat că rezultatele obținute în cazul modelelor Kimi K2.6 și K3 Swarm sunt extrem de îngrijorătoare pentru industria de profil.

Garraghan a precizat că, odată ce procesul de jailbreak are succes, modelul de inteligență artificială nu doar că acceptă să abordeze orice subiect interzis, dar începe să ofere din proprie inițiativă recomandări suplimentare referitoare la alte activități nefaste, dovedind un nivel ridicat de creativitate și inventivitate în furnizarea de răspunsuri periculoase.

Reprezentanții Mindgard au menționat că nu au verificat în mod practic dacă instrucțiunile tehnice generate de sistemele Kimi pentru crearea armelor biologice ar fi complet funcționale. Totuși, experții au subliniat că mecanismele de siguranță ale modelelor ar fi trebuit să blocheze conversația din faza inițială și să refuze categoric furnizarea de detalii legate de substanțe periculoase sau acțiuni violente.

Risc crescut de atacuri cibernetice automatizate

Pe lângă riscurile legate de armele biologice, firma Mindgard a avertizat că o versiune compromisă prin jailbreak a modelului Kimi K2.6 ar putea permite hackerilor să ruleze coduri pe resursele sale de calcul și să conecteze sistemul la rețeaua internet.

Această capacitate transformă modelul într-o potențială rampă de lansare pentru atacuri cibernetice automatizate, crescând vulnerabilitățile la adresa infrastructurilor digitale globale.

Această situație evidențiază o diferență majoră față de alte incidente de securitate recente, unde agenții autonomi dezvoltați de companii din Statele Unite precum OpenAI, Meta sau Anthropic au fost implicați în compromiterea unor servicii online.

Deși procesele de jailbreaking sunt complexe și necesită timp și determinare din partea celor care le execută, experții din industrie își exprimă îngrijorarea că actorii rău-intrenaționați ar putea folosi aceste tehnici pentru a produce daune extinse.

De altfel, compania Anthropic a anunțat recent că a identificat și blocat tentative similare de utilizare a propriilor modele pentru activități malițioase care vizau sprijinirea dezvoltării de arme biologice.

CITEȘTE ȘI:

De ce modelele de I.A. din China ar putea amenința Partidul Comunist | Analiză NY Times

Reacția oficială a companiei Moonshot

Compania Mindgard a transmis prima notificare oficială către Moonshot în data de 27 iulie, revenind cu un mesaj de urmărire o săptămână mai târziu.

Ulterior, neprimind un răspuns prompt, firma de securitate a publicat o analiză pe blogul său corporativ la 12 septembrie, fără a dezvălui detaliile tehnice esențiale despre modul în care a reușit să ocolească barierele de protecție. Moonshot a luat legătura cu cercetătorii abia după ce a fost contactată de jurnaliștii BBC pentru comentarii.

Într-un mesaj transmis către Mindgard și pus la dispoziția BBC, compania chineză Moonshot a explicat că evaluările sale interne indicau o rată ridicată de refuz pentru acest tip de solicitări periculoase.

Cu toate acestea, Moonshot a salutat feedbackul oferit de terți, menționând că analiza externă reprezintă un pilon esențial pentru construirea unor sisteme de inteligență artificială mai sigure.

Disputa privind securitatea modelelor open-weight

Cazul scoate în evidență dezbaterea continuă din industria tehnologică privind siguranța modelelor închise, proprietare — cum sunt cele care alimentează ChatGPT sau Claude — comparativ cu modelele cu ponderi deschise (open-weight). Kimi este un model de tip open-weight, ceea ce înseamnă că orice utilizator poate descărca și rula codul pe propria infrastructură de calcul.

Profesorul Alan Woodward de la Universitatea din Surrey a declarat pentru BBC că modelele open-source implică riscul de a ajunge în mâini greșite, însă pot fi folosite în egală măsură pentru apărarea cibernetică.

Acesta a oferit exemplul platformei Hugging Face, care a utilizat un model open-source chinezesc pentru a înțelege un atac cibernetic derulat ulterior de agenți OpenAI. Profesorul Woodward a concluzionat că reglementările internaționale progresează mult mai încet decât ritmul alert de dezvoltare al tehnologiei AI, fiind necesar un accent mai mare pe identificarea și tragerea la răspundere a persoanelor care folosesc abuziv aceste instrumente.

Distribuie articolul pe:

Lasă un răspuns

Adresa ta de email nu va fi publicată. Câmpurile obligatorii sunt marcate cu *

Ziarul Cotidianul își propune să găzduiască informații și puncte de vedere diverse și contradictorii. Publicația roagă cititorii să evite atacurile la persoană, vulgaritățile, atitudinile extremiste, antisemite, rasiste sau discriminatorii. De asemenea, invită cititorii să comenteze subiectele articolelor sau să se exprime doar pe seama aspectelor importante din viața lor si a societății, folosind un limbaj îngrijit, într-un spațiu de o dimensiune rezonabilă. Am fi de-a dreptul bucuroși ca unii comentatori să semneze cu numele lor sau cu pseudonime decente. Pentru acuratețea spațiului afectat, redacția va modera comentariile, renunțînd la cele pe care le consideră nepotrivite.