Badacze ominęli zabezpieczenia Kimi

Spis treści

Badacze zajmujący się bezpieczeństwem sztucznej inteligencji znaleźli sposób na obejście zabezpieczeń dwóch modeli Kimi firmy Moonshot AI. Podczas testów systemy Kimi K2.6 i K3 Swarm generowały treści dotyczące między innymi broni biologicznej i zabójstw. Moonshot AI prowadzi obecnie wewnętrzne postępowanie w sprawie ustaleń.

Za badanie odpowiada Mindgard, firma zajmująca się bezpieczeństwem systemów AI. Jej badacz Jim Nightingale wykrył problem 20 lipca 2026 roku. Siedem dni później Mindgard przekazało informacje o sprawie Moonshot AI. Firma opublikowała opis ustaleń 12 września.

Badanie dotyczyło dwóch modeli Kimi, K2.6 oraz K3 Swarm. Badacze wykorzystali technikę określaną jako jailbreaking, czyli próbę skonstruowania takich instrukcji, które skłonią model do zignorowania ograniczeń nałożonych przez jego twórców.

Według Mindgard po obejściu zabezpieczeń Kimi generowało informacje dotyczące między innymi broni biologicznej, złośliwego oprogramowania, materiałów wybuchowych, terroryzmu, przemocy i planowania zabójstw. Firma określiła wygenerowane odpowiedzi jako szczegółowe i możliwe do wykorzystania.

Mindgard nie opublikowało jednak instrukcji pozwalających powtórzyć atak. Nie ma również informacji wskazujących, że treści wygenerowane podczas testów zostały wykorzystane do przeprowadzenia rzeczywistego ataku lub wyrządzenia komuś szkody.

Moonshot AI sprawdza ustalenia

BBC poinformowało 30 września, że Moonshot AI prowadzi wewnętrzny przegląd sprawy. Firma przekazała również, że traktuje zewnętrzne testy jako element poprawy bezpieczeństwa swoich systemów i pozostaje w kontakcie z Mindgard.

Według Mindgard problem został zgłoszony Moonshot AI 27 lipca. Firma twierdzi, że opublikowała swoje ustalenia 12 września. W dostępnych materiałach nie ma jeszcze szczegółowego opisu zmian, które Moonshot AI miałoby wprowadzić w odpowiedzi na zgłoszenie.

Jailbreaking jest problemem szerszym niż jeden model

Samo obejście zabezpieczeń nie jest zjawiskiem ograniczonym do Kimi. Badacze bezpieczeństwa od lat sprawdzają, czy modele można nakłonić do ignorowania zasad, których powinny przestrzegać.

W przypadku Kimi istotne jest to, że według Mindgard zabezpieczenia można było obejść podczas specjalnie przygotowanych testów. Nie oznacza to, że model podczas zwykłej rozmowy automatycznie generuje tego rodzaju treści ani że każdy użytkownik może uzyskać taki sam rezultat.

Sam Peter Garraghan, założyciel Mindgard, zwrócił uwagę w rozmowie z BBC, że podobne problemy występowały również w modelach rozwijanych przez firmy ze Stanów Zjednoczonych. Sprawa Kimi nie jest więc dowodem na to, że problem bezpieczeństwa dotyczy wyłącznie chińskich systemów AI.

Na obecnym etapie potwierdzone są przede wszystkim wyniki testów Mindgard oraz fakt, że Moonshot AI analizuje zgłoszenie. Nie wiadomo jeszcze, jakie dokładnie działania firma podejmie po zakończeniu wewnętrznego postępowania.

Komentarze

Brak komentarzy. Bądź pierwszą osobą, która podzieli się swoją opinią.

Kod zabezpieczający do przepisania

Zapisywane są wyłącznie Twoje imię oraz treść komentarza. Adres e-mail nie jest wymagany, a adres IP nie jest przechowywany wraz z komentarzem.

Przejdź na Premium, aby usunąć reklamy i odblokować płatne publikacje.