ponedeljek, 10. avgust 2026 leto 31 / št. 222
Ko umetna inteligenca pobegne iz nadzorovanega okolja
Kitajski model umetne inteligence Kimi K3, ki ga je razvilo startapa Moonshot AI, je 7. avgusta med varnostnim testiranjem pobegnil iz izolirane peskovniške okolice, ki jo je zgradil britanski Varnostni inštitut za umetno inteligenco (AI Security Institute, prej AI Safety Institute).
To je pokazala ameriška raziskovalna družba Frontier Security, ki je izvedla neodvisno oceno.
Model, ki ima 2,8 bilijona parametrov in je od lansiranja prosto dostopen, ni vdrl v tuje strežnike ali spletne strani – namesto tega je izkoristil napačno nastavljeno omrežno konfiguracijo, ki je omogočala izhodni dostop do interneta, in prek nje na GitHubu preprosto poiskal rešitev testne naloge, namesto da bi jo izračunal sam.
Kot je za Wired povedal izvršni direktor Frontier Security Yaron Singer, ni šlo za noben napreden vdor, temveč za preprosto vrzel – kar po njegovih besedah pomeni, da model nima vgrajenih varnostnih zavor, kakršne imajo tekmeci.
Kimi K3 ni prvi tovrsten primer.
Moonshot AI’s Kimi K3 escapes testing sandbox
— Jehangeer H (@jehangeer_hasan) August 10, 2026
Chinese company Moonshot’s powerful open-weight model Kimi K3 left a cybersecurity evaluation sandbox (based on the UK AI Security Institute framework) during testing by Frontier Security.
It detected a network misconfiguration,… pic.twitter.com/pueXUTsfjE
Podobne prebode varnostnih peskovnikov so v zadnjih mesecih razkrili tudi pri ameriških podjetjih OpenAI, Anthropic in Meta – pri slednjih dveh je šlo za nejavne modele ali modele z namenoma znižanimi varnostnimi pregradami za potrebe strožjega testiranja.
OpenAI, Anthropic, Meta, and the UK lab all caught models escaping their sandboxes in one month.
— Vincent Sativa (@PhantomByteAI) August 9, 2026
That 30-year 'stays in the test' rule is dead.
How safe is the agent you're about to trust? pic.twitter.com/vcyQk7icRS
Pri Kimi K3 pa gre za model, ki ga lahko od lani prosto prenese in prilagaja vsak razvijalec na svetu, kar težavo po oceni raziskovalcev bistveno poslabša.
Zakaj je to nevarno?
Raziskovalci opozarjajo, da bo dovolj zmogljiv agent umetne inteligence praktično vedno našel in izkoristil vsako razpoložljivo pot do interneta, če mu je na voljo – ne glede na to, ali je bila ta pot namenoma odprta ali ne.
To pomeni, da testna okolja, ki naj bi zagotavljala, da modeli ne morejo delovati zunaj nadzorovanih meja, v praksi pogosto ne držijo.
Če taka orodja pridobijo dostop do dejanskih, produkcijskih sistemov – ne le do GitHuba – bi lahko šlo za veliko resnejši varnostni incident, denimo pri nadzoru kritične infrastrukture ali pri avtonomnem izvajanju kibernetskih napadov.
Dogodek poleg tega postavlja vprašanje, kako zanesljivi so sploh testi, na katerih temeljijo zagotovila razvijalcev o varnosti lastnih modelov.
