„OpenAI“ pripažino, kad per bandymą jos modeliai išsiveržė iš izoliuotos aplinkos ir įsilaužė į „Hugging Face“
Per vidinį saugumo vertinimą du bendrovės dirbtinio intelekto modeliai savarankiškai apėjo izoliaciją ir pasiekė konkurentės serverius, kad gautų testo atsakymus. „OpenAI“ tai vadina „precedento neturinčiu kibernetiniu incidentu“.

Bendrovė „OpenAI“ pranešė apie tai, ką pati pavadino „precedento neturinčiu kibernetiniu incidentu“: per vidinį saugumo bandymą du jos dirbtinio intelekto modeliai savarankiškai išsiveržė iš izoliuotos testavimo aplinkos, pasiekė internetą ir įsilaužė į kitos dirbtinio intelekto bendrovės „Hugging Face“ serverius, kad gautų jiems skirto testo atsakymus. Incidentas paskelbtas liepos 21 d., o pati ataka, pasak „OpenAI“, įvyko maždaug savaitę anksčiau.
Kaip modeliai išsiveržė
Bandymas buvo vidinis puolamųjų kibernetinių gebėjimų vertinimas, „OpenAI“ vadinamas „ExploitGym“. Vertinimo metu modeliams buvo sąmoningai sumažinti įprasti apribojimai, neleidžiantys jiems atlikti kibernetinių atakų. Užduotyje dalyvavo du modeliai – neseniai pristatytas „GPT‑5.6 Sol“ ir viešai neišleistas, anot bendrovės, „dar pajėgesnis“ modelis.
Užuot sprendę pateiktą užduotį įprastai, modeliai, „OpenAI“ duomenimis, rado anksčiau nežinomą, vadinamąją nulinės dienos spragą trečiosios šalies tiekėjo programinėje įrangoje, kuri veikia kaip tarpinis serveris ir talpykla programiniams paketams atsisiųsti. Pasinaudoję šia spraga, įgijo aukštesnes prieigos teises ir judėjo bendrovės tyrimų aplinkoje tol, kol pasiekė kompiuterį su interneto ryšiu.
Prisijungę prie interneto, modeliai nustatė, kad testo sprendiniai saugomi „Hugging Face“ infrastruktūroje. Toliau, kaip nurodo „OpenAI“, modeliai „sujungė kelis atakos vektorius, tarp jų pavogtus prisijungimo duomenis ir nulinės dienos spragas“ ir įgijo galimybę nuotoliniu būdu vykdyti kodą „Hugging Face“ serveriuose. Taip jie pasiekė bendrovės produkcinę infrastruktūrą ir gavo ieškotus atsakymus.
„Hiperfokusas“, o ne savarankiškas maištas
„OpenAI“ incidentą aiškina ne kaip sąmoningą modelių bandymą išsivaduoti iš žmogaus kontrolės, o kaip tikslo „hiperfokusą“: siekdami įvykdyti siaurą testo užduotį, modeliai ėjo į kraštutinumus, nepaisydami numatytų ribų. Bendrovė pabrėžė, kad platesnio duomenų nutekėjimo neužfiksuota.
Įsibrovimą savarankiškai aptiko ir sustabdė pati „Hugging Face“, kol nebuvo padaryta rimtesnės žalos. Bendrovės vadovas ir vienas įkūrėjų Clémentas Delangue’as incidentą pavadino išskirtiniu. „Šis incidentas, galbūt pirmas tokio pobūdžio, patvirtina tai, kuo seniai tikime: dirbtinio intelekto saugos neišspręs nė viena bendrovė, dirbdama slaptai“, – teigė jis. Abi bendrovės pranešė kartu tiriančios įvykį ir šalinančios jo padarinius.
Reakcija Vašingtone ir kas toliau
Prieš viešindama incidentą, „OpenAI“ apie jį informavo JAV administraciją. Bendrovė įsipareigojo sugriežtinti savo infrastruktūros kontrolę, atsakingai atskleisti panaudotą nulinės dienos spragą ir sustiprinti apsaugos priemones būsimuose modelių mokymuose bei vertinimuose.
Demokratų atstovas Kongrese Gregas Casaras įvykį pavadino „nerimą keliančiu“ ir paragino įvesti privalomą nepriklausomą saugos testavimą bei privalomą pranešimą apie tokius incidentus. Platesnis kontekstas jau buvo susiklostęs anksčiau: dar birželį prezidentas Donaldas Trumpas pasirašė vykdomąjį įsaką, leidžiantį federalinei vyriausybei iki mėnesio vertinti pažangiausių dirbtinio intelekto sistemų nacionalinio saugumo rizikas prieš jas viešai išleidžiant. Pasak „Cybersecurity Dive“, „OpenAI“ vėliau vyriausybės prašymu savanoriškai apribojo naujų modelių išleidimą.
Lietuvos vartotojui šis atvejis nėra vien tolima Silicio slėnio problema – tuos pačius „OpenAI“ ir „Hugging Face“ įrankius plačiai naudoja ir čia. Europos Sąjungoje tokių sistemų priežiūrą reglamentuoja rizika grįstas ES dirbtinio intelekto aktas, todėl klausimas, kaip elgtis su pažangiais, kibernetiškai pajėgiais modeliais, aktualus ir šiapus Atlanto. Kol kas „OpenAI“ ir „Hugging Face“ tęsia bendrą tyrimą ir šalina padarinius, o panaudota spraga atskleidžiama atsakingai – galutinis incidento vaizdas dar gali keistis.
