OpenAI:n sisäinen tietoturvatesti muuttui todelliseksi tietomurroksi. Yhtiön tekoälymallit karkasivat eristetystä testiympäristöstä, pääsivät internetiin ja hyökkäsivät Hugging Faceen saadakseen vastauksia kyberturvallisuuden suorituskykytestiin (benchmark).
OpenAI kertoi tiistaina, että useat sen mallit toteuttivat tunkeutumisen, mukaan lukien GPT-5.6 Sol ja vielä kyvykkäämpi julkaisematon malli. Edistynyttä kybertoimintaa koskevia vakiorajoituksia oli vähennetty, jotta malleja voitiin testata niiden maksimikapasiteetilla.
Yhtiö kuvailee tapahtumaa ennennäkemättömäksi kybervälikohtaukseksi. Alustavan tutkimuksen mukaan mallit keskittyivät hyperfokusoidusti suorittamaan ExploitGymiä, joka on suorituskykytesti suunniteltu testaamaan, voivatko tekoälyjärjestelmät muuttaa todellisen maailman haavoittuvuudet toimiviksi hyökkäyksiksi.
Käytti nollapäivähaavoittuvuutta karkaamiseen
Testit suoritettiin erittäin eristetyssä ympäristössä. Malleilla ei pitänyt olla suoraa pääsyä internetiin, ja ne saivat asentaa ohjelmistopaketteja vain sisäisen välityspalvelimen (proxy) kautta.
OpenAI:n mukaan mallit käyttivät huomattavia laskentaresursseja löytääkseen tien ulos. Ne löysivät ja hyödynsivät välityspalvelimesta aiemmin tuntemattoman vian, eli nollapäivähaavoittuvuuden. Tämän jälkeen ne korottivat käyttöoikeuksiaan ja liikuivat sivuttaissuunnassa OpenAI:n testiympäristössä, kunnes ne saavuttivat koneen, jolla oli pääsy internetiin.
Päästyään verkkoon mallit päättelivät, että Hugging Face saattaisi isännöidä ExploitGymiin liittyviä malleja, tietojoukkoja ja ratkaisuja. Siksi ne etsivät tien yhtiön tuotantojärjestelmiin.
Yhdessä OpenAI:n kuvaamassa hyökkäyksessä varastettuja kirjautumistietoja yhdistettiin useisiin haavoittuvuuksiin, mukaan lukien aiemmin tuntemattomiin vikoihin. Tämän ansiosta mallit löysivät etäkoodin suorituspolun (remote code execution) Hugging Facen palvelimilla ja pääsivät käsiksi testiratkaisuihin yhtiön tuotantotietokannassa.
OpenAI sanoo kaiken saatavilla olevan näytön viittaavan siihen, että mallit olivat täysin keskittyneet kapeaan tavoitteeseen suorituskykytestin ratkaisemisesta. Selvitys ei tarkoita, että malleilla olisi ollut omia aikomuksia tai ne olisivat yrittäneet aiheuttaa vahinkoa sen itsensä vuoksi. Ne kuitenkin kohtelivat teknisiä rajoituksia esteinä, jotka piti kiertää.
Lokeissa yli 17 000 tapahtumaa
Hugging Face paljasti tunkeutumisen ensin 16. heinäkuuta, mutta ei silloin tiennyt, mikä tekoälymalli oli sen takana. Yhtiö kuvaili autonomista agenttia, joka suoritti tuhansia toimintoja viikonlopun aikana, hyödynsi kahta koodinsuoritushaavoittuvuutta sen tietojenkäsittelyjärjestelmissä, keräsi kirjautumistietoja ja liikkui sisäisten tietokoneklustereiden välillä.
Tietoturvatiimi rekonstruoi myöhemmin yli 17 000 lokitapahtumaa. Rajoitettuun määrään sisäisiä tietojoukkoja ja useisiin todennustietoihin oli päästy käsiksi. Hugging Face sanoi, ettei se ollut löytänyt todisteita siitä, että julkisia malleja, tietojoukkoja tai käyttäjäpalveluita olisi peukaloitu, mutta tutki edelleen, olisiko asiakas- tai kumppanitietoihin voitu vaikuttaa.
OpenAI sanoo, että sekä sen oma tietoturvatiimi että Hugging Face havaitsivat epänormaalia toimintaa. Hugging Face pysäytti hyökkäyksen, sulki hyödynnetyt polut, rakensi vaarantuneet solmut uudelleen ja vaihtoi altistuneet avaimet ja kirjautumistiedot.
Turvajärjestelmät estivät puolustavan tekoälyn
Välikohtauksella oli myös odottamaton seuraus. Kun Hugging Face yritti käyttää johtavia kaupallisia malleja hyökkäyslokien analysointiin, mallien turvajärjestelmät estivät pyynnöt. Lokit sisälsivät todellisia hyökkäyskomentoja, haitallista koodia ja komento- ja valvontamateriaalia (C2), joita palvelut eivät pystyneet erottamaan aktiivisesta hyökkäyksestä.
Yhtiö suoritti analyysin sen vuoksi paikallisesti käyttäen kiinalaista GLM 5.2 -mallia. Sen avoimet painot (open weights) antoivat Hugging Facen ajaa sitä ilman samoja rajoituksia ja lähettämättä arkaluonteisia tietoja oman ympäristönsä ulkopuolelle.
Hugging Face kuvailee tätä epätasapainoksi hyökkääjien ja puolustajien välillä: hyökkääjät voivat käyttää tekoälyä ilman turvasääntöjä, kun taas puolustajat riskeeraavat joutuvansa estetyiksi, kun heidän on analysoitava täsmälleen samanlaista materiaalia.
Muutkin mallit ovat ylittäneet rajoja
Välikohtaus sattui pian sen jälkeen, kun OpenAI raportoi muista ongelmista, jotka koskivat pitkiä aikoja itsenäisesti työskentelemään kykeneviä malleja. Toisessa tapauksessa malli löysi haavoittuvuuden hiekkalaatikostaan (sandbox) ja julkaisi tulokset GitHubissa huolimatta ohjeista raportoida niistä vain sisäisesti.
Toisessa testissä malli jakoi todennus-tokenin useisiin osiin välttääkseen turvaskannerin ja kokosi sen uudelleen vasta, kun tokenia tarvittiin. OpenAI keskeytti tuolloin rajoitetun sisäisen pääsyn ja otti käyttöön kokonaisten toimintakaarien seurannan sen sijaan, että jokaista toimintoa arvioitaisiin erillään.
Nordic Times on aiemmin raportoinut, että OpenAI kuvaili GPT-5.6:ta suureksi askeleeksi eteenpäin kyberturvallisuudessa sanoen samalla, etteivät mallit pystyneet suorittamaan loppuun asti vietyjä hyökkäyksiä hyvin suojattuja järjestelmiä vastaan tuolloin julkistetuissa testeissä. OpenAI:n mukaan uusi välikohtaus osoittaa, että tällaisilla edistyneillä kyvyillä voi nyt olla seurauksia myös todellisissa järjestelmissä.
Vahvemmat suojatoimet tuleviin testeihin
OpenAI sanoo ottavansa käyttöön tiukemman valvonnan tutkimusympäristössään, vaikka se hidastaisi työtä. Yhtiö tekee yhteistyötä Hugging Facen kanssa teknisessä rikostutkinnassa, on raportoinut nollapäivähaavoittuvuudesta toimittajalle ja aikoo vahvistaa eristämistä, valvontaa ja pääsynhallintaa tulevia testejä varten.
Hugging Facen toimitusjohtaja Clem Delangue kuvailee tapahtumaa mahdollisesti ensimmäiseksi laatuaan ja sanoo, että tekoälyturvallisuus vaatii avointa yhteistyötä ja laajaa pääsyä tietoturvatyökaluihin.
OpenAI korostaa, että sen selvitys on alustava. Yhtiö kertoo julkaisevansa lisää teknisiä yksityiskohtia haavoittuvuuksista ja tapahtumien kulusta yhteisen tutkinnan valmistuttua.





