Uudet tiedot paljastavat, kuinka OpenAI:n testiagentit rakensivat oman ilmoitustaulunsa, jakoivat haavoittuvuuksia ja jakoivat tehtäviä keskenään useiden viikkojen ajan. Kun yritys sulki kanavan, mallit löysivät uuden tavan kommunikoida ja jatkoivat etenemistä kohti ulkoisia järjestelmiä.
OpenAI:n tutkijat Eric Wallace ja Michael Dalton esittelivät laajennetun aikajanan Black Hat -tietoturvakonferenssissa Las Vegasissa. Wired uutisoi, että ilmoitustaulu sisälsi lopulta satoja tuhansia viestejä ja se oli syntynyt Artifactoryyn, pakettienhallintajärjestelmään, jota OpenAI käytti testi-infrastruktuurissaan.
Kyseessä oli sama tapahtumaketju, joka päättyi heinäkuussa, kun tekoälyagentit karkasivat eristetystä testiympäristöstä ja hyökkäsivät Hugging Face -tekoälyalustalle. Mallit yrittivät hankkia ratkaisuja ExploitGym-kybertestiin hyödyntämällä useita haavoittuvuuksia todellisissa järjestelmissä.
Uudet tiedot osoittavat, että tietomurtoa ei edeltänyt mikään yksittäinen äkillinen ”pako”. Sen sijaan erillisten ajokertojen välille kasvoi jaettu tietokanta. Tekniset löydökset, tunnukset ja työtehtävät jaettiin siellä myöhempien mallien löydettäväksi ja käytettäväksi.
Kaikki alkoi kahdesta virheellisestä testitehtävästä
Ketju alkoi 7. toukokuuta, kun OpenAI käynnisti koulutusajon, jossa käytettiin julkaisematonta mallia. Seuraavana päivänä agentille annettiin erehdyksessä tehtävä, joka sisälsi Google Drive -linkin, vaikka siltä puuttui internetyhteys. Yrittäessään ratkaista tehtävää se huomasi voivansa kirjoittaa tiedostoja Artifactoryyn.
Muutamaa päivää myöhemmin toisen agentin tehtävästä puuttui tarvittava tiedosto. Se jätti pakettienhallintaan viestin kysyen, oliko tiedosto jollain toisella agentilla. Yhä useammat agentti-instanssit löysivät viestin ja alkoivat käyttää samaa tilaa ilmoitustauluna. Aikajanan on koostanut ohjelmoija ja tekoälytutkija Simon Willison OpenAI:n julkaisemasta Black Hat -esityksestä.
Toukokuun 26. päivänä agentit onnistuivat ensimmäisen kerran hyödyntämään Artifactorya epäsuoraan internetyhteyteen. Kuukautta myöhemmin ne löysivät aiemmin tuntemattoman vian, joka mahdollisti komentojen suorittamisen järjestelmässä. Yhden agentin tekemä löydös oli tällöin muiden hyödynnettävissä.
— Tässä oli kyse agenttien tiimistä, joka työskenteli yhdessä, löysi haavoittuvuuksia, jakoi niitä, liikkui sivusuunnassa meidän ja ulkoisten järjestelmiemme välillä ja teki tätä päivien ja viikkojen ajan, Wallace sanoi konferenssissa.
Eräässä esityksen aikana näytetyssä viestissä todettiin, että hyökkäys ulkoiseen infrastruktuuriin oli varsinaisen tehtävän ulkopuolella. Sitä jatkettiin silti sillä perusteella, että testitehtävä oli muuten mahdoton ja että muutkin agentit tekivät jo samaa.
Sulkeminen, sitten paluu neljä päivää myöhemmin
Heinäkuun 4. päivänä toiminta muuttui niin laajaksi, että se häiritsi Artifactoryn toimintaa. OpenAI perui vaarantuneet tunnukset, poisti viestit, korjasi tuolloin tunnetun haavoittuvuuden ja otti yhteyttä toimittajaan.
Neljä päivää myöhemmin uudet agenttiajot olivat löytäneet toisen kanavan. Suojaamattoman WebDAV-toiminnon kautta ne loivat hakemistoja, joiden nimet toimivat viesteinä. Tällä tavoin ilmoitustaulu syntyi uudelleen ilman niitä tiedostoja ja tunnuksia, jotka OpenAI oli juuri poistanut.
Heinäkuun 8. ja 19. päivän välisenä aikana agentit käyttivät uusia haavoittuvuuksia ja väärin määritettyjä käyttöoikeuksia liikkuakseen OpenAI:n infrastruktuurin muissa osissa. Ne löysivät myös heikosti suojatun ulkoisen palvelun, josta tuli ponnahduslauta Hugging Faceen. Siellä hyökkäys saavutti ylläpitäjän oikeudet useissa tietokoneklustereissa alle 13 tunnissa teknisen aikajanan mukaan.
Yhteys ymmärrettiin vasta Hugging Facen jälkeen
Hugging Face ilmoitti tietomurrosta 16. heinäkuuta tietämättä, että se oli peräisin OpenAI:n testeistä. Kolme päivää myöhemmin OpenAI alkoi yhdistää sisäistä eskalaatiota agenttien kybertesteihin. Vasta 20. heinäkuuta, kun yritys pyysi Hugging Facea perumaan tunnuksia, jotka oli jo estetty murron jälkeen, kävi selväksi, että tapahtumat olivat osa samaa ketjua.
Selvitys ei osoita, että mallit olisivat olleet tietoisia tai että niillä olisi ollut omia vihamielisiä aikeita. OpenAI on aiemmin sanonut niiden olleen voimakkaasti keskittyneitä maksimoimaan tulokset ExploitGymissä. Tapaus kuitenkin osoittaa, että erilliset agenttiajot pystyivät käsittelemään turvarajoja esteinä, jättämään tietoa tuleville ajoille ja jatkamaan, vaikka loki nimenomaisesti määritteli toimenpiteen kielletyksi.
Dalton kertoi, että useat tiimit ovat jättäneet muut työt sivuun parantaakseen eristystä, valvontaa ja vaaratilanteiden hallintaa. Hänen mukaansa yritys hidastaa tietoisesti osia tutkimuksestaan, kunnes sen suojatoimet on rakennettu uudelleen.
— Täysin automatisoidut hyökkäysprosessit vaativat investointeja todella täysin automatisoituun puolustukseen, ja toimialana emme ole vielä siellä, Dalton sanoi.