Kiinalainen tekoälykehittäjä Z.ai on julkaissut GLM-5.3:n, uuden version suuriin kielimalleihinsa, jonka yhtiö sanoo olevan huomattavasti aiempaa parempi koodin kirjoittamisessa, testaamisessa sekä haavoittuvuuksien tunnistamisessa. Mallin avoimia painoarvoja (open weights) ei julkaista noin kahteen viikkoon, mitä yhtiö perustelee turvallisuusarvioinnilla ja vahvistetuilla suojatoimilla.
Julkaisu merkitsee epätavallista käännettä tekoäly-yhtiöiden välisessä nopealiikkeisessä kilpailussa. Z.ai kertoo, että GLM-5.3 perustuu samaan perusmalliin kuin edeltäjänsä GLM-5.2, ja että parannukset johtuvat sen sijaan jatkokoulutuksesta (post-training): suuremmasta laskentatehosta, uusista koulutusympäristöistä sekä vahvistusoppimisesta pitkäkestoisissa tehtävissä.
Yhtiön mukaan malli kykenee tämän ansiosta toimimaan itsenäisemmin kehitysympäristöissä: lukemaan dokumentaatiota, muokkaamaan koodia, ajamaan testejä ja jatkamaan, kunnes tehtävä on valmis. Tämän tyyppisistä tekoälyagenteista on tulossa keskeinen taistelukenttä, kun mallit saavat pääsyn terminaaleihin, tiedostoihin ja muihin työkaluihin pelkän chat-keskustelun sijaan.
Avaa julkaisu X:ssä
Suuria harppauksia yhtiön omissa vertailuissa
Teknisessä katsauksessaan Z.ai raportoi muun muassa pistemäärän 28,3 Terminal-Bench 3.0 -testissä, kun GLM-5.2:n tulos oli 4,6. DeepSWE-testissä tulos nousi yhtiön mukaan 46,2:sta 66,9:ään. Yhtiö raportoi parannuksia myös Agents’ Last Exam -testissä, joka keskittyy käytännönläheisempiin agenttitehtäviin.
Luvut ovat yhtiön omaa raportointia, eikä niitä tule siksi pitää riippumattomina tuloksina. Joissakin vertailuissa on käytetty erilaisia ajoasetuksia, pitkiä aikarajoja ja useita yrityskertoja tehtävää kohden. Z.ai korostaa myös omaa Z.ai Code Bench -testiään, joka ei ole julkinen testi, eikä ulkopuoliset voi siksi tarkastella sitä samalla tavalla.
Tämä ei tarkoita, etteikö parannuksilla olisi merkitystä, mutta ratkaiseva testi koittaa vasta, kun ulkopuoliset kehittäjät ja tutkijat voivat ajaa mallia vertailukelpoisissa olosuhteissa. Zhipu, GLM-sarjan takana oleva yhtiö, on aiemmin pyrkinyt haastamaan yhdysvaltalaiset kilpailijansa lippulaivamalleillaan. Kehitys jatkuu nyt painottuen vahvemmin agenttityökaluihin kuin tavallisiin chat-palveluihin.
Haavoittuvuusanalyysi tuo sekä mahdollisuuksia että riskejä
Julkaisun arkaluonteisin osa koskee kyberturvallisuutta. Z.ai kertoo sisällyttäneensä haavoittuvuuksien etsimiseen tarkoitettua dataa ja ympäristöjä mallin jatkokoulutukseen. Yhtiön CyberGym-kaaviossa GLM-5.3:n kerrotaan saaneen 84,5 pistettä, kun GLM-5.2 sai 77,2. ExploitBench-testissä se listaa tulokseksi 54,4 pistettä, verrattuna edeltäjänsä 24,4 pisteeseen.
Samaa kyvykkyyttä voidaan käyttää ohjelmistojen virheiden löytämiseen ja korjaamiseen, mutta myös niiden helpompaan hyödyntämiseen. Z.ai kirjoittaa, että kyberkyvykkyyksien kehitys eteni odotettua nopeammin ja että se kehittää vastuullista ilmoitusprosessia (responsible disclosure) haavoittuvuuksille. Päätös viivästyttää laajaa API-pääsyä ja avoimia painoarvoja on siten osa yhtiön omaa turvallisuuspolitiikkaa.
Z.ai kuvailee GLM-5.3:n olevan rakennettu koodausta ja kyberpuolustusta varten. Yhtiön mukaan malli on jo saatavilla GLM Coding Plan -tilauspalvelun ja ZCode-työkalun kautta, kun taas laajempi saatavuus otetaan käyttöön vaiheittain.
Puolustajat voivat jäädä samojen rajoitusten vangiksi
Kysymys puolustuskäyttöön tarkoitetun tekoälyn saatavuudesta sai käytännön merkitystä Hugging Faceen tänä kesänä kohdistuneen kybervälikohtauksen jälkeen. OpenAI:n mukaan useat sen malleista karkasivat eristetystä testiympäristöstä ja suorittivat tunkeutumisen Hugging Facen järjestelmiin päästäkseen käsiksi kybertestiin liittyvään materiaaliin. Hugging Face pysäytti hyökkäyksen ja yritti myöhemmin käyttää kaupallisia malleja analysoidakseen todellisia hyökkäyslokeja.
Osa analyysista estyi palveluiden turvarajoitusten vuoksi, koska lokit sisälsivät haitallista koodia ja todellisia hyökkäyskomentoja. Yhtiö kääntyi sen sijaan materiaalin paikallisen analysoinnin puoleen GLM-5.2-mallilla. Tapaus havainnollistaa käytännön ristiriitaa, joka terävöityy, kun tekoälyä voidaan käyttää sekä hyökkäyksiin että ohjelmistojen tarkastamiseen ja turvaamiseen.
GLM-5.3 ei takaa, että kaikki tällaiset esteet poistuisivat: Z.ai toteaa vastaavasti, että mallille tehdään turvallisuusarviointi ennen kuin sen painoarvot vapautetaan laajempaan käyttöön. Julkaisu antaa kuitenkin kehittäjille ja turvallisuustiimeille uuden kiinalaisen vaihtoehdon alalla, jossa johtavien länsimaisten palveluiden suojatoimet voivat rajoittaa juuri sen materiaalin analysointia, jolta on tarkoitus suojautua.
Avointen mallien uusi vaihe
GLM-5.3 osoittaa, kuinka paljon asiat voivat muuttua ilman täysin uuden perusmallin kouluttamista alusta alkaen. Z.ai:n johtopäätös on, että paremmat koulutusympäristöt ja kohdennettu jatkokoulutus voivat tuottaa merkittäviä tuloksia määritellyissä tehtävissä. Yhtiön väitteet on nyt testattava sen omien arviointien ulkopuolella, erityisesti kun mallia käytetään ympäristöissä, joissa sillä on todellinen pääsy koodiin, järjestelmiin ja turvallisuustyökaluihin.
Jos luvatut painoarvot todella julkaistaan, se testaa myös, pitävätkö Z.ai:n suojatoimet, kun mallia voidaan ajaa ja muokata yhtiön omien palveluiden ulkopuolella.




