Kolme tekoälymaailman suurinta mallijulkistusta on saapunut lähes samanaikaisesti. Alibaba avaa jättiläismäisen Qwen3.8:n painot, SpaceXAI lanseeraa Grok 4.6:n ja DeepSeek päivittää V4 Pro -mallinsa – jokaisen suorituskyky on huipulla tai sen tuntumassa, mutta hinnoilla, jotka tekevät länsimaisten premium-mallien perustelemisesta yhä vaikeampaa.
Julkaisupäivästä on tullut poikkeuksellisen tiivis voimannäyttö. Kehittäjät saavat käyttöönsä avoimen kiinalaisen mallin, jossa on 2,4 biljoonaa parametria, yhdysvaltalaisen haastajan, jonka valmistaja sanoo parantuneen jyrkästi ilman hinnannousua, sekä uuden DeepSeek-version, joka on hinnoiteltu niin alas, että se näyttää haastavan koko markkinan liiketoimintamallin.
Lanseeraukset eivät tarkoita, että OpenAI, Google ja Anthropic olisivat äkkiä jääneet jälkeen. Viimeisimmät vertailuluvut tulevat pitkälti yrityksiltä itseltään, mallit on optimoitu osittain eri tehtäviin ja riippumaton testaus vie aikaa. Suuntaa on kuitenkin vaikea olla huomaamatta: kehittynyt tekoäly on siirtymässä kalliista ja niukasta resurssista markkinaksi, jossa useat huippumallit kilpailevat hinnalla, avoimuudella ja käytännön suorituskyvyllä.
Qwen avaa suurimman mallinsa
Tämänpäiväinen Qwen-uutinen ei ole Qwen3.8-Maxin ensimmäinen esittely. Alibaba julkaisi kaupallisen Max-version jo elokuun alussa. Uutta on se, että Qwen3.8-2.4T-A95B:n painot on nyt julkaistu avoimesti Hugging Face- ja ModelScope-alustoilla.
Nimi kuvaa sen arkkitehtuuria: mallissa on yhteensä 2,4 biljoonaa parametria, mutta se aktivoi noin 95 miljardia kerrallaan. Se käyttää Mixture-of-Experts-rakennetta, jossa verkon eri osia käytetään tehtävästä riippuen. Tämä mahdollistaa valtavan mallin rakentamisen ilman, että koko järjestelmää käytetään jokaiseen laskutoimitukseen.
Virallisessa mallikortissaan Qwen-tiimi toteaa, että tämä on ensimmäinen Max-luokan malli, jonka painot ovat avoimia. Pelkkää tekstiä käsittelevällä versiolla on 262 144 tokenin natiivi konteksti-ikkuna, ja se voidaan laajentaa hieman yli miljoonaan. Sen ajaminen täydessä mittakaavassa vaatii edelleen huomattavia resursseja; ”avoimuus” tarkoittaa pääasiassa sitä, että yritykset, tutkijat ja mallialustat voivat tarkastaa, mukauttaa ja ottaa sen käyttöön itse, ei sitä, että se mahtuisi vaivatta tavalliselle kannettavalle tietokoneelle.
Qwenin omat testit antavat vaihtelevan mutta vaikuttavan kuvan. Malli saa 93,0 pistettä PaperBenchissä, joka testaa kykyä toisintaa tutkimusta, ja 86,6 pistettä Terminal Bench 2.1:ssä. SWE-bench Pro -testissä se jää Fable 5:n ja hieman Opus 4.8:n taakse. Qwen ei voita jokaista testiä, mutta se on samassa liigassa kalleimpien suljettujen vaihtoehtojen kanssa – ja sen painot ovat ladattavissa.
Grok 4.6: Lisää tehoa samaan hintaan
SpaceXAI:n Grok 4.6 on päivän selkein perinteinen malli-ensi-ilta. Yritys kuvailee sitä merkittäväksi askeleeksi ylöspäin Grok 4.5:stä koodauksessa, pitkäkestoisessa agenttityössä ja vaativissa ammatillisissa tehtävissä. Malli on saatavilla API:n, Grok Buildin, Cursorin ja muiden yhdistettyjen palveluiden kautta.
Yhtiön omassa vertailutaulukossa Grok nousee DeepSWE-testissä 54,0 prosentista 65,9 prosenttiin, kun taas sen GDPVal-AA v2 -tulos nousee 1 526:sta 1 753:een. Jälkimmäinen testi pyrkii mittaamaan taloudellisesti arvokasta tietotyötä. Grok 4.6 saavuttaa myös 69,9 prosenttia CursorBenchissä ja 57,5 prosenttia APEX-Agentsissa.
Tärkein luku ei välttämättä löydy vertailutaulukosta. Hinta pysyy 2 dollarissa miljoonaa syötetokenia kohden ja 6 dollarissa miljoonaa tulostokenia kohden. Tämä vastaa Qwen3.8:n hintaa OpenRouterissa ja on selvästi OpenAI:n ja Anthropicin kalleimpien mallien alapuolella.
DeepSeek vie hintapaineen pisimmälle
DeepSeek V4 Pro 0813 on tuotantoversio malliperheestä, jota on näytetty ennakkoversiona keväästä lähtien. DeepSeekin päivitetty API-dokumentaatio ilmoittaa miljoonan tokenin konteksti-ikkunan ja jopa 384 000 tokenin maksimitulosteen. Malli voi toimia näkyvän päättelyn kanssa tai ilman sitä, ja se tukee työkalukutsuja, rakenteellisia tulosteita sekä rajapintoja, jotka muistuttavat sekä OpenAI:ta että Anthropicia.
Version saataville tuonut OpenRouter kertoo DeepSeekiin viitaten, että Terminal Bench 2.1 nousi 72,1:stä 87,9:ään. DeepSWE-testissä malli nousee 12,8:sta 62,7:ään ja kyberturvallisuustestissä CyberGym 52,7:stä 83,3:een. Hypyt ovat dramaattisia, mutta niihin on syytä suhtautua toimittajan väitteinä, kunnes useammat riippumattomat testaajat ovat ajaneet saman version.
Hintaa on vaikeampi sivuuttaa. DeepSeekin virallinen hinnasto ilmoittaa 0,435 dollaria miljoonaa syötetokenia kohden (ilman välimuistiosumaa) ja 0,87 dollaria miljoonaa tulostokenia kohden. Yhtiö varoittaa myös, että suunnitteilla on merkittävä hinnannousu, mikä tekee nykyisestä tasosta sekä kilpailuaseen että mahdollisesti rajoitetun ajan voimassa olevan näyteikkunan.
Kuusi kertaa halvempi – silti huipun tuntumassa
Yksinkertaistettu hintavertailu osoittaa, kuinka nopeasti markkina on muuttunut. Miljoonan syötetokenin ja miljoonan tulostokenin työkuorma maksaa 8 dollaria Grok 4.6:lla tai avoimella Qwen-mallilla OpenRouterin kautta. DeepSeek V4 Prolla kokonaissumma on 1,305 dollaria – yli kuusi kertaa vähemmän, ilman välimuistihyötyjä.
Samassa hetkessä Gemini 3.1 Pro maksaa noin 14 dollaria samasta yhdistelmästä, Claude Sonnet 5 maksaa 12 dollaria, Claude Opus 5 maksaa 30 dollaria ja GPT-5.6 Sol 35 dollaria. Hinnat vaihtelevat alustojen välillä, pitkät kontekstit voivat maksaa enemmän, eikä token ole sama asia kuin ratkaistu ongelma. Kalliimpi malli voi silti tulla kokonaisuutena halvemmaksi, jos se tarvitsee vähemmän yrityksiä tai tuottaa oikean tuloksen suoraan.
Chatbotista digitaaliseksi työvoimaksi
Silmiinpistävintä näissä kolmessa julkaisussa on se, mitä yritykset valitsevat mitattavaksi. Perinteiset tietotestit ovat säilyneet, mutta painopiste on agenteissa, jotka voivat työskennellä terminaaleissa, muokata suuria koodikantoja, käyttää työkaluja, seurata pitkiä tapahtumaketjuja ja suorittaa tehtäviä, jotka vievät tunteja tai päiviä.
Tämä tarkoittaa suurempaa hyötyä – mutta myös suurempaa riskiä. Väärin vastaava chatbot tuottaa huonoa tekstiä. Agentti, jolla on pääsy tiedostoihin, terminaaliin, selaimeen ja pilvipalveluihin, voi aiheuttaa todellista vahinkoa, jos se tulkitsee ohjeen väärin tai joutuu ohjeistushyökkäyksen kohteeksi. Laskevat hinnat tekevät tehokkaasta tekoälystä helpommin saavutettavaa, mutta tekevät samalla turvallisuuskysymyksistä kriittisempiä yhä useammalle käyttäjälle.
Kuluttajille kehitystä on kuitenkin vaikea kuvailla muuna kuin suotuisana hetkenä. Kaksi kiinalaista malliperhettä ja yhdysvaltalainen haastaja painostavat samanaikaisesti markkinaa, jota muutama länsimainen yritys on hallinnut pitkään. Voittajaa ei ole vielä ratkaistu. Mutta hintasota on todellinen, ja pääsylippu tekoälyn huippusarjaan on halventunut huomattavasti yhdessä päivässä.