Tekoälyyhtiö SpaceXAI (entinen xAI) julkaisi maanantaina Grok 4.7 -mallin kutsuen sitä kyvykkäimmäksi mallikseen koodaukseen ja tietotyöhön. Se maksaa saman verran ja vastaa yhtä nopeasti kuin edeltäjänsä Grok 4.6, ja se on välittömästi saatavilla Cursorissa, Grok Buildissa sekä Grok-rajapinnassa – ja jokainen parannusta osoittava luku on peräisin yhtiöltä itseltään.
Julkaisussa konkretiaa ei ole uusi hinta, vaan uusi sisältö saman hintalapun alla. Yhtiön mukaan Grok 4.7 on rakennettu uuden ja laajemman perusmallin päälle kuin 4.6. Se on koulutettu pidemmällä vahvistusoppimisjaksolla vaikeammalla tehtäväkokonaisuudella, jossa painotetaan useita tunteja kestäviä ongelmia, ja se on tullut paremmaksi oman työnsä tarkistamisessa ja pitkien kontekstien hallinnassa. Malli on myös koulutettu ymmärtämään suoraan yhtiön omaa agenttiympäristöä, Grok Bot -alustaa.
Rajapinnassa (API) mallin nimi on grok-4.7, ja se maksaa 2 dollaria miljoonaa syötetokenia kohden ja 6 dollaria miljoonaa vastetokenia kohden – täsmälleen saman verran kuin Grok 4.6 High. Konteksti-ikkuna on 500 000 tokenia ja tietojen ajankohtaisuus päättyy toukokuuhun 2026. Ne, jotka haluavat enemmän nopeutta, voivat valita nopean variantin, jossa on kaksinkertainen suoritusnopeus kaksinkertaiseen hintaan.
Hyödyt ovat todellisia – mutteivät kaikkialla
Yhtiö raportoi taulukon seitsemästä suorituskykytestistä (benchmark). Kolme niistä osoittaa selvää edistystä. EEBench-testissä Grok 4.7 saa tuloksen 64,0, kun 4.6 sai 53,0. Harvey Legal Agent -testissä, joka mittaa lakiagenttien työtä, yhtiö raportoi tuloksen 19,6, kun edeltäjä sai 15,8 ja kaksi vertailtua kilpailevaa mallia saivat 2,5 ja 6,7. Dramaattisin ero on Terminal-Bench 4.0 -testissä, jossa 4.7 yltää 38,0 pisteeseen vasten 4.6:n 20,3 pistettä – lähes tuplaus puolessa vuodessa.
Mutta taulukko näyttää myös, missä malli ei johda. Samassa Terminal-Bench 4.0 -testissä kilpailija Fable 5.1 saa tuloksen 57,9, mikä on selvästi Grok 4.7:n yläpuolella. CursorBench 4.0:ssa Grok 4.7 saa 46,3 pistettä Fablen 51,8:aa vastaan, ja HealthBench Professionalissa 56,7 vastaan 62,1. Yhtiön omassa Elo-mittauksessa GDPval-alustalla Grok 4.7 xHigh saa tuloksen 1 695 – sijoittuen Grok 4.6 High’n (1 605) ja GPT-6 Astra Maxin (1 542) yläpuolelle, mutta Fable 5.1 Maxin (1 735) alapuolelle.
Yhtiön oma myyntiargumentti ei siis ole kärkipaikka joka testissä, vaan hinta-laatusuhde: saman tason tuloksia 2 ja 6 dollarilla per miljoona tokenia, kun taulukon vertailumallit ovat hinnoiltaan 4/20 dollaria ja 10/50 dollaria. Mitään tuloksista ei ole riippumattomasti varmistettu, ja jokainen taulukon luku on SpaceXAI:n itsensä mittaama ja julkaisema.
Kaupunkiympäristön rakennuspeli demina
Konkreettisena esimerkkinä yhtiö näyttää molemmat malliversiot saman tehtävän parissa: avoimen maailman kaupunginrakennuspelin luomisessa. Grok 4.7 näytetään ensin, Grok 4.6 sen jälkeen. Tämä on juuri sellainen tehtävä, johon pidemmän koulutuksen sanotaan tähtäävän – useita tunteja kestävä työ, jossa mallin on pidettävä koodi, rakenne ja omat tarkistuksensa koossa pitkän matkan ajan ilman, että ihminen ohjaa jokaista askelta.
Yhtiö valitsi demon itse, eikä se kerro mitään siitä, miten malli käyttäytyy todellisessa koodikannassa todellisella asiakkaalla. Se kuitenkin havainnollistaa koko alan suuntaa: kilpailu on siirtynyt nopeista vastauksista agentteihin, jotka jatkavat työtään itsenäisesti tuntikausia. Tässä toimittajat nyt kirittävät toisiaan, ja tässä myös virheet tulevat kalliiksi, sillä pitkään ilman valvontaa työskentelevä malli voi ehtiä tehdä paljon ennen kuin kukaan huomaa sen olevan väärillä jäljillä.
Turvakerros ja luvut, jotka eivät ole sata
SpaceXAI kuvailee Grok 4.7:ää yhtiön tähän asti parhaiten kalibroidulla turvakerroksella – täysin uudella niin sanotulla suojapinolla (safeguard stack), jonka yhtiö sanoo olevan vahvin kieltäytymisessä ja ”jailbreak”-yritysten vastustamisessa. Julkisuuteen annettiin kaksi lukua. HackerBench v0.3 -testissä 3,3 prosenttia riskialttiista kaksoiskäyttökehotteista pääsee läpi. LatchBios-bioturvallisuusmittauksessa raportoidaan tulos 62,4 prosenttia.
Toisin sanoen: hieman useampi kuin kolme sadasta riskialttiista pyynnöstä menee edelleen läpi, ja bioturvallisuustulos on kaukana täydellisestä pistemäärästä. Yhtiö on myös kutsunut valittuja kyberturvallisuuskumppaneita suljettuihin ”red-team”-harjoituksiin puolustustutkimusta varten. Kumppaneita ei nimetty, ja julkaistut luvut ovat yhtiön omia mittauksia yhtiön omilla testisarjoilla.
Missä malli on saatavilla – ja mitä tapahtuu nyt
Saatavuus ratkaisee sen, kuinka nopeasti julkaisu saa käytännön merkitystä. Grok 4.7 on saatavilla ensimmäisestä päivästä lähtien Cursorissa ja Grok Buildissa sekä Grok-rajapinnassa, ja lisäksi kolmannen osapuolen koodausympäristöjen, mallireitittimien ja pilvipalveluiden kautta. Jokainen, joka jo ajaa grok-4.6-mallia tuotannossa, vaihtaa käytännössä mallin nimen koskematta budjettiin.
Tahti on huomioitavan arvoinen. Heinäkuussa julkaistiin Grok 4.5 samaan hintaan, 2 ja 6 dollaria miljoonaa tokenia kohden, ja samalla 500 000 tokenin konteksti-ikkunalla. Sen jälkeen yhtiö on vaihtanut nimeään, ohittanut version 4.6 ja nyt 4.7 – muuttamatta hintaa kertaakaan. Hinnastosta on tullut alan kiintopiste, kun taas sen alla olevat mallit vaihtuvat kuukausittain.
Se, mitä asiakas tosiasiallisesti saa muuttumattomalla 2 ja 6 dollarilla, ei siis ratkea taulukoiden perusteella, vaan sen mukaan, miten uusi malli käyttäytyy tuntikausia kestävissä agenttiajoissa yrityksissä, jotka antavat sen työskennellä omien järjestelmiensä sisällä. Tuo testi alkaa nyt, ja sen tekevät muut kuin yhtiö itse.
Olen hieman hakenut tuota Kalinin oletettua vetyräjähdystä ja Google ei oikein tahdo oikein löytää mitään. Sitten on hieman epäselvää jutussa vielä se että että kumpi nyt oli oikein kyseessä siis kolmosyksikössä se muka oli? Hieman aloin kaivelemaan ja menin IAEA:n tietokantaan niin siellä tuli esille hyvin erikoinen seikka. 2010 laitoksen käyttöaste, eli kuinka paljon ajasta se tuotti sähköä. 2010 82,4% ajasta virtaa. Ei mikään huono luku mutta ei mikään hyvä ydinvoimalalle. 2011 kuitenkin tuli erikoinen seikka vastaan. Nimittäin se että laitoksen käyttöaste pomppasi 84,8% eli se tuotti enemmän sähköä vaikka siellä sattui vakava onnettomuus?!!?!?!. Sitten 2012 käyttöaste pomppasi 92,1%. Se on jo erittäin hyvä luku. Eli kummallinen vetyräjähdys oli kyseessä kun laitos siitä huolimatta tuotti enemmän sähköä kuin edellisvuonna ja seuraavana vuonna se alkoi todenteolla jauhamaan virtaa. Sitten kuulema alkuperäisen referenssijutun mukaan siellä pitäisi olla STUK:illa dokumenttejä, missäs ne ovat kun alkuperäisessä refennsi jutussa ei ollut vaikka ne ovat julkisuuslain mukaan avointa tietoa? Nyt ei oikein stemmaa. Sitten btw ensiöpiirin eveden puoliintumisaika on 7 sekuntia ja VVER-1000 laitoksissa on painekupu.
https://www.iaea.org/PRIS/CountryStatistics/ReactorDetails.aspx?current=495
Videolla kyllä näykyy tuon kaaviokuvan mukaisen reaktorin säätösauvakoneiston ylätaso, ja näkyy se pojsahtavan iloisesti, hyvä ettei höyrystänyt muutamaa työntekijää.
Videolta näkee, että kyse ei ollut räjähdyksestä ensinkään, vaan putkirikosta. Toisekseen, jos reaktori on ollut vain joitain kuukausia tai jutusta päätellen vain viikkoja käytössä, niin radionuklidien määrä on hyvin vähäinen. Tällä videolla nähdään millainen on oikea vetyräjähdys:
https://www.youtube.com/watch?v=pdHbp-tU5O0
Kummastipa Venäjää ja kaikkea venäläistä nyt yritetään täällä demonisoida. Itse olen paljon enemmän huolissani Olkiluoto 3:sta, joka on maailman suurin ydinreaktori ja rakennettu aivan päin helvettiä. Toivon, että jos se joskus käynnistyy, niin se räjähtää tuhannen pillun päreiksi samoin tein. Jos se nimittäin ehtii käydä vaikkapa vuoden ennen räjähtämistään, niin tuulista riippuen koko eteläinen Suomi voi muuttua asuinkelvottomaksi. Fukushima oli siihen nähden pientä, millaisiin tuhoihin tuo paskalaitos pystyy.
Areva tekee sutta ja sekundaa:
http://www.hs.fi/talous/a1429238316209
http://yle.fi/uutiset/3-5427790
http://www.greenpeace.org/finland/fi/kampanjat/ydinvoima/Ydinvoimahankkeet-Suomessa/olkiluoto/Olkiluoto-hankkeen-historia/
”STUK:ista 27.2. saadun, 26.2. neljän virkamiehen voimin laaditun muistion mukaan räjähdys on sattunut Kalinin voimalaitoksen kolmosyksikön huollon aikana 26. marraskuuta 2011, jolloin laitoksella on tehty primääripiirin painekoetta. Venäläisten tekemän selvityksen mukaan painekokeen aikana ei ohjeisto- ja koulutuspuutteiden johdosta ole huolehdittu vedyn poistamisesta, minkä seurauksena vetyä kertyi reaktoripaineastian kannessa oleviin säätösauvojen suojaputkiin. Vetyräjähdyksen seurauksena kahden säätösauvan suojaputket olivat rikkoutuneet, jolloin syntyi vuotoreitti primääripiiristä suojarakennukseen.”
Tuo vetyräjädhys argumentti on puhdasta puppua. Vety syntyy kun polttoainelementtien zirkoonisuojus reagoi veden kanssa ja nappaa itseensä hapen ja dumppaa vedyn pois. Ongelma tässä on se että jotta tämä reaktio tapahtuisi lämpötilan pitää olla yli 1200 astetta eli polttoaineen pitää SULAA että vetykaasua pääsee muodostumaan tarpeeksi. Joten jotta meidän pitäisi uskoa että vetyräjähdys on mahdollinen meidän pitää uskoa että reaktorin polttoainelementit sulivat ja jollain ihmeen tavalla ainoastaan Pro Hanhikiven Pj sai tietää tästä 3 vuotta myöhemmin. Samalla meidän pitäisi uskoa että Venäläiset onistuivat korjamaan laitoksen samantien koska tuo oletettu räjähdys ei vaikuttanut kaupalliseen tuotantoon, päinvastoin laitos oli onnettomuus vuonna tuottavampi kuin sitä ennen ja sen jälkeen se teki tuotantoennätyksen.
Stefa, hyvä huomio. Lisäksi vety voi räjähtää vain, jos se saa hapettimen jostain. Hapettimeksi käyvät esimerkiksi happi, kloori ja etenkin fluori. Happea ei tuolla putkistossa kuitenkaan ollut saatavilla.