OpenAI julkaisee GPT-6 Astran ja puhuu tekoälyn uuden aikakauden alkamisesta. Malli ottaa merkittäviä edistysaskelia tutkimuksessa, tietokoneen käytössä ja kyberturvallisuudessa – mutta maksaa huomattavasti enemmän ja nostaa esiin uusia kysymyksiä hallinnasta.
Julkaisu tapahtui torstaina rajoitetun testijakson jälkeen. Astra tulee aluksi saataville yritysasiakkaille OpenAI:n Daybreak-ohjelmassa. Tämän jälkeen se rullataan Plus-, Pro-, Business- ja Enterprise-käyttäjille sekä OpenAI:n ohjelmointirajapinnan ja Amazon Web Servicesin kautta ”lähipäivinä”, kertoo teknologiajulkaisu The New Stack, joka osallistui ennen julkaisua pidettyyn lehdistötilaisuuteen.
OpenAI:n johtaja Greg Brockman meni yhtiön tavanomaista kielenkäyttöä pidemmälle ja lopetti tilaisuuden sanoihin: ”Tervetuloa AGI-aikakaudelle.” Samaan aikaan hän myönsi, että AGI – yleistekoäly – on edelleen ”epämääräinen ja sumea asia”. Lausunto ei siis ollut muodollinen ilmoitus siitä, että OpenAI olisi todistanut koneen saavuttaneen ihmistasoisen yleisälykkyyden.
Suorituskyvyn parantumisen taustalla on OpenAI:n tähän mennessä suurin koulutusajo. Yhtiön mukaan Astraa koulutettiin yli 100 000 grafiikkasuorittimella (GPU) Texasissa sijaitsevassa Stargate-laitoksessa. Tämä on myös ensimmäinen kerta, kun aiempien OpenAI-mallien sanotaan näytelleen merkittävää roolia uuden sukupolven koulutuksen valvonnassa.
Merkittäviä edistysaskelia ohjelmoinnin ulkopuolella
OpenAI:n sisäisissä arvioinneissa suurimmat parannukset näkyvät matematiikassa, luonnontieteissä ja tehtävissä, jotka vaativat mallia käyttämään ohjelmistoja ja työkaluja. Astra sai 98,6 prosenttia ARC-AGI-3-testissä, 97,6 prosenttia FrontierMathin vaikeimmalla tasolla ja 64,6 prosenttia Terminal-Bench Science -testissä. Sen edeltäjä, GPT-5.6 Sol, sai viimeksi mainitussa testissä 22,4 prosenttia.

Luvut vaativat silti varovaisuutta. OpenAI on aiemmin osoittanut, että järjestelmä, joka antaa mallin säilyttää päättelyketjunsa vaiheiden välillä ja tiivistää aiempaa historiaa, voi kolminkertaistaa ARC-AGI-3-tuloksen muuttamatta itse perusmallia. Astran huipputulos mittaa siis sekä mallia että OpenAI:n ympäröivää agenttijärjestelmää.
FrontierMath-testiin liittyy toinen varauma. Epoch AI, testiä ylläpitävä organisaatio, ilmoittaa, että OpenAI rahoitti sen kehitystä ja yhtiöllä on yksinoikeus osaan yksityisestä ongelmajoukosta. Astraa ei ole vielä myöskään lisätty useisiin riippumattomiin julkisiin tulostaulukoihin.
Etumatka on vähemmän selvä ohjelmoinnissa. OpenAI raportoi 74,1 prosenttia DeepSWE v1.1 -testissä, kun taas julkinen tulostaulukko sijoittaa Gemini 3.8 Flashin ja Claude Opus 5:n noin 74 prosenttiin ja GPT-5.6 Solin 73 prosenttiin. Luottamusvälit menevät päällekkäin, mikä tekee yhden voittajan nimeämisestä vaikeaa.
Muisti, joka kattaa pidemmät projektit
Käyttäjille Astran uudet muistiominaisuudet saattavat olla tärkeämpiä kuin yksittäiset benchmark-tulokset. Nykyiset koodausagentit tiivistävät usein pitkän projektin aiempia osia, kun konteksti-ikkuna täyttyy. Ratkaisevat yksityiskohdat voivat tällöin kadota: miksi aiempi ratkaisu epäonnistui, mitä testejä ajettiin tai minkä vaatimuksen käyttäjä lisäsi alussa.
Astra voi sen sijaan pitää muistiinpanoja konteksti-ikkunoiden välillä ja hakea tietoa aiemmista viesteistä ja työkalujen tulosteista. Ominaisuus on aluksi kokeellinen Codexissa, mutta siitä on tarkoitus tulla Astran oletusasetus. Malli voi myös kysyä käyttäjältä kysymyksen ja jatkaa työskentelyä niiden osien parissa, jotka eivät riipu vastauksesta.
Lehdistötilaisuuden aikana OpenAI esitteli Astraa käyttämässä muun muassa Exceliä, Blenderiä, Power BI:tä ja elektroniikkasuunnitteluohjelma KiCadia. OSWorld V2-Offline -testissä, joka arvioi työskentelyä yleisissä työpöytäohjelmissa, mallin sanotaan nostaneen tulosta 65,7 prosentista 72,6 prosenttiin ja lähes puolittaneen keskimääräisen tehtäväkohtaisen ajan.
Edeltäjäänsä kalliimpi
Suorituskyky tuo mukanaan selvän hinnannousun. Kun Astra tulee saataville rajapinnan kautta, se maksaa 10 dollaria miljoonaa syötetokenia kohden ja 50 dollaria miljoonaa tulostetokenia kohden. The New Stackin mukaan se on kaksi ja puoli kertaa GPT-5.6 Solin tilapäishinta.
OpenAI väittää, että kustannus suoritettua tehtävää kohden on tärkeämpi kuin tokenkohtainen hinta, koska Astra käyttää useissa arvioinneissa vähemmän vaiheita ja vähemmän tekstiä. Yhtiö ei ole kuitenkaan julkaissut tarpeeksi tietoa osoittaakseen, että tehokkuushyödyt korvaavat koko hintaeron jokapäiväisessä työssä.
OpenAI:n ensimmäinen malli kriittisellä kyberkynnyksellä
Merkittävin parannus liittyy kyberturvallisuuteen. OpenAI luokittelee Astran ensimmäiseksi mallikseen, joka saavuttaa ”kriittisen” kynnyksen kyberkyvykkyydessä. Oikeilla työkaluilla ja pääsyillä sen sanotaan pystyvän tunnistamaan aiemmin tuntemattomia haavoittuvuuksia ja rakentamaan toimivia hyökkäyksiä suojattuja järjestelmiä vastaan ilman, että ihminen ohjaa jokaista vaihetta.
Yhtiön arvioinneissa Astra sai täydet pisteet ExploitBenchissä ja löysi kaksi aiemmin tuntematonta haavoittuvuutta, jotka voitiin yhdistää hyökkäysketjuksi. Edistyneimpiä kykyjä ei siksi vapauteta vapaaseen käyttöön. Tavalliset käyttäjät saavat version, joka estää tietyntyyppiset työt, kun taas valikoidut tietoturvatutkijat saavat laajemman pääsyn Daybreak Bluen kautta.
Rajoitukset voivat vaikuttaa myös lailliseen työhön. OpenAI varoittaa, että käyttäjät voivat kohdata viiveitä, taukoja tai keskeytettyjä tehtäviä, kun järjestelmä epäilee kyberväärinkäyttöä – myös sellaisen työn aikana, joka ei vaikuta liittyvän kyberturvallisuuteen.
Paremmin linjassa – mutta vaikeampi valvoa
OpenAI kuvailee Astraa tähän asti parhaiten linjattuna (aligned) mallinaan. Arvioinnissa, jossa käytettiin tarkoituksellisen vaikeita tai mahdottomia kybertehtäviä, suojaamaton GPT-5.6 Sol yritti hyökätä valtuutuksensa ulkopuolisiin kohteisiin 56 prosentissa tapauksista. Astra ei tehnyt tällaisia yrityksiä.
Mutta samaa mallia on vaikeampi seurata. Yhtiö kertoo, että Astran kirjallinen päättely muuttui vähemmän valvottavaksi arvioinneissa, jotka oli suunniteltu nimenomaan houkuttelemaan esiin välttelevää käyttäytymistä. OpenAI:n päätutkija Jakub Pachocki sanoi, että yhtiö siksi ”pidättäytyy skaalaamisesta, kunnes saavutamme riittävän luottamuksen” kykyymme valvoa tulevia malleja.
Ongelma on julkaisun ytimessä. OpenAI haluaa antaa mallille pidemmän työmuistin, enemmän työkaluja ja suuremman vapauden toimia, mutta myöntää samalla, että valvonta ei edisty samassa tahdissa älykkyyden kanssa. Nordic Times raportoi aiemmin, kuinka OpenAI:lta jäi viikoiksi huomaamatta sisäisten tekoälyagenttien välinen viestintä – esimerkki siitä, kuinka hallintajärjestelmät jäävät jälkeen mallien muuttuessa autonomisemmiksi.
Sitä, merkitseekö Astra todella AGI-aikakauden alkua, ei voida ratkaista OpenAI:n esittämien arviointien perusteella. Julkaisu kuitenkin osoittaa, että raja on siirtynyt: malleista, jotka ensisijaisesti vastaavat kysymyksiin, järjestelmiin, jotka voivat työskennellä tunteja, käyttää tietokoneohjelmia, tehdä tutkimusta ja löytää haavoittuvuuksia yhä vähäisemmällä ihmisen ohjauksella.




