Mainos:

Kiinalainen Kimi K3 voittaa yhdysvaltalaiset huippumallit useissa tekoälytesteissä

Päivitetty 2.8.2026, Julkaistu 17.7.2026 – Kirjoittaja Toimitus

Kiinalainen Moonshot AI julkaisee Kimi K3 -mallin – avoimen tekoälymallin, joka yhtiön omien testien mukaan voittaa tai vastaa yhdysvaltalaisia huippumalleja, kuten GPT-5.6 Solia ja Claude Fable 5:tä, useissa käytännön suorituskykytesteissä, erityisesti koodauksessa, verkkotyöskentelyssä ja agenttitehtävissä.

Kimi K3:ssa on 2,8 biljoonaa parametria, tuki sekä tekstille että kuville ja miljoonan tokenin konteksti-ikkuna. Yhtiö kutsuu sitä maailman ensimmäiseksi avoimeksi malliksi tässä kokoluokassa. Se on jo saatavilla Kimi.com-sivuston, Kimi Workin, Kimi Coden ja Kimi API:n kautta.

Moonshot AI:n teknisessä blogissa yhtiö myöntää, että Kimi K3 laahaa edelleen Claude Fable 5:n ja GPT-5.6 Solin perässä kokonaisvaltaisessa käyttäjäkokemuksessa. Samaan aikaan se väittää, että malli saavuttaa huipputason suorituskyvyn omissa arvioinneissaan ja suoriutuu usein muita testattuja järjestelmiä paremmin käytännön tehtävissä.

Yhtiön koodaustesteissä Kimi K3 johtaa muun muassa Program Bench- ja SWE Marathon -testeissä, ja on lähes tasoissa GPT-5.6 Solin kanssa Terminal Bench 2.1 -testissä. Agenttitesteissä Kimi K3 on kärjessä muun muassa Automation Benchissä, SpreadsheetBench 2:ssa ja BrowseCompissa, kun taas Claude Fable 5 ja GPT-5.6 Sol johtavat edelleen joissakin laajemmissa mittauksissa.

Mainos:
Koodausvertailu, jossa verrataan Kimi K3:a GPT-5.6 Soliin ja Claude Fable 5:een.
Moonshot AI:n omat koodaussuorituskykytestit Kimi K3:lle.
Agentti- ja tuottavuusvertailu, jossa verrataan Kimi K3:a yhdysvaltalaisiin huippumalleihin.
Moonshot AI:n omat agentti- ja tuottavuussuorituskykytestit Kimi K3:lle.

Rakennettu pitkiin tehtäviin, ei vain lyhyisiin vastauksiin

Moonshot AI kuvailee Kimi K3:a malliksi pitkiin työnkulkuihin: koodaamiseen laajoissa koodikannoissa, automaatioon, tietotyöhön ja tehtäviin, jotka sisältävät kuvakaappauksia ja visuaalista palautetta. Julkaisumateriaali mainitsee muun muassa laskentaytimien optimoinnin, pelikehityksen, sirujen suunnittelun ja tutkimukseen liittyvät laskennat.

Teknisesti K3 on rakennettu yhtiön omien Kimi Delta Attention- ja Attention Residuals -ratkaisujen varaan. Delta Attentionin sanotaan tarjoavan jopa 6,3 kertaa nopeamman vastausten generoinnin erittäin pitkissä konteksteissa, kun taas Attention Residualsin kerrotaan tuovan noin 25 prosenttia paremman koulutustehokkuuden alle 2 prosentin lisäkustannuksilla. Edeltäjäänsä Kimi K2:een verrattuna yhtiö puhuu noin 2,5 kertaa paremmasta vastineesta laskentateholle.

Julkaisuhetkellä Kimi K3 toimii oletusarvoisesti maksimaalisella ”ajattelupanoksella” (thinking effort). Alemmat ja ylemmät tilat on tarkoitus tuoda myöhemmissä päivityksissä. Moonshot AI kirjoittaa myös tekevänsä yhteistyötä pilvikumppaneiden ja avoimen lähdekoodin ylläpitäjien kanssa vakaan käyttöönoton varmistamiseksi. Mallin täydet painot (weights) on tarkoitus julkaista 27. heinäkuuta 2026.

Rajoituksista yhtiö myöntää, että laatu voi heikentyä, jos agenttiympäristö ei palauta täyttä päättelyhistoriaa, että K3 tekee joskus omia päätöksiään epäselvissä tehtävissä, ja että se tuntuu edelleen heikommalta kuin Claude Fable 5 ja GPT-5.6 Sol puhtaassa käyttäjäkokemuksessa.

Siitä huolimatta viesti on terävä: avoin kiinalainen malli absoluuttisessa huippukokoluokassa väittää nyt voittavansa suljetut yhdysvaltalaiset huippumallit useissa niistä vertailuarvoista, jotka ohjaavat käytännön tekoälyn kehitystä.

Mainos:
Seuraa keskustelua
Ilmoita minulle
guest

Kun lähetät kommentin, käsittelemme nimimerkkiäsi, sähköpostiosoitettasi (ei julkaista), teknisiä tietoja ja kommentin sisältöä. Kommentti tarkastetaan automaattisesti ja tarvittaessa toimituksellisesti. Lue tietosuojaseloste ja kommentointiperiaatteet.

0 Kommentit
Vanhimmat
Uusimmat Äänestetyimmät

Venäjä varoittaa vastatoimista eurooppalaisia aluksia vastaan

Julkaistu tänään 00:12 – Kirjoittaja Toimitus

MOSKOVA (Xinhua) -- Venäjän presidentti Vladimir Putin varoitti keskiviikkona, että Venäjä vastaa samalla mitalla, jos länsimaat takavarikoivat sen kauppa-aluksia.

Puhuessaan Tyynenmeren laivaston harjoitusten päätösvaiheessa Putin sanoi, että joidenkin maiden viranomaiset yrittävät rajoittaa venäläisten taloudellisten toimijoiden alusten ja rauhanomaisten alusten liikkumista kansainvälisen merioikeuden vastaisesti.

Hänen huomautuksensa tulivat sen jälkeen, kun Euroopan laivastovoimat olivat pysäyttäneet ja tarkastaneet niin sanotun varjolaivaston aluksia, muun muassa Italian johtamissa Euroopan unionin operaatioissa Välimerellä.

Heinäkuun lopussa EU asetti myös satamaanpääsykiellon 41 uudelle varjolaivaston alukselle ja otti käyttöön pakolliset ilmoitusvaatimukset nesteytetyn luonnonkaasun (LNG) kuljetusalusten myynnistä Venäjälle.

Mainos:

Putin nosti esiin myös Japanin pakotteet

Putin ilmaisi myös huolensa Aasian ja Tyynenmeren alueen kasvavasta jännityksestä, jonka hän yhdisti Japanin Venäjälle asettamiin pakotteisiin.

Valitettavasti näemme muutoksia asemissa, ja haluaisin korostaa, etteivät nämä muutokset ole olleet meidän puoleltamme millään tavalla provosoituja, Putin sanoi.

Kolme tekoälyjulkistusta sytytti hintasodan huippumallien välille

Julkaistu eilen 21:56 – Kirjoittaja Toimitus

Kolme tekoälymaailman suurinta mallijulkistusta on saapunut lähes samanaikaisesti. Alibaba avaa jättiläismäisen Qwen3.8:n painot, SpaceXAI lanseeraa Grok 4.6:n ja DeepSeek päivittää V4 Pro -mallinsa – jokaisen suorituskyky on huipulla tai sen tuntumassa, mutta hinnoilla, jotka tekevät länsimaisten premium-mallien perustelemisesta yhä vaikeampaa.

Julkaisupäivästä on tullut poikkeuksellisen tiivis voimannäyttö. Kehittäjät saavat käyttöönsä avoimen kiinalaisen mallin, jossa on 2,4 biljoonaa parametria, yhdysvaltalaisen haastajan, jonka valmistaja sanoo parantuneen jyrkästi ilman hinnannousua, sekä uuden DeepSeek-version, joka on hinnoiteltu niin alas, että se näyttää haastavan koko markkinan liiketoimintamallin.

Lanseeraukset eivät tarkoita, että OpenAI, Google ja Anthropic olisivat äkkiä jääneet jälkeen. Viimeisimmät vertailuluvut tulevat pitkälti yrityksiltä itseltään, mallit on optimoitu osittain eri tehtäviin ja riippumaton testaus vie aikaa. Suuntaa on kuitenkin vaikea olla huomaamatta: kehittynyt tekoäly on siirtymässä kalliista ja niukasta resurssista markkinaksi, jossa useat huippumallit kilpailevat hinnalla, avoimuudella ja käytännön suorituskyvyllä.

Qwen avaa suurimman mallinsa

Tämänpäiväinen Qwen-uutinen ei ole Qwen3.8-Maxin ensimmäinen esittely. Alibaba julkaisi kaupallisen Max-version jo elokuun alussa. Uutta on se, että Qwen3.8-2.4T-A95B:n painot on nyt julkaistu avoimesti Hugging Face- ja ModelScope-alustoilla.

Mainos:

Nimi kuvaa sen arkkitehtuuria: mallissa on yhteensä 2,4 biljoonaa parametria, mutta se aktivoi noin 95 miljardia kerrallaan. Se käyttää Mixture-of-Experts-rakennetta, jossa verkon eri osia käytetään tehtävästä riippuen. Tämä mahdollistaa valtavan mallin rakentamisen ilman, että koko järjestelmää käytetään jokaiseen laskutoimitukseen.

Virallisessa mallikortissaan Qwen-tiimi toteaa, että tämä on ensimmäinen Max-luokan malli, jonka painot ovat avoimia. Pelkkää tekstiä käsittelevällä versiolla on 262 144 tokenin natiivi konteksti-ikkuna, ja se voidaan laajentaa hieman yli miljoonaan. Sen ajaminen täydessä mittakaavassa vaatii edelleen huomattavia resursseja; ”avoimuus” tarkoittaa pääasiassa sitä, että yritykset, tutkijat ja mallialustat voivat tarkastaa, mukauttaa ja ottaa sen käyttöön itse, ei sitä, että se mahtuisi vaivatta tavalliselle kannettavalle tietokoneelle.

Qwenin omat testit antavat vaihtelevan mutta vaikuttavan kuvan. Malli saa 93,0 pistettä PaperBenchissä, joka testaa kykyä toisintaa tutkimusta, ja 86,6 pistettä Terminal Bench 2.1:ssä. SWE-bench Pro -testissä se jää Fable 5:n ja hieman Opus 4.8:n taakse. Qwen ei voita jokaista testiä, mutta se on samassa liigassa kalleimpien suljettujen vaihtoehtojen kanssa – ja sen painot ovat ladattavissa.

Grok 4.6: Lisää tehoa samaan hintaan

SpaceXAI:n Grok 4.6 on päivän selkein perinteinen malli-ensi-ilta. Yritys kuvailee sitä merkittäväksi askeleeksi ylöspäin Grok 4.5:stä koodauksessa, pitkäkestoisessa agenttityössä ja vaativissa ammatillisissa tehtävissä. Malli on saatavilla API:n, Grok Buildin, Cursorin ja muiden yhdistettyjen palveluiden kautta.

Yhtiön omassa vertailutaulukossa Grok nousee DeepSWE-testissä 54,0 prosentista 65,9 prosenttiin, kun taas sen GDPVal-AA v2 -tulos nousee 1 526:sta 1 753:een. Jälkimmäinen testi pyrkii mittaamaan taloudellisesti arvokasta tietotyötä. Grok 4.6 saavuttaa myös 69,9 prosenttia CursorBenchissä ja 57,5 prosenttia APEX-Agentsissa.

Tärkein luku ei välttämättä löydy vertailutaulukosta. Hinta pysyy 2 dollarissa miljoonaa syötetokenia kohden ja 6 dollarissa miljoonaa tulostokenia kohden. Tämä vastaa Qwen3.8:n hintaa OpenRouterissa ja on selvästi OpenAI:n ja Anthropicin kalleimpien mallien alapuolella.

DeepSeek vie hintapaineen pisimmälle

DeepSeek V4 Pro 0813 on tuotantoversio malliperheestä, jota on näytetty ennakkoversiona keväästä lähtien. DeepSeekin päivitetty API-dokumentaatio ilmoittaa miljoonan tokenin konteksti-ikkunan ja jopa 384 000 tokenin maksimitulosteen. Malli voi toimia näkyvän päättelyn kanssa tai ilman sitä, ja se tukee työkalukutsuja, rakenteellisia tulosteita sekä rajapintoja, jotka muistuttavat sekä OpenAI:ta että Anthropicia.

Version saataville tuonut OpenRouter kertoo DeepSeekiin viitaten, että Terminal Bench 2.1 nousi 72,1:stä 87,9:ään. DeepSWE-testissä malli nousee 12,8:sta 62,7:ään ja kyberturvallisuustestissä CyberGym 52,7:stä 83,3:een. Hypyt ovat dramaattisia, mutta niihin on syytä suhtautua toimittajan väitteinä, kunnes useammat riippumattomat testaajat ovat ajaneet saman version.

Hintaa on vaikeampi sivuuttaa. DeepSeekin virallinen hinnasto ilmoittaa 0,435 dollaria miljoonaa syötetokenia kohden (ilman välimuistiosumaa) ja 0,87 dollaria miljoonaa tulostokenia kohden. Yhtiö varoittaa myös, että suunnitteilla on merkittävä hinnannousu, mikä tekee nykyisestä tasosta sekä kilpailuaseen että mahdollisesti rajoitetun ajan voimassa olevan näyteikkunan.

Kuusi kertaa halvempi – silti huipun tuntumassa

Yksinkertaistettu hintavertailu osoittaa, kuinka nopeasti markkina on muuttunut. Miljoonan syötetokenin ja miljoonan tulostokenin työkuorma maksaa 8 dollaria Grok 4.6:lla tai avoimella Qwen-mallilla OpenRouterin kautta. DeepSeek V4 Prolla kokonaissumma on 1,305 dollaria – yli kuusi kertaa vähemmän, ilman välimuistihyötyjä.

Samassa hetkessä Gemini 3.1 Pro maksaa noin 14 dollaria samasta yhdistelmästä, Claude Sonnet 5 maksaa 12 dollaria, Claude Opus 5 maksaa 30 dollaria ja GPT-5.6 Sol 35 dollaria. Hinnat vaihtelevat alustojen välillä, pitkät kontekstit voivat maksaa enemmän, eikä token ole sama asia kuin ratkaistu ongelma. Kalliimpi malli voi silti tulla kokonaisuutena halvemmaksi, jos se tarvitsee vähemmän yrityksiä tai tuottaa oikean tuloksen suoraan.

Chatbotista digitaaliseksi työvoimaksi

Silmiinpistävintä näissä kolmessa julkaisussa on se, mitä yritykset valitsevat mitattavaksi. Perinteiset tietotestit ovat säilyneet, mutta painopiste on agenteissa, jotka voivat työskennellä terminaaleissa, muokata suuria koodikantoja, käyttää työkaluja, seurata pitkiä tapahtumaketjuja ja suorittaa tehtäviä, jotka vievät tunteja tai päiviä.

Tämä tarkoittaa suurempaa hyötyä – mutta myös suurempaa riskiä. Väärin vastaava chatbot tuottaa huonoa tekstiä. Agentti, jolla on pääsy tiedostoihin, terminaaliin, selaimeen ja pilvipalveluihin, voi aiheuttaa todellista vahinkoa, jos se tulkitsee ohjeen väärin tai joutuu ohjeistushyökkäyksen kohteeksi. Laskevat hinnat tekevät tehokkaasta tekoälystä helpommin saavutettavaa, mutta tekevät samalla turvallisuuskysymyksistä kriittisempiä yhä useammalle käyttäjälle.

Kuluttajille kehitystä on kuitenkin vaikea kuvailla muuna kuin suotuisana hetkenä. Kaksi kiinalaista malliperhettä ja yhdysvaltalainen haastaja painostavat samanaikaisesti markkinaa, jota muutama länsimainen yritys on hallinnut pitkään. Voittajaa ei ole vielä ratkaistu. Mutta hintasota on todellinen, ja pääsylippu tekoälyn huippusarjaan on halventunut huomattavasti yhdessä päivässä.

PST varoittaa alaikäisten nopeasta islamistisesta radikalisoitumisesta

Julkaistu eilen 19:35 – Kirjoittaja Toimitus

Norjan suojelupoliisi PST havaitsee islamististen ekstremistien välisten siteiden tiivistymistä ja varoittaa, että alaikäiset voivat radikalisoitua aiempaa nopeammin. Terroriuhka säilyy kohtalaisella tasolla, mutta virasto toteaa islamistisen ekstremismin kehityksen kulkevan väärään suuntaan.

Politiets sikkerhetstjeneste, Norjan suojelupoliisi (PST), on rekisteröinyt lisääntynyttä verkostoitumista islamististen ekstremistien keskuudessa Norjassa. Vastaterrorismin johtaja Ane Mannsåker Roald sanoo, että yksilöiden väliset yhteydet ovat yleistyneet ja heidän verkostonsa laajentuneet.

PST ei sano itse ryhmän kasvaneen. Sen sijaan se arvioi, että näissä ympäristöissä jo valmiiksi aktiiviset ihmiset kytkeytyvät tiiviimmin toisiinsa – kehitys, joka voi ajan mittaan lisätä heidän kykyään radikalisoida ja rekrytoida muita.

Samaan aikaan yhä useammat alaikäiset altistuvat ekstremistiselle islamistiselle ideologialle. PST:n mukaan nuoret voivat nykyään radikalisoitua huomattavasti nopeammin kuin mitä virasto on aiemmin nähnyt.

Mainos:

Graafinen väkivalta tavoittaa nuoret puhelinten välityksellä

PST viittaa myös siihen, että alaikäiset kuluttavat verkossa kuvia ja videoita vakavasta väkivallasta ja kidutuksesta. Materiaali tavoittaa heidät suoraan heidän matkapuhelimiinsa, ja Roaldin mukaan tämä vaarantaa kynnyksen laskemisen sille, mitä pidetään normaalina.

Virasto on myös havainnut korkeaa iskuihin liittyvää aktiviteettia islamististen ekstremistien keskuudessa länsimaissa ja Euroopassa viime vuosina. Norjassa se näkee yksilöitä, jotka tukevat ja hyväksyvät väkivallan ja joilla on islamistisia ekstremistisiä vakaumuksia.

Norjan terroriuhka on edelleen luokiteltu kohtalaiseksi, tasolle kolme viisiportaisella asteikolla. Silti Roald pelkää, että tiiviimmät verkostot voivat ajan myötä vahvistaa sekä kykyä että halua toteuttaa terrori-iskuja Norjassa.

Kirk-murhakiista etenee suoraan väittelyyn

Julkaistu eilen 18:42 – Kirjoittaja Toimitus

Candace Owens ja kommentaattori Andrew Wilson kohtaavat perjantaina suorassa väittelyssä Charlie Kirkin murhaan liittyvistä todisteista. Väittelyä markkinoidaan 300 000 dollarin tapahtumana, ja sen moderaattorina toimii Patrick Bet-David. Molemmat osapuolet voivat tarkistaa toistensa väitteiden todenperäisyyden reaaliajassa.

Tapahtuma järjestetään 14. elokuuta Owensin studiossa poikkeuksellisen julkisen rahasta, paikasta, moderaattorista ja väittelysäännöistä käydyn neuvottelun jälkeen. Owens kirjoittaa, että Wilson itse tarjosi 300 000 dollaria väitelläkseen joko hänen tai asianajaja Baron Colemanin kanssa heidän omilla alustoillaan, ja että hän hyväksyi tarjouksen.

Wilson on myös vahvistanut tapaamisen toteutuvan. X-postauksessaan hän julkaisi videon tulevasta väittelystä. Virallinen julkaisugrafiikka nimeää väittelijöiksi Owensin ja Wilsonin, moderaattoriksi Bet-Davidin ja päivämääräksi perjantain 14. elokuuta.

Kyseessä ei ole vaaliväittely tai yleinen kahden konservatiivihahmon välinen yhteenotto. Keskustelun keskiössä on kysymys siitä, kuka ampui Charlie Kirkin ja miten syytettyä Tyler Robinsonia vastaan esitettyjä julkisia todisteita tulisi arvioida.

Mainos:

Kaksi sovittamatonta selitystä

Owens on useiden kuukausien ajan väittänyt, että Robinsonista tehtiin syntipukki ja ettei virallinen selitys pidä paikkaansa. Hän on muun muassa korostanut kuvia ja videosekvenssejä, jotka hänen mukaansa herättävät kysymyksiä Utah Valley Universityn katolla olleen henkilön tunnistamisesta.

Aiemmassa erään tällaisen kattofragmentin tarkastelussa todettiin, että videon resoluutio ei mahdollistanut luotettavaa kasvojentunnistusta ja ettei materiaali yksinään voinut määrittää henkilön henkilöllisyyttä. Robinsonia vastaan on nostettu syyte tapauksessa, mutta syyllisyyskysymystä ei ole vielä lopullisesti ratkaistu.

Wilson on päinvastaista mieltä. Hän väittää, että todisteiden kokonaisuus osoittaa kohti Robinsonia ja ettei Owens ole esittänyt riittävästi tukea väitteelle, jonka mukaan liittovaltion toimijat olisivat lavastaneet hänet. Julkisessa neuvottelussa Wilson muotoili keskeiseksi kysymykseksi sen, tekevätkö todisteet todennäköisemmäksi sen, että Robinsonista tehtiin liittovaltion syntipukki vai sen, ettei näin tehty.

https://www.youtube.com/watch?v=HGtMfbePDKk

Avointa neuvottelua suuren yleisön edessä

Tie väittelyyn on ollut täynnä henkilökohtaisia hyökkäyksiä ja muuttuvia vastatarjouksia. Elokuun 7. päivänä Wilson kirjoitti voivansa hyväksyä 500 000 dollaria ja ehdotti yhteensä miljoonan dollarin pottia, neutraalia maaperää sekä kolmen ja puolen tunnin väittelyä pitkillä ristikuulusteluilla. Tuolloin hän halusi moderaattoriksi Michael Knowlesin ja hylkäsi vaatimuksen esiintyä Turning Point USA:n edustajana.

Lopullinen toteutus eroaa tuosta vastatarjouksesta useissa kohdissa. Summaksi on nyt merkitty 300 000 dollaria, tapaaminen järjestetään järjestäjien mukaan Owensin studiossa, ja yrittäjä sekä podcast-isäntä Patrick Bet-David toimii moderaattorina. Owensin mukaan tämä noudattaa Wilsonin alkuperäistä julkista tarjousta ja ehtoja, joista osapuolet myöhemmin sopivat avoimessa neuvottelussaan X:ssä.

Markkinointi lupaa myös molempien osapuolten suorittamaa reaaliaikaista faktojen tarkistusta. Ratkaisevaa on, tuleeko lähetyksestä lähteiden ja aikajanojen testi vai jälleen uusi verkkoriita, jossa seuraajamäärät painavat enemmän kuin materiaali. Sekä Owens että Wilson ovat rakentaneet suuret yleisöt konfrontaatioon perustuvilla formaateilla, ja heidän tapahtumaa koskevia postauksiaan on katsottu jo satoja tuhansia kertoja.

Väittely ei voi korvata oikeussalia

Perjantain tapaaminen saattaa selventää, mihin todisteisiin osapuolet tarkalleen vetoavat ja mitä väitteitä he ovat valmiita puolustamaan kysymysten alla. Se ei kuitenkaan voi määrittää Robinsonin juridista syyllisyyttä. Tuo kysymys kuuluu oikeuteen, missä todisteita voidaan testata prosessisääntöjen mukaisesti ja todistajia kuulla valan alla.

Väittelyn arvo ei siten piile niinkään siinä, kuka julistetaan voittajaksi, vaan siinä, voidaanko keskeiset väitteet jäljittää aitoihin videoihin, asiakirjoihin, todistajanlausuntoihin ja teknisiin löydöksiin. Aloitusaikaa ja lopullista lähetyslinkkiä ei ollut vielä ilmoitettu julkaistussa grafiikassa.