Anthropic on julkaissut Claude Opus 5:n, uuden lippulaivamallin, joka on suunniteltu vastaamaan älykkyydeltään Fable 5 -mallia mutta maksamaan vain puolet siitä. Malli johtaa useita yhtiön testejä ja on tästä lähtien Clauden vakiovalinta vaativaan arkityöhön.
Opus 5 seuraa Opus 4.8 -mallia ja säilyttää saman API-hinnoittelun: 5 dollaria miljoonaa syötetokenia (input tokens) kohden ja 25 dollaria miljoonaa tulostetokenia (output tokens) kohden. Tämä on puolet Fable 5:n hinnasta, joka on Anthropicin kyvykkäin laajasti saatavilla oleva malli.
Julkaisu täyttää aukon edullisemman Sonnet-sarjan ja Fable-tason välillä. Anthropic kuvailee Opus 5:ttä harkitsevammaksi ja proaktiivisemmaksi malliksi, joka on rakennettu päivittäiseen työhön, kuten ohjelmointiin, tutkimukseen, analyysiin ja pitkäkestoisiin tehtäviin, joissa tekoäly käyttää työkaluja ja tarkastaa omia tuloksiaan.
Opus 5:stä tulee oletusmalli Claude Maxissa ja kyvykkäin vaihtoehto Claude Prossa. Kehittäjille se on saatavilla API-nimellä claude-opus-5. Erityisen nopeustilan (fast mode) sanotaan tarjoavan noin 2,5-kertaisen nopeuden, mutta se maksaa kaksi kertaa perushinnan verran.
Johtaa ohjelmoinnissa ja tietotyössä
Julkaisumateriaalissaan Anthropic korostaa ohjelmointia ja edistynyttä tietotyötä. Frontier-Bench-testissä, jossa tekoälyagentit ratkaisevat käytännön terminaali- ja koodaustehtäviä, malli saavutti 43,3 prosentin tuloksen. Se on enemmän kuin Fable 5 (33,7 %), GPT-5.6 Sol (34,4 %) ja Opus 4.8 (21,1 %).
CursorBench 3.2 -testissä Anthropic kertoo, että maksimiteholla toimiva Opus 5 on puolen prosenttiyksikön sisällä Fable 5:n parhaasta tuloksesta, noin puolella tehtäväkohtaisella kustannuksella. Uusi malli sijoittuu korkeimmalle myös Anthropicin vertailussa GDPval-AA-testissä, joka mittaa edistynyttä tietotyötä.
Yhtiö antaa useita esimerkkejä siitä, miten tämä näkyy käytännössä. Eräässä testissä mallia pyydettiin luomaan koneen osa uudelleen kolmiulotteisena mallina ilman valmista työkalua piirustuksen tarkasteluun. Opus 5 kirjoitti oman kuva-analyysimenetelmänsä, erotti geometrian pikseleistä ja rakensi sen jälkeen mallin FreeCAD-ohjelmistoon. Toisessa tapauksessa sen sanotaan löytäneen ohjelmointivirheen juurisyyn suositusta ohjelmistopaketista ja korjanneen poikkeustapauksen, joka oli jäänyt jopa ihmisen tekemässä korjauksessa huomaamatta.
Kolminkertainen pistemäärä uusissa ongelmissa
Hätkähdyttävin tulos tulee ARC-AGI-3-testistä, joka on suunniteltu uusien ongelmien ympärille, joissa opitut vakioilmaukset eivät riitä. Anthropicin mukaan Opus 5 saavutti 30,2 prosenttia, mikä on noin kolme kertaa enemmän kuin seuraavaksi parhaan mallin tulos vertailussa.

Yhtiö raportoi myös suurista parannuksista tietokoneen käytön ja automatisoitujen liiketoimintatehtävien testeissä. OSWorld 2.0 -testissä Opus 5:n sanotaan voittavan Fable 5:n parhaan tuloksen hieman yli kolmannesosalla kustannuksista. Zapier AutomationBenchissä se suorittaa useampia kokonaisia työnkulkuja kuin muut vertailun mallit, jopa alimmalla päättelytehon asetuksella.
Tuloksia on kuitenkin luettava yhtiön omana raportointina. Useat testeistä ovat ulkopuolisia, mutta ajot, asetukset ja valinnat on esittänyt Anthropic tuotejulkistuksen yhteydessä. Riippumattomat käyttäjät eivät ole vielä ehtineet testata, kuinka hyvin etumatka säilyy jokapäiväisessä käytössä.
Vahvempi tieteessä ja visuaalisessa tuotannossa
Anthropic raportoi parannuksista myös tieteellisessä tutkimuksessa. Opus 5 päihittää Opus 4.8:n kaikissa yhtiön biotieteiden testeissä, ja erityisen suurta edistystä on tapahtunut orgaanisessa kemiassa, bioinformatiikassa ja siinä, miten proteiinisarjojen muutokset vaikuttavat toimintaan.
Mallin sanotaan tuottavan myös edistyneempiä visuaalisia tuloksia. Esittelyissä se rakentaa muun muassa toimivan interaktiivisen tuulitunnelin ja kolmiulotteisen mallin eläinsolusta. Tämä ei tarkoita, että Opus 5 olisi kuvageneraattori FLUX 3:n tapaan; sen sijaan se osaa kirjoittaa koodia ja rakentaa interaktiivisia ympäristöjä kuvauksen perusteella.
Anthropic sijoitti aiemmin Fable 5:n uuteen Mythos-luokkaan Opuksen yläpuolelle. Opus 5:n myötä yhtiö tuo suuren osan tästä suorituskyvystä edullisempaan malliin, joka on tarkoitettu laajempaan ja säännöllisempään käyttöön.
Anthropicin mukaan turvallisempi, mutta hallusinoi hieman enemmän
Turvallisuus saa merkittävästi tilaa julkaisussa. Teknisessä järjestelmäselosteessa Anthropic kuvailee Opus 5:ttä yhtiön tähän asti parhaiten linjatuksi (aligned) malliksi. Sen sanotaan noudattavan yhtiön sääntöjä paremmin, osoittavan vähemmän harhaanjohtavaa käytöstä ja olevan vaikeampi hämätä väärinkäyttöön kuin Opus 4.8, Sonnet 5 tai Fable 5.
Raportti sisältää tärkeän varauman: Opus 5 keksii perättömiä väitteitä hieman useammin kuin Opus 4.8, vaikka se on kokonaisuudessaan tarkempi. Anthropic löysi myös harvinaisia tapauksia, joissa malli yritti kiertää turvaluokituksia tai verkkorajoituksia suorittaakseen käyttäjän tehtävän. Tällaisia tapahtumia esiintyi alle 0,01 prosentissa valvotuista suorituksista, ja yhtiö sanoo, ettei se löytänyt todisteita haitallisista toimista tai yrityksistä vältellä valvontaa.
Voi löytää haavoittuvuuksia, mutta ei rakentaa hyökkäyksiä
Kyberturvallisuudessa Opus 5 on merkittävästi edeltäjäänsä vahvempi, mutta jää edelleen rajoitetun saatavuuden Mythos 5 -mallin taakse toimivien hyökkäysten kehittämisessä. Uusi malli voi auttaa löytämään haavoittuvuuksia lähdekoodista, kun taas haavoittuvuuksien etsiminen käännetyistä ohjelmista, penetraatiotestaus ja haitallisten työkalujen kehittäminen on estetty.
Anthropic odottaa turvasuodattimiensa puuttuvan peliin noin 85 prosenttia harvemmin kuin Fable 5:n kohdalla. Kun pyyntö kuitenkin estetään Claudessa, Claude Codessa tai Claude Coworkissa, järjestelmä käyttää oletuksena Opus 4.8 -mallia. Hyväksytyt yritykset ja turvatutkijat voivat saada vähemmän rajoitetun version yhtiön kyberturvallisuuden varmistusohjelman kautta.
Opus 5 havainnollistaa, kuinka nopeasti tekoälymarkkinat liikkuvat. Edellinen Opus-malli oli vielä hiljattain Anthropicin selkeä premium-vaihtoehto. Nyt seuraajaa tarjotaan samaan hintaan suorituskyvyllä, joka useissa testeissä saavuttaa tai ylittää kaksi kertaa kalliimman Fable-tason. Jos riippumattomat kokemukset vahvistavat tulokset, hinta per suoritettu tehtävä saattaa merkitä vähintään yhtä paljon kuin mallin nimi hierarkian huipulla.





