Kuvia, videota, audiota ja robottien liikettä. Black Forest Labsin uusi FLUX 3 on suunniteltu luomaan ja ymmärtämään niitä kaikkia yhden ja saman mallin sisällä. Videomalli on tällä hetkellä varhaisessa testivaiheessa, ja avoimen painotuksen (open-weight) versio on suunniteltu julkaistavaksi myöhemmin.
FLUX-tuoteperhe tunnetaan jo entuudestaan kuvien luomisesta. FLUX 3:n myötä saksalainen tekoäly-yritys laajentaa toimintaansa videoihin natiivilla äänellä, kuvankäsittelyyn sekä fyysisten toimintojen ennustamiseen.
Tavoitteena on kehittää yksi perusmalli, joka ymmärtää, miltä maailma näyttää, miten se liikkuu ja miltä se kuulostaa, sen sijaan että kuvia, videoita ja audiota käsiteltäisiin erillisinä ongelmina. Äänitapahtuman tulisi vastata videoleikkeen tapahtumia, esineen liikkeen tulisi heijastaa sen painoa, ja jokaisen uuden kuvaruudun tulisi olla uskottava jatkumo edelliselle.
Black Forest Labsin mukaan videomalli pystyy luomaan kerralla jopa 20 sekunnin mittaisia leikkeitä äänellä varustettuna. Se tukee tekstistä videoksi -toimintoa (text-to-video), kuvasta videoksi -toimintoa (image-to-video), videosta videoksi -muuntamista, olemassa olevien leikkeiden jatkamista, monikielistä dialogia sekä hallittuja siirtymiä avainruutujen välillä.

Sama tekoäly voisi myös ohjata robotteja
Julkaisun odottamattomin osa löytyy ruudun ulkopuolelta. FLUX 3:n varhaista versiota on laajennettu FLUX-mimiciksi, joka on Mimic Roboticsin kanssa kehitetty robottien liikemalli, jota on testattu Audin tuotantolaitoksilla.
Perusteluna on, että mallin, joka kykenee luomaan vakuuttavaa videota, täytyy jo ymmärtää jotain kosketuksesta, liikkeestä, painosta sekä syystä ja seurauksesta. Tätä samaa ymmärrystä voidaan sitten käyttää ennustamaan, miten robottikäden tulisi toimia fyysisessä maailmassa.
Black Forest Labs kertoo, että Audilla käyttöön otetut järjestelmät ovat käsitelleet pehmeitä ja joustavia esineitä, joita oli vaikea automatisoida perinteisesti ohjelmoiduilla robottisoluilla. Väitteet tulevat yrityksiltä itseltään, ja FLUX-mimic on edelleen varhaisessa vaiheessa.
Avoimen painotuksen malli luvattu
FLUX 3 Video on nyt saatavilla varhaisessa testikäytössä (early access). Kuvien luomisen, kuvankäsittelyn ja lisäversioiden odotetaan tulevan käyttöön asteittain testauksen jälkeen. Black Forest Labs aikoo myös julkaista FLUX 3 Devin, joka on avoimen painotuksen multimodaalinen perusmalli sisällöntuotantoon ja toimintojen ennustamiseen. Tarkkaa julkaisupäivää ei ole ilmoitettu.
Tämä tarkoittaa, että FLUX 3:sta voi tulla muutakin kuin vain yksi suljettu videopalvelu. Kehittäjät voisivat rakentaa samalle perustalle sovelluksia kuville, videoille, audiolle ja robotiikalle. Suunnitelma avoimesta painotuksesta koskee kuitenkin tulevaa malliversiota, ei koko varhaisvaiheen videopalvelua.

Black Forest Labsin alustavissa sisäisissä arvioinneissa testaajat pitivät FLUX 3:a parempana kuin Grok Imagine Videota 69 prosentissa tapauksista, Runway Gen-4.5:tä 77 prosentissa ja Luma Ray 3.2:ta 93 prosentissa tapauksista. FLUX 3 saavutti myös 52 prosentin suosioasteen Gemini Omni Flashia ja Seedance 2.0:aa vastaan. Black Forest Labs korostaa, että arvioinnit ovat alustavia ja että sekä malli että testausympäristö ovat edelleen kehitysvaiheessa.
Jos projekti lunastaa lupauksensa, FLUX 3:sta voi tulla poikkeuksellinen hybridi: luova studio kuville ja videoille, äänimalli ja perusta robottien ohjaukselle, kaikki saman järjestelmän sisällä.







