Ox Alpha -mysteeri ratkesi: Z.AI:n GLM-5.3-Flash on täällä — frontier-tason koodaus kymmenesosahintaan
Elokuun 2026 kummallisin tekoälytarina sai nimensä 26. elokuuta: anonyymisti OpenRouterissa ja OpenCodessa viikon pyörinyt mysteerimalli Ox Alpha paljastui kiinalaisen Z.AI:n (tunnetaan myös nimellä Zhipu) GLM-5.3-Flash -mallin esiversioksi. Paljastus on yksi vuoden merkittävimmistä avoimen lähdekoodin tekoälyjulkaisuista: kyseessä on natiivi multimodaalinen malli, jonka painot julkaistiin MIT-lisenssillä ja joka tarjoaa koodaus- ja agenttisuorituskykyä kymmenesosahintaan verrattuna raskaampiin lippulaivamalleihin.
Ox Alpha -viikko: näin anonyymi malli valloitti OpenRouterin
Ox Alpha ilmestyi OpenRouteriin ja OpenCode-koodaustyökaluun 20. elokuuta ilman kehittäjänimeä. OpenRouter kuvasi sitä ”stealth-malliksi”: kolmannen osapuolen tarjoama malli, jonka kehittäjä halusi pysyä anonyyminä esikatselun ajan. Malli oli ilmainen, siinä oli miljoonan tokenin konteksti ja se otti vastaan tekstiä, kuvia ja videota.
Ilmaisuus ja suorituskyky tekivät tehtävänsä: muutamassa päivässä Ox Alphan päivittäinen kysyntä nousi 70,3 miljoonaan pyyntöön ja 5,93 biljoonaan tokeniin (24.8.), ja se nousi OpenRouterin viikon käytetyimmäksi malliksi 558 mallin joukosta. Ennen kuin nimi paljastettiin, mallia oli käytetty 343,5 miljoonaa kertaa. Jopa Stripen toimitusjohtaja Patrick Collison, jonka yhtiö oli sopinut OpenRouterin ostosta, kehui mallia ”erittäin vaikuttavaksi”.
Kun kukaan ei tunnustanut omistajuutta, yhteisö alkoi ratkoa arvoitusta. Redditin r/LocalLLaMA-ryhmässä tehtiin tokenisointianalyysiä noin 60 testijonolla: emoji, korea, matematiikan merkinnät ja kyrilliset kirjaimet vastasivat GLM-malliperheen tokenisointia siellä, missä muut perheet poikkesivat. Yhdessä palvelimelta vuotaneen GLM-5.3-spesifisen virheilmoituksen kanssa todisteet osoittivat kiinalaiseen Z.AI:hin – tosin arvaukset menivät villiksi: Microsoftin MAI, Xiaomi, DeepSeek ja jopa Google kiersivät huhuissa.
Paljastus: GLM-5.3-Flash, ”frontier-tason älykkyys flash-hintaan”
Bloomberg vahvisti 26. elokuuta Z.AI:n ilmoituksen: Ox Alpha oli uuden GLM-sarjan mallin esiversio. Samana päivänä OpenRouteriin ilmestyi virallinen z-ai/glm-5.3-flash -merkintä, julkaisublogi ja MIT-lisensoidut painot Hugging Facessa.
GLM-5.3-Flash on ensimmäinen natiivisti multimodaalinen malli GLM-5-sarjassa: sekoiteasiantuntija-arkkitehtuuri (MoE), jossa on 320 miljardia parametria yhteensä mutta vain 18 miljardia aktiivista tokenia kohden. Konteksti-ikkuna on 1 048 576 tokenia ja maksimivastaus 131 072 tokenia. Malli on koulutettu 30 biljoonan tokenin multimodaalisella aineistolla, ja se käyttää ensimmäistä kertaa GLM-sarjassa hybridiarkkitehtuuria, jossa harva ja lineaarinen huomio yhdistyvät – Z.AI:n mukaan tämä leikkaa huomiokomputation määrää noin 3x ja KV-välimuistin kokoa 4,4x verrattuna isoon GLM-5.3:een. Miljoonan tokenin kontekstissa välimuisti on se, joka maksaa.
Suorituskykylukemat koodauksessa ja agenteissa ovat lähellä kärkeä: Terminal-Bench 2.1:ssä 84,3 (Claude Opus 4.8: 85,0), DeepSWE v1.1:ssä 63,4 verrattuna GLM-5.2:n 46,2:een ja AutomationBenchissa 48,8 verrattuna 26,2:een. Z.AI:n omassa Code Benchissä maksimivaivalla malli jää vain puolen pisteen päähän Claude Opus 4.8:sta (29,0 vs 29,5). Riippumaton Artificial Analysis antaa sille älykkyysindeksissä 57 pistettä – saman tason kuin GPT-5.6 Terra ja Gemini 3.7 Flash – mutta noin kymmenesosalla kustannuksesta.
Hinta, nopeus ja varaukset
Listahinnat ovat 0,15 dollaria miljoonalta syöttötokenilta ja 0,50 dollaria miljoonalta tuotostokenilta (välimuistiosumat 0,03 dollaria). Julkaisutarjous antaa 50 prosentin alennuksen 9. syyskuuta asti, eli 0,075 ja 0,25 dollaria. Vertailun vuoksi Z.AI:n lippulaiva GLM-5.3 maksaa 1,40/4,40 dollaria – Flash on siis kymmenesosa siitä, mihin Z.AI:n markkinointi viittaakin.
Kolme varausta, jotka yhteisö nosti esiin:
- ”Flash” tarkoittaa hintatasoa, ei nopeutta. Artificial Analysis mittaa tuottonopeudeksi 50,2 tokenia sekunnissa, kun samankokoisten avoimien mallien mediaani on noin 67 ja DeepSeek V4 Flash pääsee 119,4:ään. Malli aloittaa vastauksen nopeasti (1,47 s ensimmäiseen tokeniin), mutta suoratoistaa hitaasti.
- Omatoiminen hostaus ei onnistu millään järkevällä laitteistolla: FP8-painot ovat noin 328 gigatavua, joten yksi 128 gigatavun DGX Spark ei riitä; käytännössä tarvitaan datakeskusluokan rautaa tai kvantisointia useammalle koneelle.
- Hinta on määräaikainen. 50 prosentin alennus päättyy 9. syyskuuta, ja jo nyt kuusi kymmenestä OpenRouterin palveluntarjoajasta veloittaa täyden listahinnan. Kontekstin ylärajat vaihtelevat myös tarjoajittain (262 144:stä 1 310 720:een tokeniin), mikä voi yllättää tuotantokäytössä.
Lisäksi kannattaa muistaa tietosuoja: anonyymin Ox Alpha -jakson aikana OpenRouterin ehdot sallivat nimettömän tarjoajan säilyttää pyynnöt ja vastaukset, eikä salassapitoa voitu taata. Sensitiivistä dataa ei kannattanut silloin eikä nyt lähettää tuntemattomien tarjoajien reiteille.
Taustalla myös GLM-5.3 -lippulaiva
Ox Alpha -viikon taustalla on toinenkin iso julkaisu: Z.AI toi 14. elokuuta markkinoille lippulaivamallinsa GLM-5.3:n (743 miljardia parametria), jonka se kertoi joidenkin suorituskykytestien perusteella kilpailevan Anthropicin kehittyneimmän Fable 5 -mallin kanssa. GLM-5.3 käyttää samaa perusmallia kuin GLM-5.2 – kaikki parannukset on saatu aikaan pelkällä jälkitreenauksella, mikä on itsessään osoitus vahvistusoppimisen voimasta. Malli on listattu kärkeen CyberGym-kyberturvakokeessa haavoittuvuuksien löytämisessä, ja hyödyntämisketjun päässä se yli kaksinkertaistaa GLM-5.2:n tulokset. GLM-5.3:n painot on julkaistu avoimesti, mutta räätälöidyllä lisenssillä, joka on suunnattu erityisesti hyperskaalaajia vastaan – toisin kuin Flashin puhdas MIT.
Stealth-julkaisut eivät ole uusi ilmiö Z.AI:lle: yhtiö testasi aiemmin GLM-5:tä anonyymisti ”Pony Alpha” -nimellä, ja kaikki kuuden kuukauden aikana paljastuneet stealth-mallit (Zhipun GLM-5, Xiaomin MiMo-V2-Pro, Ant Groupin Ling-2.6-flash ja Meituanin LongCat-2.0) ovat olleet kiinalaisten laboratorioiden tekemiä. Malli on siis yhtä paljon esittely kiinalaisesta siru- ja infrapinosta kuin itse mallista.
Kiinalaiset sirut ja avoimen lähdekoodin aalto
Paljastuksen erikoisin yksityiskohta on rauta: Z.AI kertoo, että koko anonyymi testijakso ajettiin kiinalaisilla tekoälysiruilla. Yhtiö väittää saavuttaneensa ”NVIDIAn valtavirran GPU:ita vastaavan suorituskyvyn ja tokenkohtaisen kustannuksen” ja että infrastruktuuria ohjasi osittain malli itse: GLM-5.3 toimi infrastruktuuriagenttina optimoiden sitä palvelinta, joka palveli mallia. Lukuja ei ole riippumattomasti vahvistettu, mutta suunta on selvä: kiinalaiset sirut pystyvät nyt skaalautuvaan päättelyyn frontier-luokan malleille.
GLM-5.3-Flash ei ole elokuun ainoa iso avoimen lähdekoodin julkaisu. Alibaba avasi 12. elokuuta Qwen3.8-Maxin painot – ensimmäistä kertaa Max-sarjasta: 2,4 biljoonan parametrin MoE-malli (95 miljardia aktiivista), joka on sijoittunut viidenneksi Text Arenassa ja toiseksi Vision Arenassa. Qwenin painot toimitetaan kuitenkin räätälöidyllä lisenssillä (ei Apache 2.0), johon liittyy liikevaihtokynnyksiä, ja avoimesta versiosta on riisuttu kuvan syöttö ja miljoonan tokenin konteksti. GLM-5.3-Flashin MIT-lisenssi on tässä joukossa poikkeuksellisen salliva.
Mitä tämä tarkoittaa suomalaiselle yrittäjälle
Käytännön johtopäätökset ovat yksinkertaisia:
- Koodaukseen ja agenttityöhön tuli uusi kustannustehokas vaihtoehto. GLM-5.3-Flash on OpenRouterissa heti käytettävissä, ja Z.AI:n GLM Coding Plan -tilaukset (Lite 18 $, Pro 80 $, Max 168 $ kuukaudessa) tarjoavat kolminkertaisen kiintiön GLM-5.3:een verrattuna – ja ruuhka-ajan ulkopuolella pisteet kuluvat puoleen tahtiin.
- Avoimen lähdekoodin malli ei automaattisesti tarkoita ilmaista tai helppoa. 328 gigatavun painot ja datakeskusvaatimus tarkoittavat, että pk-yritykselle käytännöllinen reitti on API, ei oma infra.
- Promo hämärtää hinnoittelua. Jos suunnittelet työnkulun GLM-5.3-Flashin varaan, laske kustannukset listahinnalla (0,15/0,50), et tarjoushinnalla, joka päättyy 9. syyskuuta.
- Tämä on jatkumoa, jonka trendi on selvempi kuin yksikään yksittäinen julkaisu: kiinalaiset laboratoriot (Z.AI, Alibaba, DeepSeek, Moonshot) lähestyvät länsimaisten lippulaivojen suorituskykyä murto-osalla hinnasta ja julkaisevat painoja avoimesti. Neljä edellistä stealth-mallia kuudessa kuukaudessa ovat kaikki olleet kiinalaisia.
Näin pääset kokeilemaan: OpenRouterissa malli on käytössä tunnisteella z-ai/glm-5.3-flash (entinen stealth/ox-alpha on poistettu, joten vanhaan tunnisteeseen viittaava koodi kannattaa päivittää). Suoraan Z.AI:n API:sta malli toimii kehittäjädokumentaation mukaisesti, ja GLM Coding Plan -tilaajille se on jo täysin käytettävissä. Jos haluat vain kokeilla nopeasti, OpenRouterin chat-näkymä riittää – ja muista, että 50 prosentin alennus on voimassa 9. syyskuuta asti.
Mitä yhteisö sanoo
r/LocalLLaMA-ryhmän sormenjälkianalyysi oli mallin tunnistamisen avain, ja TechCrunchin mukaan Reddit oli jakautunut: yksi ketju julisti, että malli ”ei voi olla kiinalainen”, toinen ilmaisi ”korkeaa luottamusta” siihen, että se on. Paljastuksen jälkeen keskustelu on siirtynyt kolmeen käytännön asiaan: hitaaseen tuottonopeuteen, 328 gigatavun omatoimihostauksen seinään ja päättyvään alennukseen.
Kehittäjäkokemukset ilmaiselta viikolta olivat pääosin positiivisia. Coursiv-analyysin mukaan yksi käyttäjä kertoi Ox Alphan löytäneen kaksi aitoa bugia Python-projektista, jotka muut auditointityökalut olivat ohittaneet; toinen vertaili sen koodausta DeepSeek V4 Flashiin ja piti GLM:n versiota tarkempana ja vähemmän bugisena. Stripen Patrick Collison tiivisti tunnelman: ”erittäin vaikuttava”.
Tiivistelmä
Ox Alpha -mysteeri oli samalla yksi vuoden tehokkaimmista markkinointitempauksista: ilmainen viikko toi Z.AI:lle 343,5 miljoonaa pyyntöä, kehittäjien luottamuksen ja valtavan näkyvyyden – ja dataa mallin käyttäytymisestä ennen virallista julkaisua. GLM-5.3-Flash on sen jälkeen osoittautunut aidosti merkittäväksi julkaisuksi: frontier-tason koodaus- ja agenttisuorituskyky kymmenesosahintaan, natiivisti multimodaalinen ja MIT-lisensoiduin painoin. Yrittäjän kannattaa seurata tätä sarjaa: seuraava iso kysymys on, kuinka nopeasti amerikkalaiset laboratoriot vastaavat hinta- ja avoimuuspaineeseen.