DeepSeek V4 Flash 0731 – halpa flash-malli, joka haastaa koko frontier-kategorian
📅 Päivitetty 9.8.2026
DeepSeek julkaisi 31.7.2026 päivitetyn DeepSeek V4 Flash 0731 -mallin sekä Hugging Facessa että virallisessa API:ssa, joka siirtyi samalla julkiseen betaan. Julkaisu on herättänyt poikkeuksellisen paljon huomiota, sillä kyseessä ei ole uusi arkkitehtuuri eikä suurempi malli – vaan sama 284B-parametrinen MoE-malli kuin huhtikuun preview-versiossa, joka on koulutettu uudelleen post-training-vaiheessa. Silti malli päihittää DeepSeekin oman V4 Pro -preview-version jokaisessa julkaistussa agenttibenchmarkissa, kolmasosalla hinnasta.
Tässä artikkelissa käymme läpi, mitä 0731-päivitys oikeasti muuttaa, mitä benchmark-luvut tarkoittavat käytännössä, mitä yhteisö mallista sanoo – ja miksi tämä voi olla yksi vuoden 2026 merkittävimmistä hintasuorituskyky-järkytyksistä.
Mikä on DeepSeek V4 Flash?
DeepSeek V4 Flash on DeepSeekin V4-malliperheen kevyt versio. Arkkitehtuuriltaan se on 284B-parametrinen sekoitepohjainen (MoE) malli, josta aktivoituu vain 13B parametria jokaista tokenia kohden. Konteksti-ikkuna on 1 miljoona tokenia.
Teknisesti malli rakentuu DeepSeek V4 -teknisen raportin kuvaamalle arkkitehtuurille:
- Jokaisessa MoE-kerroksessa on 1 jaettu asiantuntija ja 256 reititettyä asiantuntijaa, joiden välidimensio on 2048
- Jokaista tokenia kohden aktivoituu 6 reititettyä asiantuntijaa
- Kolme ensimmäistä MoE-kerrosta käyttää hajautusreititystä (hash routing)
- Huomio on hybridi: Compressed Sparse Attention (CSA) ja Heavily Compressed Attention (HCA) yhdistettynä
- Perinteiset residual-yhteydet on korvattu Manifold-Constrained Hyper-Connections (mHC) -ratkaisulla, laajennuskertoimella 4 ja 20 Sinkhorn-Knopp-iteraatiolla
- Esikoulutus tehtiin yli 32 biljoonalla tokenilla Muon-optimoijalla
- Multi-token prediction -syvyys on 1
DeepSeekin teknisen raportin keskeinen tehokkuusluku – 27 % yksittäisen tokenin inferenssin FLOPeista ja 10 % KV-välimuistista verrattuna DeepSeek V3.2:een 1M kontekstissa – koskee kuitenkin V4 Prota, ei Flashia. Flash on suunniteltu nopeutta ja kustannustehokkuutta silmällä pitäen.
Hugging Facen repoon on kirjattu 304B parametria. Tämä sisältää DSpark-spekulatiivisen dekoodauksen draft-moduulin, joka on kiinnitetty 284B-pohjan päälle – sama rakenne kuin DeepSeek-V4-Flash-DSpark-julkaisussa.
Mitä 0731-päivitys muuttaa?
Julkaisun tärkein viesti on se, että arkkitehtuuri ja koko ovat ennallaan. Parannukset tulevat yksinomaan uudelleenkoulutuksesta – siis post-training-reseptistä, ei uudesta suunnittelusta. Tämä on sinällään merkittävä viesti: se tarkoittaa, että samalla laskennallisella perustalla voidaan saavuttaa huomattavasti parempia tuloksia, jos koulutusdata ja vahvistusoppiminen (RL) ovat kohdallaan.
API-puolella tärkein muutos on, että deepseek-v4-flash tukee nyt natiivisti Responses API -formaattia ja on sovitettu Codex-ympäristöön. V4 Pro -API:ta, sovellusta ja web-mallia ei päivitetty tässä yhteydessä.
Malli tukee reasoning_effort-asetusta arvoilla low, high ja max. DeepSeek suosittelee agenttiseen käyttöön lämpötilaa 1.0 ja top_p-arvoa 0.95. High- ja max-tiloissa mallista voi saada jopa 384 000 tokenia ulostuloa – huomattava määrä pitkille agenttiajoille.
Yksi mielenkiintoinen tekninen yksityiskohta: mallissa ei ole lainkaan Jinja-chat-templatea. Sen sijaan DeepSeek toimittaa encoding/-kansion, jossa on encode_messages– ja parse_message_from_completion_text-funktiot. Tämä kertoo siitä, että malli on suunniteltu ensisijaisesti API-käyttöön ja agenttiympäristöihin, ei perinteiseen chattiin.
Hinta: kolmasosa Prosta
DeepSeekin hinnoittelusivun mukaan deepseek-v4-flash maksaa:
- 0,14 dollaria / 1M input-tokenia (cache miss)
- 0,0028 dollaria / 1M input-tokenia (cache hit)
- 0,28 dollaria / 1M output-tokenia
- 2500 samanaikaista yhteyttä (concurrency)
Vertailun vuoksi V4 Pro maksaa 0,87 dollaria / 1M output-tokenia. Flash on siis noin kolmasosan hinnasta. Cache-hit-hinta on käytännössä olematon – 0,0028 dollaria miljoonalta tokenilta mahdollistaa äärimmäisen halvat toistuvat agenttisilmukat.
Mediumin analyysi laskee, että keskimääräinen Flash-sessio maksaa noin 14 senttiä. Tämä on merkittävä luku, kun sitä vertaa legacy-mallien deployment-kustannuksiin, jotka voivat nousta satoihin dollareihin per asennus. Kirjoittaja arvioi, että Flashin hinta on 10–20 prosenttia legacy-tasosta – ja kysyy aiheellisesti, onko premium-markkina enää elinkelpoinen tällaisella hintaerolla.
Huomionarvoista: osa medioista on sekoittanut hinnat keskenään. Esimerkiksi Mediumin analyysissä mainitaan 0,28 dollaria inputista ja 0,87 dollaria outputista – nämä ovat itse asiassa V4 Pron hinnat. Oikeat Flash-hinnat ovat siis vielä selvästi halvemmat kuin useimmat analyysit antavat ymmärtää.
Benchmarkit: flash-malli, joka ei käyttäydy flash-mallin tavoin
Alla olevat luvut ovat DeepSeekin itse raportoimia 0731-mallikortista. Vertailussa ovat V4 Flash 0731, huhtikuun preview-versio, V4 Pro (Preview), GLM-5.2 ja Claude Opus 4.8.
| Benchmark | V4 Flash 0731 | V4 Flash (Preview) | V4 Pro (Preview) | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | – | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
Luvuista voi tehdä useita johtopäätöksiä.
Ensinnäkin parannus preview-versioon on valtava. DeepSWE:ssä nousu on 7,3:sta 54,4:ään – lähes kahdeksankertainen. Cybergymissä 38,7:stä 76,7:ään, Terminal Benchissä 61,8:sta 82,7:ään. Tällaiset harppaukset samalla arkkitehtuurilla ovat poikkeuksellisia ja viittaavat siihen, että huhtikuun preview oli kaukana siitä, mihin malli pystyy.
Toiseksi Flash päihittää V4 Pron (Preview) jokaisessa julkaistussa agenttibenchmarkissa. Terminal Benchissä 82,7 vs 72,1, NL2Repo:ssa 54,2 vs 38,5, DeepSWE:ssä 54,4 vs 12,8. Tämä on omituista: kevyemmän mallin pitäisi olla heikompi. Kun Flash maksaa kolmasosan Pron hinnasta ja silti voittaa sen testeissä, on joko Pron post-training keskeneräinen, Flashin koulutusresepti onnistunut poikkeuksellisen hyvin, tai mallien välillä on jotain rakenteellista eroa, jota ei vielä ymmärretä.
Kolmanneksi suhde Opus 4.8:aan on mielenkiintoinen. Opus voittaa kaikissa vertailuissa, mutta marginaalit vaihtelevat rajusti: Agents’ Last Examissa ero on vain 0,5 pistettä (25,2 vs 25,7), DeepSWE:ssä 3,6 pistettä, kun taas NL2Repo:ssa ero on peräti 15,5 pistettä (54,2 vs 69,7). Koodauspainotteisissa tehtävissä Opus on siis yhä selvästi edellä, mutta agenttisessa autonomiassa ero on kutistunut lähes olemattomaksi.
On myös syytä huomauttaa, että Code Agent -tehtävät ajettiin DeepSeek Harnessin minimal-tilassa, jota ei ole julkaistu. DSBench-FullStack (68,7) ja DSBench-Hard (59,6) ovat sisäisiä testisarjoja. Agenttipisteet ovat vahvasti harness-riippuvaisia, joten riippumattomat ajot voivat poiketa merkittävästi.
Yhteisön reaktiot: innostusta, skeptisyyttä ja ”markkinakrakkaus”-puhetta
Yhteisön reaktiot ovat jakautuneet odotetusti. Redditin r/LocalLLaMA-keskustelussa julkaisua kutsuttiin jo etukäteen ”seuraavaksi markkinakrakkaukseksi”, ja osa käyttäjistä vertasi tilannetta tammikuun 2025 DeepSeek R1 -shokkiin, joka kaatoi teknologiaosakkeita.
Toisaalta skeptikot muistuttavat, että benchmarkit eivät ole koko totuus. Yksi käyttäjä r/hermesagent-yhteisössä huomauttaa, että mallilla on edelleen korkea hallusinaatiopistemäärä: ”Sillä on edelleen melko korkea hallusinaatiopiste, ja olen huomannut, että mallit, jotka pärjäävät hyvin tuossa benchmarkissa, eivät toimi hyvin tietyissä työnkuluissa.” Tämä on tärkeä huomautus: agenttibenchmarkit mittaavat tehtävän suorittamista, eivät luotettavuutta pitkäkestoisessa käytössä.
Toinen käyttäjä kritisoi mallin ohjeiden noudattamista: ”Suurin ongelma preview-versiossa oli sen kyvyttömyys noudattaa sääntöpromptteja ja taitoja. Näyttää siltä, että mitä tahansa teet, se jättää ne huomiotta.” Jos tämä ongelma on siirtynyt 0731-versioon, se on merkittävä puute agenttikehityksessä, jossa mallin pitää seurata tarkkoja ohjeita.
Kolmas näkökulma tulee käyttäjältä, joka vertasi mallia pienempiin malleihin: ”Se ei tuntunut paljon paremmalta, se on noin 3.6 35B -tasoa. DeepSeek Flash toimii hyvin koodaustehtävissä.” Tämä viittaa siihen, että mallin vahvuus saattaa olla kapea: koodaus kyllä, mutta yleinen päättely ei välttämättä yllä samalle tasolle.
Flash vs Pro -paradoksi: mitä DeepSeek on tehnyt toisin?
Se, että Flash päihittää Pron agenttibenchmarkeissa, on analyysien kiinnostavin yksityiskohta. Mediumin kirjoittaja Ezekiel Njuguna arvelee, että DeepSeek on todennäköisesti käyttänyt fiksumpia synteettisen datan generaattoreita ja parannettuja vahvistusoppimistekniikoita. Mutta hän nostaa esiin myös kaksi rakenteellisempaa vaihtoehtoa:
- Tehokkaampi token-reititys: Flash saattaa reitittää tokeninsa tehokkaammin kuin Pro, saavuttaen saman oikeellisuuden selvästi vähemmillä operaatioilla.
- Tool-käytön koulutus: Flash on mahdollisesti koulutettu erityisesti tekemään hyvää käyttöä laajasta työkaluvalikoimasta – mikä on agenttimaailmassa lähellä oikeaa arkkitehtuurimurrosta.
Kumpikaan selitys ei ole vielä vahvistettu, mutta molemmat ovat tutkimusyhteisölle kiinnostavia. Jos token-reititys on todella tehokkaampi Flashissa kuin Prossa, se horjuttaa yksinkertaista ”isompi on parempi” -logiikkaa ja voi vaikuttaa siihen, miten tulevia malleja koulutetaan.
DSpark: spekulatiivinen dekoodaus vauhdittamassa
Mallin mukana toimitettu DSpark-moduuli on spekulatiivisen dekoodauksen ratkaisu, joka nopeuttaa generointia. DSpark-paperin mukaan se on 60–85 prosenttia nopeampi per-käyttäjä-generoinnissa V4 Flashissa verrattuna MTP-1-perustasoon samalla kokonaissuorituskyvyllä.
Käyttöönotto on yksinkertainen: vLLM:ssä DSpark aktivoidaan yhdellä lipulla:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Tämä tekee mallista entistä houkuttelevamman agenttiajoihin, joissa latenssi on kriittinen tekijä. Kun hinta on jo valmiiksi matala, nopeus on se toinen puoli yhtälöä, joka ratkaisee käytännön sovelluksissa.
Omakäyttö: MIT-lisenssi ja kaksi hyvin erilaista reittiä
DeepSeek V4 Flash 0731 on MIT-lisensoitu ja ungated – painot ovat vapaasti ladattavissa ilman hyväksyntää. Tämä avaa kaupallisen omakäytön (on-premise) ilman juridisia esteitä.
Käytännössä käyttöönottoon on kaksi hyvin erilaista reittiä:
API-reitti on lähes kaikkien ulottuvilla. Hinta on niin matala, että startupit, indie-kehittäjät ja sisäiset alustatiimit voivat pyörittää agenttisilmukoita ilman GPU-budjettia. 2500 yhteyden concurrency-raja riittää jo varsin vaativaan käyttöön.
Omakäyttö on huomattavasti kalliimpaa. Vaikka vain 13B parametria aktivoituu tokenia kohden, kaikki asiantuntijat pysyvät muistissa. DeepSeekin vLLM-esimerkki palvelee mallia yhdellä 4×GB300-nodilla. Unslothin dynaamiset GGUF-muunnokset vievät 8-bittisenä 162 GB ja 3-bittisenä 103 GB, ja käytännössä tarvitaan noin 110 GB yhdistettyä RAM- ja VRAM-määrää. Omakäyttö sopii siis keskisuurille ja suurille yrityksille, joilla on palvelinklusteri – tai yhdelle hyvin varustetulle työasemalle aggressiivisella kvantisoinnilla.
Kriittinen näkökulma: luvut ovat DeepSeekin omia
On tärkeää painottaa, että kaikki tässä esitetyt benchmark-luvut ovat DeepSeekin itse raportoimia, ajettuna julkaisemattomalla harnessilla. Agenttibenchmarkit ovat tunnetusti harness-herkkiä: pieniä eroja arviointiprosessissa voi riittää muuttamaan pisteitä merkittävästi.
Lisäksi osa testeistä (DSBench-FullStack, DSBench-Hard) on täysin sisäisiä, eikä niitä voi riippumattomasti toistaa. Kunnes riippumattomat toimijat – kuten Artificial Analysis, LMArena tai suuret tutkimusryhmät – ajavat omat arvionsa, lukuihin kannattaa suhtautua varauksella.
Yhteisössä on myös huomautettu, että mallin hallusinaatiopisteet ovat edelleen korkeat ja että ohjeiden noudattaminen oli preview-versiossa ongelmallista. Nämä ovat asioita, joita benchmarkit eivät aina tavoita.
Mitä tämä tarkoittaa suomalaiselle kehittäjälle ja yritykselle?
Suomalaiselle pienelle tiimille, startupille tai yksittäiselle kehittäjälle 0731-päivitys avaa käytännössä uuden luokan mahdollisuuksia. Aiemmin agenttipohjaisen kehitystyökalun rakentaminen frontier-mallille oli kallista: kuukausittaiset API-laskut saattoivat karata satoihin tai tuhansiin euroihin, jos agentti pyöri jatkuvasti. Flashin hinnalla sama työnkulku maksaa murto-osan.
Konkreettinen esimerkki: jos agenttisi käsittelee keskimäärin 2 miljoonaa input-tokenia ja 200 000 output-tokenia per päivä, kustannus Flashilla on noin 0,34 dollaria päivässä (2M × 0,14 + 0,2M × 0,28) – eli noin 10 dollaria kuukaudessa. Vastaava työmäärä Opus 4.8:lla maksaisi moninkertaisesti. Tällainen hintaero muuttaa laskelmaa siitä, kannattaako agentteja rakentaa ollenkaan – ja se on koko julkaisun ydin.
Kannattaa myös huomioida, että malli on MIT-lisensoitu. Jos yrityksellä on käytössään palvelinklusteri tai hyvin varustettu työasema (noin 110 GB muistia 3-bittisellä kvantisoinnilla), mallin voi ajaa myös kokonaan omalla infrastruktuurilla. Tämä on kiinnostava vaihtoehto erityisesti aloilla, joilla datan on pysyttävä EU:n sisällä – esimerkiksi terveydenhuollossa, julkishallinnossa tai rahoituksessa.
Mihin mallia kannattaa käyttää – ja mihin ei?
Kokemuksen ja benchmarkkien perusteella DeepSeek V4 Flash 0731 sopii erityisen hyvin:
- Koodausagentit ja terminaalityöskentely: vikojen etsintä, testien kirjoittaminen, refaktorointi, repo-tason navigointi
- Työkaluja käyttävät agentit: API-kutsut, tiedostojen käsittely, selainautomaatio, CI/CD-avusteiset työnkulut
- Suurivolyyminen tekstin käsittely: dokumenttien tiivistäminen, luokittelu, datan rikastaminen – erityisesti kun cache-hit-hinta (0,0028 $/1M) tekee toistuvista ajoista lähes ilmaisia
- Prototyypit ja MVP:t: kun hinta on näin matala, kynnys kokeilla erilaisia agenttiarkkitehtuureja on olematon
Sen sijaan malli ei ole ensimmäinen valinta, kun tarvitaan:
- Pitkäkestoista, monivaiheista päättelyä – tässä Opus 4.8 on edelleen vahvempi, kuten Mediumin analyysi toteaa
- Erityisen luotettavaa ohjeiden noudattamista: yhteisöraportit preview-versiosta kertoivat ongelmista sääntöprompttien noudattamisessa, ja vaikka 0731 on parantunut, tämä kannattaa testata omassa työnkulussa
- Täydellistä tarkkuutta hallusinaatioherkissä tehtävissä – korkea hallusinaatiopistemäärä tarkoittaa, että faktapohjaisissa tuotannoissa tarvitaan varmentavia kerroksia
Mitä tämä tarkoittaa käytännössä?
DeepSeek V4 Flash 0731 on merkittävä julkaisu useista syistä:
Hinta-laatusuhde muuttaa taloutta. Jos malli todella toimii lähellä Opus 4.8:aa agenttitehtävissä kolmasosalla hinnasta, se pakottaa koko alan miettimään hinnoittelua uusiksi. Mediumin analyysi ennustaa tästä seuraavan hintakollapsin syklin – ja toteaa, että legacy-yritysten premium-logiikka toimii vain, jos suorituskyvyn hinta on korkea.
Agenttiset työnkulut ovat se alue, jossa malli loistaa. Terminal Bench, Cybergym ja AutomationBench mittaavat juuri sitä, mitä autonomiset agentit tekevät oikeasti: navigoivat terminaalissa, korjaavat vikoja, käyttävät työkaluja. Tämä on alue, jolla hinta ratkaisee – ja täällä Flash on nyt uskottava vaihtoehto.
Koodauksessa Opus on yhä edellä. NL2Repo-ero (15,5 pistettä) on liian suuri väitettäväksi, että Flash olisi Opus-tasoa koodauksessa. Yhteisöraportit tukevat tätä: malli toimii hyvin koodaustehtävissä, mutta ei ole ihmeidentekijä.
Self-host-väylä on auki. MIT-lisenssi ja ungated-painot tarkoittavat, että suomalaisetkin yritykset voivat halutessaan pyörittää mallia omalla infrastruktuurillaan – jos muistibudjetti riittää.
Yhteenveto
DeepSeek V4 Flash 0731 on yksi vuoden 2026 merkittävimmistä hintasuorituskyky-julkaisuista. Se ei tuo uutta arkkitehtuuria, mutta se osoittaa, että post-training-reseptillä voidaan saavuttaa valtavia parannuksia samalla pohjalla – ja että flash-luokan malli voi haastaa frontier-mallit agenttisessa autonomiassa murto-osalla hinnasta.
Skeptikot muistuttavat kuitenkin aiheellisesti, että luvut ovat valmistajan omia, harness on julkaisematon ja hallusinaatio- sekä ohjeiden noudattamisen ongelmat saattavat yhä vaivata. Riippumattomat testit ratkaisevat, onko kyseessä todellinen paradigmamuutos vai hyvin markkinoitu päivitys.
Omalla kohdallamme malli on jo käytössä – tämäkin artikkeli on kirjoitettu DeepSeek V4 Flashilla. Se on ollut nopea, kustannustehokas ja yllättävän hyvä pitkissä agenttitehtävissä. Se ei ole Opus-tasoa kaikessa, mutta se ei myöskään yritä olla – se on vain reilusti parempi kuin sen hintalappu antaa ymmärtää.
Linkit ja lähteet
- DeepSeek-V4-Flash-0731 Hugging Facessa
- DeepSeek API -hinnoittelu
- DeepSeek V4 -tekninen raportti (arXiv)
- DSpark-paperi (arXiv)
- Marktechpost: DeepSeek Upgrades DeepSeek-V4-Flash-0731
- Medium: What The Hell, DeepSeek?
- Unsloth: DeepSeek V4 -dokumentaatio