Alle modellen

DeepSeek V4 Flash op Okou. Agent-grade codering tegen de goedkoopste prijsklasse

DeepSeek's open-weight 284B Mixture-of-Experts model met 13B actief per token. De 0731 build verslaat V4 Pro op elke agent benchmark die DeepSeek publiceerde, voor $0.14 / $0.28 per 1M tokens.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash is de efficiëntiehelft van DeepSeek's V4-generatie: een 284B-parameter Mixture-of-Experts-model dat 13B parameters per token activeert, uitgebracht onder de MIT-licentie met open weights. De 0731-build die op 31 juli 2026 werd geleverd, behield de architectuur ongewijzigd en voerde post-training opnieuw uit op agentgegevens, waardoor het DeepSeek V4 Pro (Preview) overtrof op alle negen agentbenchmarks die DeepSeek publiceerde — 82,7 tegen 72,1 op Terminal-Bench 2.1, en 54,4 tegen 12,8 op DeepSWE.

De catalogusprijs van de leverancier is $0,14 / $0,28 per 1M tokens, met cache-hits van $0,0028 / 1M en geen kosten voor cache-writes, wat het het goedkoopste redeneermodel maakt in het huidige assortiment van Okou. Het heeft een contextvenster van 1M tokens, tot 384K uitvoer, en de denkmodus is standaard ingeschakeld. Het is alleen tekst: geen visie. Kies voor Claude Sonnet 4.6 wanneer een stap afbeeldingen of het Claude Code-framework nodig heeft, en voor GPT 5.6 Luna wanneer je in plaats daarvan de goedkope tier van de OpenAI-familie wilt.

Wat is DeepSeek V4 Flash?

31 juli 2026 (DeepSeek-V4-Flash-0731, openbare bèta) · De efficiëntiehelft van de DeepSeek V4-familie: 13B actieve parameters tegenover 49B van V4 Pro, post-getraind voor agentwerk.

DeepSeek V4 Flash verscheen voor het eerst op 24 april 2026 als de kleinere helft van de V4-familie — een 284B-parameter MoE met 13B actief per token en een contextvenster van 1M-token, naast de 1.6T-parameter V4 Pro. Het verliet de preview op 31 juli 2026 als DeepSeek-V4-Flash-0731, een openbare bètaversie die de architectuur onaangetast liet en alleen de post-trainingsfase opnieuw uitvoerde, dit keer op agent-georiënteerde gegevens.

Die hertraining is het hele verhaal van de release. Volgens de eigen cijfers van DeepSeek verslaat de 0731-build V4 Pro (Preview) op alle negen gepubliceerde agentbenchmarks, terwijl ongeveer een kwart van de parameters wordt geactiveerd: Terminal-Bench 2.1 gaat van 61,8 in de Flash-preview naar 82,7, DeepSWE van 7,3 naar 54,4, Toolathlon-Verified van 49,7 naar 70,3. Verschillende daarvan liggen binnen enkele punten van Claude Opus 4.8 — 82,7 tegen 85,0 op Terminal-Bench 2.1, 25,2 tegen 25,7 op Agents' Last Exam — tegen een fractie van de prijs.

De kanttekeningen zijn het waard om duidelijk te vermelden. Elke score is door DeepSeek gerapporteerd en uitgevoerd met de DeepSeek Harness, die nog niet is uitgebracht, dus niets ervan is onafhankelijk gereproduceerd, en twee van de negen sets zijn DeepSeek's interne sets. Het model is alleen tekst, loopt achter op de grens op redeneren op universitair niveau, en blijft nog steeds achter op V4 Pro op lange-termijn meerstaps taken. De denkmodus staat standaard aan, en denk-tokens worden gefactureerd als uitvoer.

Wat is opmerkelijk aan DeepSeek V4 Flash

Koparchitectuur en functionaliteiten.

V4 Flash is een spaarzaam Mixture-of-Experts-model: 284B totale parameters met 13B geactiveerd per token, waarbij elke MoE-laag 1 gedeelde expert en 256 gerouteerde experts bevat met een intermediaire dimensie van 2048, en 6 gerouteerde experts per token worden geactiveerd. De eerste drie MoE-lagen gebruiken hash-routing, en de voorspellingsdiepte van meerdere tokens is 1. Het gepubliceerde 0731-checkpoint heeft 304B parameters omdat het een speculatief-decoderende conceptmodule bovenop de 284B-basis levert. Het ondersteunt een contextvenster van 1M tokens met tot 384K uitvoer, denk- en niet-denkmodi, en een reasoning_effort-parameter met low, high en max-niveaus. Gewichten zijn MIT-gelicentieerd en onbeperkt.

Specificaties in één oogopslag

FamilieDeepSeek V4-serie (Flash)
Parameters284B totaal / 13B actief (MoE)
ModaliteitenTekst, code (geen visie)
LicentieMIT, open gewichten
Prompt cachingOndersteund (DeepSeek)
Contextvenster1M tokens
Max uitvoerTot 384K tokens
RedeneerinspanningLaag / Hoog / Max
Leverancierslijstprijs$0,14 invoer / $0,28 uitvoer per 1M

DeepSeek V4 Flash benchmarks

Door DeepSeek gerapporteerde cijfers van de DeepSeek-V4-Flash-0731 modelkaart, uitgevoerd met de DeepSeek Harness in minimale modus met maximale redeneerinspanning (temperatuur 1.0, top_p 0.95). De harness is niet vrijgegeven, dus geen van deze is onafhankelijk gereproduceerd, en DSBench-FullStack en DSBench-Hard zijn DeepSeek's interne testsets.

Terminal-Bench 2.1agentic terminal werk; V4 Pro (Preview) 72.1
82.7
SWE-bench Geverifieerdpreview build, door leverancier gerapporteerd
79.0%
Cybergymdoor leverancier gerapporteerd
76.7
Toolathlon (geverifieerd)toolgebruik; V4 Pro (Preview) 55.9
70.3
DSBench-FullStackDeepSeek interne set
68.7
DSBench-HardDeepSeek interne set
59.6
DeepSWEomhoog van 7.3 in de preview build
54.4
NL2Reporepository constructie
54.2
Laatste examen van agentenClaude Opus 4.8 scoort 25.7
25.2

DeepSeek V4 Flash prijzen

Catalogusprijs van de provider, per 1M tokens.

Invoer$0.14
Uitvoer$0.28
Cache lezen$0.003
Cache schrijvenNiet gefactureerd

Hoe DeepSeek V4 Flash zich in de praktijk gedraagt

Waargenomen gedrag van productieve agentruns.

Agentic uitvoering

De 0731 post-training richt zich precies hierop: een terminal aansturen, tools achtereenvolgens aanroepen en een taak voltooien zonder menselijke tussenkomst. 82.7 op Terminal-Bench 2.1 en 70.3 op Toolathlon-Verified plaatsen het in de voorhoede voor de prijs.

Kostenprofiel

$0,14 / $0,28 per 1M tokens, cache hits voor $0,0028 / 1M, en cache writes worden helemaal niet gefactureerd. Dat is de goedkoopste positie in de huidige line-up en ongeveer een derde van de outputprijs van V4 Pro, dus het is het model om te richten op werk met een hoog volume.

Lange context

1M tokens in en tot 384K uit, dus repository-brede lezing en lange transcripten passen zonder chunking. Kwaliteit op lange-termijn, meerstaps agent-loops blijft achter bij V4 Pro.

Redeneerdiepte

Drie reasoning_effort-niveaus — low, high en max — ruilen latentie in voor overweging, en DeepSeek's gepubliceerde scores zijn allemaal op max. Redeneren op universitair niveau is niet de sterkte; dat is waar Claude Opus 5 en GPT 5.6 Sol vooroplopen.

Modaliteiten

Alleen tekst en code. Alles met een screenshot, een gescande PDF of een grafiek in de loop heeft een vision-model nodig, zoals Claude Sonnet 4.6 of GPT 5.6 Luna.

Beste agenttaken voor DeepSeek V4 Flash

Coderingsagenten met hoog volume

Bulk PR-review, testschrijven, lint-en-fix passes en geplande refactors, waarbij dezelfde agent honderden keren per dag draait. Met $0,28 per 1M output tokens blijven de kosten per run laag genoeg dat volume geen beperking meer is.

Terminal- en toolgestuurde automatisering

De sterkste gepubliceerde resultaten van de 0731-build zijn op terminalwerk en toolgebruik, wat precies is wat een build-fix, deployment-check of log-triage agent de hele dag doet.

Repository-brede lezing

Een venster van 1M tokens neemt een hele middelgrote repository, een lange incidenttijdlijn of een volledige set ontwerpdokumenten in één keer op, zodat een migratie- of auditagent over het geheel kan redeneren in plaats van stukje bij beetje.

De goedkope laag onder een grensverleggende orkestrator

Laat Claude Opus 5 of GPT 5.6 Sol plannen en beoordelen, en geef de vele mechanische stappen — bestanden lezen, commando's uitvoeren, patches opstellen — aan V4 Flash. U betaalt het grenspercentage alleen voor de stappen die de run bepalen.

Wanneer DeepSeek V4 Flash overslaan

Sla V4 Flash over bij alles met afbeeldingen in de lus, aangezien het geen visie heeft, en bij redeneren op universitair niveau, waar de grensmodellen nog duidelijk vooroplopen. Lange-termijn runs die coherent blijven over vele uren blijven het terrein van V4 Pro en Claude Opus. En behandel de gepubliceerde agent scores als claims van de leverancier totdat de DeepSeek Harness wordt geleverd: benchmark ze op uw eigen repository voordat u een productie-agent overzet.

DeepSeek V4 Flash versus andere modellen

DeepSeek V4 Flash vs DeepSeek V4 Pro

Zelfde familie, tegenovergestelde afweging. Pro is het 1.6T vlaggenschip met 49B actief per token; Flash activeert 13B en kost een derde van de uitvoerprijs van Pro. Op DeepSeek's gepubliceerde agent benchmarks scoort de 0731 Flash build nu hoger dan V4 Pro (Preview) op alle negen, dus de reden voor Pro is diepte in lange meerstaps redenering in plaats van agent doorvoer. V4 Pro wordt niet langer aangeboden op Okou — de pagina hier is referentiemateriaal.

DeepSeek V4 Flash vs GPT 5.6 Luna

Beide zijn de goedkope laag van hun familie en beide draaien op het Codex-framework. Luna is multimodaal en wordt ondersteund door OpenAI's ecosysteem; Flash is alleen tekst, open-weight, kost minder dan een kwart van Luna's uitvoerprijs en behaalt veel sterkere gepubliceerde agent-benchmarkscores. Kies Luna wanneer je visie of OpenAI-specifiek gedrag nodig hebt, Flash wanneer het werk code en tools betreft.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6 is een kernagentmodel met visie, het Claude Code-framework en de tool-routing betrouwbaarheid van Anthropic; Flash is een kostenbesparend, tekst-alleen model tegen ongeveer een vijftigste van de uitvoerprijs van Sonnet. Houd Sonnet op de stappen die een run bepalen en geef Flash het volume eronder.

Conclusie: moet je DeepSeek V4 Flash gebruiken?

DeepSeek V4 Flash is de goedkoopste manier om een competente coderingsagent uit te voeren op Okou: frontier-adjacent agent benchmarks, een 1M-tokenvenster en $0.28 per 1M outputtokens. Controleer de cijfers van de leverancier op uw eigen repository, houd visie en de moeilijkste redenering elders, en het is moeilijk te verslaan op kosten per voltooide taak.

Veelgestelde vragen

Wat is het contextvenster van DeepSeek V4 Flash?

1M tokens in, en tot 384K tokens output per antwoord. DeepSeek beveelt het volledige 384K outputplafond aan op de high en max redeneringsinspanningsniveaus.

Hoeveel kost DeepSeek V4 Flash?

De catalogusprijs van de leverancier is $0,14 per 1M invoertokens en $0,28 per 1M uitvoer, met cachehits van $0,0028 per 1M en geen kosten voor cachewrites. Op Okou bevindt het zich in de $ prijscategorie, de goedkoopste van de vier. DeepSeek heeft een piekurenbeleid aangekondigd dat de eigen catalogusprijzen zou verdubbelen tussen 09:00-12:00 en 14:00-18:00 Beijing-tijd; dit is nog niet van kracht.

Is DeepSeek V4 Flash beter dan DeepSeek V4 Pro?

Op de negen agent benchmarks die DeepSeek publiceerde voor de 0731 build, ja: het scoort hoger dan V4 Pro (Preview) op elk van hen, terwijl het 13B parameters activeert tegenover 49B van Pro. Pro behoudt de voorsprong op langetermijn multi-step redeneren. V4 Pro wordt niet langer aangeboden op Okou.

Ondersteunt DeepSeek V4 Flash visie?

Nee. Het accepteert alleen tekst en code. Leid stappen die gebaseerd zijn op screenshots, grafieken of PDF naar een multimodaal model zoals Claude Sonnet 4.6 of GPT 5.6 Luna.

Welk framework gebruikt DeepSeek V4 Flash op Okou?

Codex. Okou routeert het via DeepSeek's Responses API, waarvan V4 Flash momenteel het enige DeepSeek-model is dat wordt ondersteund. Voer het uit als een ingebouwd model dat wordt gefactureerd in Okou-credits, of breng uw eigen DeepSeek API-sleutel mee.

Alternatieven

DeepSeek V4 Flash gebruiken op Okou

Twee manieren om toegang te krijgen tot DeepSeek V4 Flash op Okou

Okou ondersteunt DeepSeek V4 Flash als een ingebouwd model dat wordt gefactureerd in Okou-credits, en via 'bring-your-own' met een DeepSeek API key. Het ingebouwde pad maakt gebruik van Okou Managed routing en de hieronder uitgelegde prijscategorie; het 'bring-your-own' pad factureert u rechtstreeks bij de upstream leverancier en slaat de Okou-creditconversie volledig over.

Aanbeveling van Okou

Okou positioneert DeepSeek V4 Flash als een kostenbesparende optie voor bulkclassificatie, voorfilters, latency-gevoelige antwoorden en ander werk met een hoog volume.

Credits en de $ prijscategorie

Okou prijst elk ingebouwd model op een vierstaps creditschaal — $, $$, $$$, $$$$ — weergegeven als een badge in de modelkiezer en op de price tier-regel van zero model ls. DeepSeek V4 Flash bevindt zich op $. Die laag is wat je uitgeeft van je Okou-creditsaldo; de catalogusprijs van de leverancier in de bovenstaande tabel is wat de upstream-provider in rekening brengt voordat Okou het omzet in credits.

Beschikbaar op Okou sinds July 31, 2026.