DeepSeek V4 Flash på Okou. Agent-grade kodning til den billigste prisklasse
DeepSeeks open-weight 284B Mixture-of-Experts-model med 13B aktiv pr. token. 0731-buildet slår V4 Pro på alle agent-benchmarks, DeepSeek udgav, til $0.14 / $0.28 pr. 1M tokens.
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash er effektivitetshalvdelen af DeepSeeks V4-generation: en 284B-parameter Mixture-of-Experts-model, der aktiverer 13B parametre pr. token, udgivet under MIT-licensen med åbne vægte. 0731-buildet, der blev leveret den 31. juli 2026, beholdt arkitekturen uændret og genkørte post-træning på agentdata, hvilket flyttede den forbi DeepSeek V4 Pro (Preview) på alle ni agent-benchmarks, DeepSeek udgav – 82,7 mod 72,1 på Terminal-Bench 2.1 og 54,4 mod 12,8 på DeepSWE.
Leverandørens listepris er 0,14 USD / 0,28 USD pr. 1M tokens, med cache-hits til 0,0028 USD / 1M og ingen gebyr for cache-skrivninger, hvilket gør den til den billigste ræsonnementsmodel i Okou's nuværende sortiment. Den har et 1M-token kontekstvindue, op til 384K output og tænketilstand slået til som standard. Den er kun tekst: ingen vision. Vælg Claude Sonnet 4.6, når et trin kræver billeder eller Claude Code-rammeværket, og for GPT 5.6 Luna, når du ønsker den billige version af OpenAI-familien i stedet.
Hvad er DeepSeek V4 Flash?
31. juli 2026 (DeepSeek-V4-Flash-0731, offentlig beta) · Effektivitetshalvdelen af DeepSeek V4-familien: 13B aktive parametre mod V4 Pro's 49B, eftertrænet til agentarbejde.
DeepSeek V4 Flash dukkede først op den 24. april 2026 som den mindre halvdel af V4-familien – en 284B-parameter MoE med 13B aktiv pr. token og et 1M-token kontekstvindue, ved siden af den 1.6T-parameter V4 Pro. Den forlod forhåndsvisningen den 31. juli 2026 som DeepSeek-V4-Flash-0731, en offentlig beta-build, der holdt arkitekturen uberørt og kun genkørte post-træningspasset, denne gang på agent-smagsdata.
Den genoptræning er hele historien om udgivelsen. Ifølge DeepSeeks egne tal slår 0731-buildet V4 Pro (Preview) på alle ni offentliggjorte agent-benchmarks, mens det aktiverer omkring en fjerdedel af parametrene: Terminal-Bench 2.1 går fra 61.8 i Flash-forhåndsvisningen til 82.7, DeepSWE fra 7.3 til 54.4, Toolathlon-Verified fra 49.7 til 70.3. Flere af disse lander inden for få point af Claude Opus 4.8 — 82.7 mod 85.0 på Terminal-Bench 2.1, 25.2 mod 25.7 på Agents' Last Exam — til en brøkdel af prisen.
Forbeholdene er værd at nævne klart. Hver score er DeepSeek-rapporteret og kørt med DeepSeek Harness, som ikke er blevet frigivet, så intet af det er blevet reproduceret uafhængigt, og to af de ni sæt er DeepSeeks interne. Modellen er kun tekstbaseret, halter efter frontlinjen på ræsonnement på kandidatniveau og halter stadig efter V4 Pro på langsigtede flertrinsopgaver. Tænketilstand er slået til som standard, og tænketokens faktureres som output.
Hvad er bemærkelsesværdigt ved DeepSeek V4 Flash
Overskriftsarkitektur og kapacitetsfunktioner.
V4 Flash er en sparsom Mixture-of-Experts-model: 284B samlede parametre med 13B aktiveret pr. token, hvor hvert MoE-lag indeholder 1 delt ekspert og 256 routede eksperter ved en mellemliggende dimension på 2048, og 6 routede eksperter aktiveres pr. token. De første tre MoE-lag bruger hash-routing, og multi-token forudsigelsesdybden er 1. Det publicerede 0731-kontrolpunkt er 304B parametre, fordi det leverer et spekulativt-dekodende udkastmodul oven på den 284B base. Det understøtter et 1M-token kontekstvindue med op til 384K output, tænkende og ikke-tænkende tilstande og en reasoning_effort-parameter med low, high og max-niveauer. Vægtene er MIT-licenserede og ubeskyttede.
Specifikationer på et øjeblik
DeepSeek V4 Flash benchmarks
DeepSeek-rapporterede tal fra DeepSeek-V4-Flash-0731 modelkortet, kørt med DeepSeek Harness i minimal tilstand ved maksimal ræsonneringsindsats (temperatur 1.0, top_p 0.95). Harness er ikke blevet frigivet, så ingen af disse er blevet reproduceret uafhængigt, og DSBench-FullStack og DSBench-Hard er DeepSeeks interne testsæt.
DeepSeek V4 Flash priser
Udbyderens listepris, pr. 1M tokens.
Hvordan DeepSeek V4 Flash opfører sig i praksis
Observeret adfærd fra produktionsagentkørsler.
Agentisk udførelse
0731 post-træningsmålene er præcis dette: at styre en terminal, kalde værktøjer i rækkefølge og afslutte en opgave uden en menneskelig involvering. 82.7 på Terminal-Bench 2.1 og 70.3 på Toolathlon-Verified placerer den i frontlinjen for prisen.
Omkostningsprofil
$0.14 / $0.28 per 1M tokens, cache-hits til $0.0028 / 1M, og cache-skrivninger faktureres slet ikke. Det er den billigste position i den nuværende opstilling og cirka en tredjedel af V4 Pro's outputpris, så det er modellen at pege på højvolumenarbejde.
Lang kontekst
1M tokens ind og op til 384K ud, så læsning af hele repository og lange transskriptioner passer uden opdeling. Kvaliteten på langsigtede, mange-trins agent-loops halter stadig efter V4 Pro.
Begrundelsesdybde
Tre reasoning_effort-niveauer – low, high og max – udveksler latenstid for overvejelse, og DeepSeeks offentliggjorte scores er alle på max. Ræsonnement på kandidatniveau er ikke dens styrke; det er her Claude Opus 5 og GPT 5.6 Sol forbliver foran.
Modaliteter
Kun tekst og kode. Alt med et skærmbillede, en scannet PDF eller et diagram i løkken kræver en visionmodel som Claude Sonnet 4.6 eller GPT 5.6 Luna.
Bedste agentopgaver for DeepSeek V4 Flash
Højvolumen kodningsagenter
Bulk PR-gennemgang, testskrivning, lint-og-fix-passer og planlagte refaktoreringer, hvor den samme agent kører hundredvis af gange om dagen. Til $0,28 pr. 1M output-tokens forbliver omkostningerne pr. kørsel lave nok til, at volumen ikke længere er begrænsningen.
Terminal- og værktøjsdrevet automatisering
0731-buildets stærkeste publicerede resultater er på terminalarbejde og værktøjsbrug, hvilket er præcis, hvad en build-fix, deployment-check eller log-triage-agent gør hele dagen.
Repository-dækkende læsning
Et 1M-token vindue tager et helt mellemstort repository, en lang hændelsestidslinje eller et komplet sæt designdokumenter i én omgang, så en migrations- eller revisionsagent kan ræsonnere over det hele i stedet for stykke for stykke.
Det billige lag under en frontier-orkestrator
Lad Claude Opus 5 eller GPT 5.6 Sol planlægge og gennemgå, og overlad de mange mekaniske trin – læsning af filer, kørsel af kommandoer, udarbejdelse af patches – til V4 Flash. Du betaler kun frontier-prisen for de trin, der afgør kørslen.
Hvornår man skal springe DeepSeek V4 Flash over
Spring V4 Flash over på alt med billeder i loopet, da den ikke har vision, og på ræsonnement på kandidatniveau, hvor frontlinjemodellerne stadig er klart foran. Langtidsløb, der forbliver sammenhængende over mange timer, er stadig V4 Pro's og Claude Opus's territorium. Og behandl de offentliggjorte agent-scores som leverandørpåstande, indtil DeepSeek Harness sendes: benchmark dem på dit eget lager, før du flytter en produktionsagent over.
DeepSeek V4 Flash vs. andre modeller
DeepSeek V4 Flash vs DeepSeek V4 Pro
Samme familie, modsat bytte. Pro er flagskibet på 1,6T med 49B aktive pr. token; Flash aktiverer 13B og koster en tredjedel af Pros outputpris. På DeepSeeks offentliggjorte agent-benchmarks scorer 0731 Flash-buildet nu højere end V4 Pro (Preview) på alle ni, så argumentet for Pro er dybde i lang multi-trins ræsonnement snarere end agent-gennemstrømning. V4 Pro tilbydes ikke længere på Okou – dens side her er referencemateriale.
DeepSeek V4 Flash vs GPT 5.6 Luna
Begge er den billige kategori i deres familie, og begge kører på Codex-rammeværket. Luna er multimodal og understøttet af OpenAI's økosystem; Flash er kun tekst, open-weight, koster under en fjerdedel af Lunas outputpris og har langt stærkere offentliggjorte agent-benchmark-resultater. Vælg Luna, når du har brug for vision eller OpenAI-specifik adfærd, Flash når arbejdet er kode og værktøjer.
DeepSeek V4 Flash vs Claude Sonnet 4.6
Sonnet 4.6 er en kernemodel for agenter med vision, Claude Code-rammeværket og Anthropic's pålidelighed for værktøjsrouting; Flash er en omkostningsbesparende, tekstbaseret model til cirka en halvtredsindstyvendedel af Sonnets outputpris. Behold Sonnet på de trin, der afgør en kørsel, og giv Flash volumen under den.
Bundlinjen: skal du bruge DeepSeek V4 Flash?
DeepSeek V4 Flash er den billigste måde at køre en kompetent kodningsagent på Okou: frontier-nære agent-benchmarks, et 1M-token-vindue og $0,28 pr. 1M output-tokens. Verificer leverandørens tal på dit eget repository, hold vision og den sværeste ræsonnement andre steder, og det er svært at slå på omkostninger pr. udført opgave.
Ofte stillede spørgsmål
Hvad er DeepSeek V4 Flash's kontekstvindue?
1M tokens ind, og op til 384K tokens output pr. svar. DeepSeek anbefaler det fulde 384K outputloft på high og max ræsonnementsniveauer.
Hvor meget koster DeepSeek V4 Flash?
Leverandørens listepris er $0,14 pr. 1M input-tokens og $0,28 pr. 1M output, med cache-hits til $0,0028 pr. 1M og ingen gebyr for cache-skrivninger. På Okou ligger den i $ prisklassen, den billigste af de fire. DeepSeek har annonceret en spidsbelastningspolitik, der ville fordoble deres egne listepriser mellem kl. 09:00-12:00 og 14:00-18:00 Beijing-tid; den er endnu ikke trådt i kraft.
Er DeepSeek V4 Flash bedre end DeepSeek V4 Pro?
På de ni agent-benchmarks, DeepSeek udgav for 0731-buildet, ja: den scorer højere end V4 Pro (Preview) på hver enkelt, mens den aktiverer 13B parametre mod Pros 49B. Pro bevarer fordelen på langsigtede flertrinsræsonnementer. V4 Pro tilbydes ikke længere på Okou.
Understøtter DeepSeek V4 Flash vision?
Nej. Den tager kun tekst og kode. Send skærmbillede-, diagram- eller PDF-drevne trin til en multimodal model som Claude Sonnet 4.6 eller GPT 5.6 Luna.
Hvilket framework bruger DeepSeek V4 Flash på Okou?
Codex. Okou router den gennem DeepSeeks Responses API, som V4 Flash i øjeblikket er den eneste DeepSeek-model, der understøtter. Kør den som en indbygget model faktureret i Okou-kreditter, eller medbring din egen DeepSeek API-nøgle.
Alternativer
Bruger DeepSeek V4 Flash på Okou
To måder at få adgang til DeepSeek V4 Flash på Okou
Okou understøtter DeepSeek V4 Flash som en indbygget model, der faktureres i Okou-kreditter, og via bring-your-own med en DeepSeek API key. Den indbyggede sti bruger Okou Managed routing og den prisklasse, der er forklaret nedenfor; bring-your-own-stien fakturerer dig direkte hos den oprindelige leverandør og springer Okou-kreditkonverteringen helt over.
Okou's anbefaling
Okou positionerer DeepSeek V4 Flash som en omkostningsbesparende mulighed for bulkklassificering, forfiltrering, latensfølsomme svar og andet højvolumenarbejde.
Kreditter og $ prisniveau
Okou prissætter hver indbygget model på en firetrins kredit-skala — $, $$, $$$, $$$$ — vist som et badge i modelvælgeren og på price tier-linjen i zero model ls. DeepSeek V4 Flash ligger på $. Det niveau er, hvad du bruger fra din Okou-kreditbalance; leverandørens listepris i tabellen ovenfor er, hvad den opstrøms udbyder opkræver, før Okou konverterer det til kreditter.
Tilgængelig på Okou siden July 31, 2026.

