Alla modeller

DeepSeek V4 Flash på Okou. Agentklassad kodning till den billigaste prisnivån

DeepSeeks open-weight 284B Mixture-of-Experts-modell med 13B aktiv per token. Bygget 0731 slår V4 Pro på varje agentbenchmark som DeepSeek publicerade, till $0.14 / $0.28 per 1M tokens.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash är effektivitetshalvan av DeepSeeks V4-generation: en 284B-parameter Mixture-of-Experts-modell som aktiverar 13B parametrar per token, släppt under MIT-licensen med öppna vikter. Bygget 0731 som levererades den 31 juli 2026 behöll arkitekturen oförändrad och körde om efterträningen på agentdata, vilket flyttade den förbi DeepSeek V4 Pro (Preview) på alla nio agentbenchmarks som DeepSeek publicerade – 82,7 mot 72,1 på Terminal-Bench 2.1, och 54,4 mot 12,8 på DeepSWE.

Leverantörens listpris är 0,14 USD / 0,28 USD per 1M tokens, med cacheträffar till 0,0028 USD / 1M och ingen avgift för cache-skrivningar, vilket gör den till den billigaste resonemangsmodellen i Okou:s nuvarande sortiment. Den har ett kontextfönster på 1M tokens, upp till 384K utdata, och tänkarläge på som standard. Den är endast text: ingen vision. Välj Claude Sonnet 4.6 när ett steg behöver bilder eller Claude Code-ramverket, och för GPT 5.6 Luna när du vill ha den billiga nivån av OpenAI-familjen istället.

Vad är DeepSeek V4 Flash?

31 juli 2026 (DeepSeek-V4-Flash-0731, offentlig beta) · Effektivitetshalvan av DeepSeek V4-familjen: 13B aktiva parametrar mot V4 Pro:s 49B, eftertränad för agentarbete.

DeepSeek V4 Flash dök först upp den 24 april 2026 som den mindre halvan av V4-familjen – en 284B-parameter MoE med 13B aktiv per token och ett 1M-token kontextfönster, bredvid den 1.6T-parameter V4 Pro. Den lämnade förhandsvisningen den 31 juli 2026 som DeepSeek-V4-Flash-0731, en offentlig beta-version som behöll arkitekturen orörd och endast körde om efterträningspasset, denna gång på agent-smaksatta data.

Den omskolningen är hela historien om releasen. Enligt DeepSeeks egna siffror slår 0731-bygget V4 Pro (Preview) på alla nio publicerade agentbenchmarks samtidigt som det aktiverar ungefär en fjärdedel av parametrarna: Terminal-Bench 2.1 går från 61.8 i Flash-förhandsvisningen till 82.7, DeepSWE från 7.3 till 54.4, Toolathlon-Verified från 49.7 till 70.3. Flera av dessa ligger inom några poäng från Claude Opus 4.8 – 82.7 mot 85.0 på Terminal-Bench 2.1, 25.2 mot 25.7 på Agents' Last Exam – till en bråkdel av priset.

Varningarna är värda att nämna tydligt. Alla poäng är DeepSeek-rapporterade och körda med DeepSeek Harness, som inte har släppts, så inget av det har reproducerats oberoende, och två av de nio uppsättningarna är DeepSeeks interna. Modellen är endast textbaserad, ligger efter frontlinjen när det gäller resonemang på avancerad nivå och släpar fortfarande efter V4 Pro när det gäller långsiktiga flerstegsuppgifter. Tänkläget är på som standard, och tänkande tokens faktureras som utdata.

Vad är anmärkningsvärt med DeepSeek V4 Flash

Rubrikarkitektur och funktionsfunktioner.

V4 Flash är en gles Mixture-of-Experts-modell: 284B totala parametrar med 13B aktiverade per token, där varje MoE-lager innehåller 1 delad expert och 256 dirigerade experter vid en mellanliggande dimension på 2048, och 6 dirigerade experter aktiveras per token. De första tre MoE-lagren använder hash-routing, och förutsägelsedjupet för flera tokens är 1. Den publicerade 0731-checkpointen har 304B parametrar eftersom den levereras med en spekulativ-avkodningsmodul ovanpå den 284B-basen. Den stöder ett 1M-token kontextfönster med upp till 384K utdata, tänkande och icke-tänkande lägen, och en reasoning_effort-parameter med low, high och max-nivåer. Vikterna är MIT-licensierade och ogated.

Specifikationer i korthet

FamiljDeepSeek V4-serien (Flash)
Parametrar284B totalt / 13B aktiv (MoE)
ModaliteterText, kod (ingen vision)
LicensMIT, öppna vikter
Prompt-cachelagringStöds (DeepSeek)
Kontextfönster1M tokens
Max utdataUpp till 384K tokens
ResonemangsinsatsLåg / Hög / Max
Leverantörens listpris0,14 USD inmatning / 0,28 USD utmatning per 1M

DeepSeek V4 Flash benchmarks

DeepSeek-rapporterade siffror från DeepSeek-V4-Flash-0731-modellkortet, körda med DeepSeek Harness i minimalt läge vid maximal resonemangsinsats (temperatur 1.0, top_p 0.95). Harness har inte släppts, så ingen av dessa har reproducerats oberoende, och DSBench-FullStack och DSBench-Hard är DeepSeeks interna testuppsättningar.

Terminal-Bench 2.1agentiskt terminalarbete; V4 Pro (förhandsvisning) 72.1
82.7
SWE-bench Verifieradförhandsversion, leverantörsrapporterad
79.0%
Cybergymleverantörsrapporterad
76.7
Toolathlon (verifierad)verktygsanvändning; V4 Pro (förhandsvisning) 55.9
70.3
DSBench-FullStackDeepSeek intern uppsättning
68.7
DSBench-HardDeepSeek intern uppsättning
59.6
DeepSWEupp från 7.3 i förhandsversionen
54.4
NL2Repokonstruktion av förråd
54.2
Agenternas sista provClaude Opus 4.8 får 25.7
25.2

DeepSeek V4 Flash prissättning

Leverantörens listpris, per 1M tokens.

Inmatning$0.14
Utdata$0.28
Cacheläsning$0.003
CacheskrivningEj fakturerad

Hur DeepSeek V4 Flash beter sig i praktiken

Observerat beteende från produktionsagentkörningar.

Agentisk exekvering

0731-post-träningsmålen exakt detta: att driva en terminal, anropa verktyg i sekvens och slutföra en uppgift utan en människa i loopen. 82.7 på Terminal-Bench 2.1 och 70.3 på Toolathlon-Verified placerar den i frontlinjen för priset.

Kostnadsprofil

0,14 USD / 0,28 USD per 1 miljon tokens, cacheträffar till 0,0028 USD / 1 miljon, och cache-skrivningar faktureras inte alls. Det är den billigaste positionen i det nuvarande sortimentet och ungefär en tredjedel av V4 Pro:s utpris, så det är modellen att peka på för högvolymarbete.

Lång kontext

1M tokens in och upp till 384K ut, så läsning av hela arkivet och långa transkriptioner passar utan att delas upp. Kvaliteten på långa, många-stegs agentloopar ligger fortfarande efter V4 Pro.

Resonemangsdjup

Tre reasoning_effort-nivåer – low, high och max – byter latens mot övervägande, och DeepSeeks publicerade poäng är alla på max. Resonemang på avancerad nivå är inte dess styrka; det är där Claude Opus 5 och GPT 5.6 Sol ligger före.

Modaliteter

Endast text och kod. Allt med en skärmdump, en skannad PDF eller ett diagram i loopen kräver en visionsmodell som Claude Sonnet 4.6 eller GPT 5.6 Luna.

Bästa agentuppgifter för DeepSeek V4 Flash

Högvolyms kodningsagenter

Massgranskning av PR, testskrivning, lint-och-fix-pass och schemalagda refaktoriseringar, där samma agent körs hundratals gånger om dagen. Med $0.28 per 1M utdatatoken förblir kostnaden per körning tillräckligt låg för att volymen slutar vara begränsningen.

Terminal- och verktygsdriven automatisering

0731-versionens starkaste publicerade resultat är på terminalarbete och verktygsanvändning, vilket är precis vad en bygg-fix, distributionskontroll eller logg-triage-agent gör hela dagen.

Repository-bred läsning

Ett 1M-tokenfönster tar en hel medelstor databas, en lång incidenttidslinje eller en komplett uppsättning designspecifikationer i ett enda pass, så en migrerings- eller revisionsagent kan resonera över hela saken istället för bit för bit.

Det billiga lagret under en banbrytande orkestrator

Låt Claude Opus 5 eller GPT 5.6 Sol planera och granska, och överlämna de många mekaniska stegen – läsa filer, köra kommandon, utarbeta patchar – till V4 Flash. Du betalar gränspriset endast för de steg som avgör körningen.

När man ska hoppa över DeepSeek V4 Flash

Hoppa över V4 Flash för allt med bilder i loopen, eftersom den inte har någon vision, och för resonemang på avancerad nivå, där de ledande modellerna fortfarande är tydligt överlägsna. Långsiktiga körningar som förblir sammanhängande under många timmar är fortfarande V4 Pros och Claude Opus territorium. Och behandla de publicerade agentpoängen som leverantörspåståenden tills DeepSeek Harness släpps: benchmarka dem på ditt eget arkiv innan du flyttar en produktionsagent.

DeepSeek V4 Flash vs andra modeller

DeepSeek V4 Flash vs DeepSeek V4 Pro

Samma familj, motsatt kompromiss. Pro är flaggskeppet på 1,6T med 49B aktiva per token; Flash aktiverar 13B och kostar en tredjedel av Pros utpris. På DeepSeeks publicerade agentbenchmarks får 0731 Flash-bygget nu högre poäng än V4 Pro (Preview) på alla nio, så argumentet för Pro är djup i långa flerstegsresonemang snarare än agentgenomströmning. V4 Pro erbjuds inte längre på Okou – dess sida här är referensmaterial.

DeepSeek V4 Flash vs GPT 5.6 Luna

Båda är den billiga nivån i sin familj och båda körs på Codex-ramverket. Luna är multimodal och stöds av OpenAI:s ekosystem; Flash är endast text, öppen vikt, kostar mindre än en fjärdedel av Lunas utgångspris och uppvisar betydligt starkare publicerade agent-benchmark-poäng. Välj Luna när du behöver vision eller OpenAI-specifikt beteende, Flash när arbetet är kod och verktyg.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6 är en kärnagentmodell med vision, Claude Code-ramverket och Anthropic:s tillförlitlighet för verktygsdirigering; Flash är en kostnadsbesparande, textbaserad modell till ungefär en femtiondel av Sonnets utgångspris. Behåll Sonnet på de steg som avgör en körning och ge Flash volymen under den.

Slutsats: ska du använda DeepSeek V4 Flash?

DeepSeek V4 Flash är det billigaste sättet att köra en kompetent kodningsagent på Okou: gränsnära agentbenchmarks, ett 1M-tokenfönster och 0,28 USD per 1M utdatatokens. Verifiera leverantörens siffror på ditt eget arkiv, behåll vision och det svåraste resonemanget någon annanstans, och det är svårt att slå på kostnad per slutförd uppgift.

Vanliga frågor

Vad är DeepSeek V4 Flashs kontextfönster?

1M tokens in, och upp till 384K tokens utdata per svar. DeepSeek rekommenderar det fulla 384K utdatataket vid high och max resonemangsnivåer.

Hur mycket kostar DeepSeek V4 Flash?

Leverantörens listpris är 0,14 USD per 1 miljon inmatningstokens och 0,28 USD per 1 miljon utmatning, med cacheträffar till 0,0028 USD per 1 miljon och ingen avgift för cache-skrivningar. På Okou ligger den i $-prisnivån, den billigaste av de fyra. DeepSeek har meddelat en policy för högtrafik som skulle fördubbla dess egna listpriser mellan 09:00-12:00 och 14:00-18:00 Beijing-tid; den har ännu inte trätt i kraft.

Är DeepSeek V4 Flash bättre än DeepSeek V4 Pro?

På de nio agentbenchmarks som DeepSeek publicerade för 0731-versionen, ja: den får högre poäng än V4 Pro (förhandsvisning) på varje, samtidigt som den aktiverar 13B parametrar mot Pros 49B. Pro behåller fördelen på långsiktigt flerstegsresonemang. V4 Pro erbjuds inte längre på Okou.

Stöder DeepSeek V4 Flash vision?

Nej. Den tar endast text och kod. Skicka skärmbilds-, diagram- eller PDF-drivna steg till en multimodal modell som Claude Sonnet 4.6 eller GPT 5.6 Luna.

Vilket ramverk använder DeepSeek V4 Flash på Okou?

Codex. Okou dirigerar den via DeepSeeks Responses API, som V4 Flash för närvarande är den enda DeepSeek-modellen som stöder. Kör den som en inbyggd modell fakturerad i Okou-krediter, eller ta med din egen DeepSeek API-nyckel.

Alternativ

Använder DeepSeek V4 Flash på Okou

Två sätt att komma åt DeepSeek V4 Flash på Okou

Okou stöder DeepSeek V4 Flash som en inbyggd modell som faktureras i Okou-krediter, och genom att ta med egen med en DeepSeek API key. Den inbyggda vägen använder Okou hanterad routing och den prisnivå som förklaras nedan; den egna vägen fakturerar dig direkt med den uppströms leverantören och hoppar över Okou-kreditkonverteringen helt.

Okou:s rekommendation

Okou positionerar DeepSeek V4 Flash som ett kostnadsbesparande alternativ för massklassificering, förfiltrering, latenskänsliga svar och annat högvolymsarbete.

Krediter och $ prisnivå

Okou prissätter varje inbyggd modell på en fyrstegs kreditsskala – $, $$, $$$, $$$$ – som visas som ett märke i modellväljaren och på price tier-raden i zero model ls. DeepSeek V4 Flash ligger på $. Den nivån är vad du spenderar från ditt Okou-kreditbalans; leverantörens listpris i tabellen ovan är vad den uppströms leverantören debiterar innan Okou konverterar det till krediter.

Tillgänglig på Okou sedan July 31, 2026.