DeepSeek V4 Flash trên Okou. Mã hóa cấp tác nhân ở mức giá rẻ nhất
Mô hình Mixture-of-Experts 284B mã nguồn mở của DeepSeek với 13B hoạt động trên mỗi token. Bản dựng 0731 đánh bại V4 Pro trên mọi điểm chuẩn tác nhân mà DeepSeek đã công bố, với giá 0,14 USD / 0,28 USD cho mỗi 1 triệu token.
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash là một nửa hiệu quả của thế hệ V4 của DeepSeek: một mô hình Mixture-of-Experts 284B tham số kích hoạt 13B tham số trên mỗi token, được phát hành theo Giấy phép MIT với trọng số mở. Bản dựng 0731 được phát hành vào ngày 31 tháng 7 năm 2026 giữ nguyên kiến trúc và chạy lại quá trình huấn luyện trên dữ liệu tác nhân, điều này đã giúp nó vượt qua DeepSeek V4 Pro (Xem trước) trên tất cả chín điểm chuẩn tác nhân mà DeepSeek đã công bố — 82,7 so với 72,1 trên Terminal-Bench 2.1, và 54,4 so với 12,8 trên DeepSWE.
Giá niêm yết của nhà cung cấp là 0,14 đô la / 0,28 đô la cho mỗi 1 triệu token, với lượt truy cập bộ nhớ cache ở mức 0,0028 đô la / 1 triệu và không tính phí ghi bộ nhớ cache, điều này làm cho nó trở thành mô hình suy luận rẻ nhất trong dòng sản phẩm hiện tại của Okou. Nó có cửa sổ ngữ cảnh 1 triệu token, tối đa 384K đầu ra và chế độ suy nghĩ được bật theo mặc định. Nó chỉ là văn bản: không có thị giác. Hãy chọn Claude Sonnet 4.6 khi một bước cần hình ảnh hoặc khung Claude Code, và GPT 5.6 Luna khi bạn muốn cấp độ rẻ của gia đình OpenAI thay thế.
DeepSeek V4 Flash là gì?
Ngày 31 tháng 7 năm 2026 (DeepSeek-V4-Flash-0731, bản beta công khai) · Một nửa hiệu quả của dòng DeepSeek V4: 13B tham số hoạt động so với 49B của V4 Pro, được huấn luyện sau cho công việc của tác nhân.
DeepSeek V4 Flash lần đầu tiên xuất hiện vào ngày 24 tháng 4 năm 2026 dưới dạng một nửa nhỏ hơn của dòng V4 — một MoE 284B tham số với 13B hoạt động trên mỗi token và cửa sổ ngữ cảnh 1M token, bên cạnh V4 Pro 1.6T tham số. Nó rời khỏi bản xem trước vào ngày 31 tháng 7 năm 2026 dưới dạng DeepSeek-V4-Flash-0731, một bản dựng beta công khai giữ nguyên kiến trúc và chỉ chạy lại quá trình hậu đào tạo, lần này trên dữ liệu theo phong cách tác nhân.
Việc đào tạo lại đó là toàn bộ câu chuyện của bản phát hành. Theo số liệu của DeepSeek, bản dựng 0731 đánh bại V4 Pro (Xem trước) trên tất cả chín điểm chuẩn tác nhân đã công bố trong khi chỉ kích hoạt khoảng một phần tư các tham số: Terminal-Bench 2.1 tăng từ 61.8 trong bản xem trước Flash lên 82.7, DeepSWE từ 7.3 lên 54.4, Toolathlon-Verified từ 49.7 lên 70.3. Một số trong số đó nằm trong vài điểm của Claude Opus 4.8 — 82.7 so với 85.0 trên Terminal-Bench 2.1, 25.2 so với 25.7 trên Agents' Last Exam — với một phần nhỏ chi phí.
Những cảnh báo đáng được nêu rõ ràng. Mọi điểm số đều do DeepSeek báo cáo và được chạy bằng DeepSeek Harness, chưa được phát hành, vì vậy không có điểm số nào được tái tạo độc lập, và hai trong số chín bộ là của nội bộ DeepSeek. Mô hình chỉ có văn bản, tụt hậu so với các mô hình tiên tiến về suy luận cấp độ sau đại học và vẫn kém V4 Pro trong các tác vụ đa bước dài hạn. Chế độ suy nghĩ được bật theo mặc định và các token suy nghĩ được tính phí dưới dạng đầu ra.
Điều gì đáng chú ý về DeepSeek V4 Flash
Kiến trúc tiêu đề và các tính năng khả năng.
V4 Flash là một mô hình Mixture-of-Experts thưa thớt: tổng cộng 284B tham số với 13B được kích hoạt trên mỗi token, trong đó mỗi lớp MoE chứa 1 chuyên gia được chia sẻ và 256 chuyên gia được định tuyến ở kích thước trung gian 2048, và 6 chuyên gia được định tuyến kích hoạt trên mỗi token. Ba lớp MoE đầu tiên sử dụng định tuyến băm, và độ sâu dự đoán đa token là 1. Điểm kiểm tra 0731 được xuất bản có 304B tham số vì nó vận chuyển một mô-đun dự thảo giải mã suy đoán trên nền tảng 284B cơ sở. Nó hỗ trợ cửa sổ ngữ cảnh 1M token với tối đa 384K đầu ra, chế độ suy nghĩ và không suy nghĩ, và một tham số reasoning_effort với các cấp độ low, high và max. Trọng số được cấp phép MIT và không bị giới hạn.
Thông số kỹ thuật nhanh
Điểm chuẩn DeepSeek V4 Flash
Các số liệu do DeepSeek báo cáo từ thẻ mô hình DeepSeek-V4-Flash-0731, được chạy với DeepSeek Harness ở chế độ tối thiểu với nỗ lực suy luận tối đa (nhiệt độ 1.0, top_p 0.95). Harness chưa được phát hành, vì vậy không có số liệu nào trong số này được tái tạo độc lập, và DSBench-FullStack và DSBench-Hard là các bộ kiểm tra nội bộ của DeepSeek.
Giá DeepSeek V4 Flash
Giá niêm yết của nhà cung cấp, trên 1 triệu token.
Cách DeepSeek V4 Flash hoạt động trong thực tế
Hành vi được quan sát từ các lần chạy tác nhân sản xuất.
Thực thi tác nhân
Mục tiêu hậu đào tạo 0731 chính xác là điều này: điều khiển một thiết bị đầu cuối, gọi các công cụ theo trình tự và hoàn thành một tác vụ mà không cần sự can thiệp của con người. 82.7 trên Terminal-Bench 2.1 và 70.3 trên Toolathlon-Verified đặt nó vào công ty tiên phong với mức giá này.
Hồ sơ chi phí
0,14 đô la / 0,28 đô la cho 1 triệu token, lượt truy cập bộ nhớ cache với giá 0,0028 đô la / 1 triệu, và ghi bộ nhớ cache không bị tính phí. Đó là vị trí rẻ nhất trong dòng sản phẩm hiện tại và khoảng một phần ba giá đầu ra của V4 Pro, vì vậy đây là mô hình để nhắm đến công việc có khối lượng lớn.
Ngữ cảnh dài
1M token đầu vào và lên đến 384K token đầu ra, vì vậy việc đọc toàn bộ kho lưu trữ và các bản ghi dài đều phù hợp mà không cần phân đoạn. Chất lượng trên các vòng lặp tác nhân dài hạn, nhiều bước vẫn còn kém V4 Pro.
Độ sâu lý luận
Ba cấp độ reasoning_effort — low, high và max — đánh đổi độ trễ để cân nhắc, và tất cả các điểm số được công bố của DeepSeek đều ở max. Lý luận cấp độ sau đại học không phải là thế mạnh của nó; đó là nơi Claude Opus 5 và GPT 5.6 Sol vẫn dẫn đầu.
Phương thức
Chỉ văn bản và mã. Bất cứ thứ gì có ảnh chụp màn hình, PDF được quét hoặc biểu đồ trong vòng lặp đều cần một mô hình thị giác như Claude Sonnet 4.6 hoặc GPT 5.6 Luna.
Các tác vụ tác nhân tốt nhất cho DeepSeek V4 Flash
Các tác nhân mã hóa khối lượng lớn
Đánh giá PR hàng loạt, viết kiểm thử, chạy lint-and-fix và tái cấu trúc theo lịch trình, nơi cùng một tác nhân chạy hàng trăm lần mỗi ngày. Với chi phí 0,28 đô la cho mỗi 1 triệu token đầu ra, chi phí mỗi lần chạy vẫn đủ thấp để khối lượng không còn là hạn chế.
Tự động hóa dựa trên thiết bị đầu cuối và công cụ
Kết quả được công bố mạnh nhất của bản dựng 0731 là về công việc đầu cuối và sử dụng công cụ, đó chính xác là những gì một tác nhân sửa lỗi bản dựng, kiểm tra triển khai hoặc phân loại nhật ký thực hiện cả ngày.
Đọc toàn bộ kho lưu trữ
Một cửa sổ 1M-token có thể chứa toàn bộ kho lưu trữ cỡ trung bình, một dòng thời gian sự cố dài hoặc một bộ tài liệu thiết kế đầy đủ trong một lần, vì vậy một tác nhân di chuyển hoặc kiểm toán có thể suy luận về toàn bộ thay vì từng phần.
Lớp rẻ tiền bên dưới một bộ điều phối tiên phong
Hãy để Claude Opus 5 hoặc GPT 5.6 Sol lập kế hoạch và xem xét, và giao nhiều bước cơ học — đọc tệp, chạy lệnh, soạn thảo bản vá — cho V4 Flash. Bạn chỉ trả phí biên giới cho các bước quyết định lần chạy.
Khi nào nên bỏ qua DeepSeek V4 Flash
Bỏ qua V4 Flash đối với bất kỳ thứ gì có hình ảnh trong vòng lặp, vì nó không có khả năng nhìn, và đối với suy luận cấp độ sau đại học, nơi các mô hình tiên tiến vẫn vượt trội rõ ràng. Các lần chạy dài hạn duy trì tính nhất quán trong nhiều giờ vẫn là lãnh địa của V4 Pro và Claude Opus. Và hãy coi các điểm số tác nhân đã công bố là tuyên bố của nhà cung cấp cho đến khi DeepSeek Harness được phát hành: hãy kiểm tra chúng trên kho lưu trữ của riêng bạn trước khi bạn chuyển một tác nhân sản xuất.
DeepSeek V4 Flash so với các mô hình khác
DeepSeek V4 Flash so với DeepSeek V4 Pro
Cùng một dòng, đối lập nhau. Pro là sản phẩm chủ lực 1.6T với 49B hoạt động trên mỗi token; Flash kích hoạt 13B và có giá bằng một phần ba giá đầu ra của Pro. Trên các điểm chuẩn tác nhân được DeepSeek công bố, bản dựng 0731 Flash hiện đạt điểm cao hơn V4 Pro (Xem trước) trên cả chín điểm, vì vậy trường hợp của Pro là chiều sâu trong lý luận đa bước dài hơn là thông lượng tác nhân. V4 Pro không còn được cung cấp trên Okou — trang của nó ở đây là tài liệu tham khảo.
DeepSeek V4 Flash so với GPT 5.6 Luna
Cả hai đều là cấp giá rẻ trong dòng của chúng và cả hai đều chạy trên khung Codex. Luna là đa phương thức và được hỗ trợ bởi hệ sinh thái của OpenAI; Flash chỉ có văn bản, trọng lượng mở, có giá dưới một phần tư giá đầu ra của Luna và đăng các điểm chuẩn tác nhân được công bố mạnh hơn nhiều. Chọn Luna khi bạn cần tầm nhìn hoặc hành vi cụ thể của OpenAI, Flash khi công việc là mã và công cụ.
DeepSeek V4 Flash so với Claude Sonnet 4.6
Sonnet 4.6 là một mô hình tác nhân cốt lõi có tầm nhìn, khung Claude Code và độ tin cậy định tuyến công cụ của Anthropic; Flash là một mô hình chỉ văn bản tiết kiệm chi phí với giá đầu ra bằng khoảng một phần năm mươi của Sonnet. Giữ Sonnet ở các bước quyết định một lần chạy và cung cấp cho Flash khối lượng bên dưới nó.
Điểm mấu chốt: bạn có nên sử dụng DeepSeek V4 Flash không?
DeepSeek V4 Flash là cách rẻ nhất để chạy một tác nhân mã hóa có năng lực trên Okou: các tiêu chuẩn tác nhân gần biên giới, cửa sổ 1M token và 0,28 đô la cho mỗi 1M token đầu ra. Xác minh số liệu của nhà cung cấp trên kho lưu trữ của riêng bạn, giữ tầm nhìn và lý luận khó nhất ở nơi khác, và rất khó để đánh bại về chi phí cho mỗi tác vụ hoàn thành.
Các câu hỏi thường gặp
Cửa sổ ngữ cảnh của DeepSeek V4 Flash là gì?
1M token đầu vào và lên đến 384K token đầu ra mỗi phản hồi. DeepSeek khuyến nghị giới hạn đầu ra 384K đầy đủ ở các cấp độ nỗ lực suy luận high và max.
DeepSeek V4 Flash có giá bao nhiêu?
Giá niêm yết của nhà cung cấp là 0,14 đô la cho mỗi 1 triệu token đầu vào và 0,28 đô la cho mỗi 1 triệu token đầu ra, với các lượt truy cập bộ nhớ đệm là 0,0028 đô la cho mỗi 1 triệu và không tính phí ghi bộ nhớ đệm. Trên Okou, nó nằm trong cấp giá $, rẻ nhất trong bốn cấp. DeepSeek đã công bố chính sách giờ cao điểm sẽ tăng gấp đôi giá niêm yết của họ từ 09:00-12:00 và 14:00-18:00 giờ Bắc Kinh; nó vẫn chưa có hiệu lực.
DeepSeek V4 Flash có tốt hơn DeepSeek V4 Pro không?
Trên chín điểm chuẩn tác nhân mà DeepSeek đã công bố cho bản dựng 0731, vâng: nó đạt điểm cao hơn V4 Pro (Xem trước) trên mọi điểm, trong khi kích hoạt 13B tham số so với 49B của Pro. Pro vẫn giữ lợi thế về suy luận đa bước dài hạn. V4 Pro không còn được cung cấp trên Okou.
DeepSeek V4 Flash có hỗ trợ tầm nhìn không?
Không. Nó chỉ chấp nhận văn bản và mã. Định tuyến các bước dựa trên ảnh chụp màn hình, biểu đồ hoặc PDF đến một mô hình đa phương thức như Claude Sonnet 4.6 hoặc GPT 5.6 Luna.
DeepSeek V4 Flash sử dụng khung nào trên Okou?
Codex. Okou định tuyến nó thông qua DeepSeek's Responses API, mà V4 Flash hiện là mô hình DeepSeek duy nhất hỗ trợ. Chạy nó như một mô hình tích hợp được tính phí bằng tín dụng Okou, hoặc mang theo khóa DeepSeek API của riêng bạn.
Các lựa chọn thay thế
Sử dụng DeepSeek V4 Flash trên Okou
Hai cách truy cập DeepSeek V4 Flash trên Okou
Okou hỗ trợ DeepSeek V4 Flash dưới dạng mô hình tích hợp được tính phí bằng tín dụng Okou, và thông qua việc tự mang theo với DeepSeek API key. Đường dẫn tích hợp sử dụng định tuyến được quản lý Okou và cấp giá được giải thích bên dưới; đường dẫn tự mang theo sẽ tính phí trực tiếp cho bạn với nhà cung cấp thượng nguồn và bỏ qua hoàn toàn việc chuyển đổi tín dụng Okou.
Đề xuất của Okou
Okou định vị DeepSeek V4 Flash như một lựa chọn tiết kiệm chi phí cho việc phân loại hàng loạt, bộ lọc trước, phản hồi nhạy cảm với độ trễ và các công việc khối lượng lớn khác.
Tín dụng và cấp giá $
Okou định giá mọi mô hình Tích hợp theo thang tín dụng bốn bước — $, $$, $$$, $$$$ — được hiển thị dưới dạng huy hiệu trong bộ chọn mô hình và trên dòng price tier của zero model ls. DeepSeek V4 Flash nằm ở $. Cấp đó là số tiền bạn chi tiêu từ số dư tín dụng Okou của mình; giá niêm yết của nhà cung cấp trong bảng trên là số tiền nhà cung cấp thượng nguồn tính trước khi Okou chuyển đổi nó thành tín dụng.
Có sẵn trên Okou từ July 31, 2026.

