DeepSeek V4.1-Flash Được Phát Hành: Tính Năng, Thang Điểm, và Cách Truy Cập

2026-09-11
DeepSeek V4.1-Flash Được Phát Hành: Tính Năng, Thang Điểm, và Cách Truy Cập

DeepSeek đã phát hành flagship mới nhất hiệu quả của mình, DeepSeek V4.1 Flash, định vị mẫu mới của DeepSeek như một bước tiến quyết định về khả năng, tốc độ, chi phí và khả năng mở rộng. 

Phát hành vào khoảng 10 tháng 9 năm 2026, mẫu này được công ty mô tả là thành viên nhỏ gọn nhất của gia đình kiến trúc mới. Nó được thiết kế để nâng cao khả năng, tăng tốc độ đầu ra, tăng thông lượng và mở đường cho các mẫu lớn hơn.

Theo DeepSeek và thử nghiệm nội bộ/ngoại bộ, DeepSeek V4.1 Flash hoàn toàn vượt trội hơn V4 Pro trước đó về hiệu suất, chi phí, tốc độ và tổng thời gian trễ/hoàn thành nhiệm vụ. 

Do đó, DeepSeek đang loại bỏ V4 Pro. Bắt đầu từ 04:00 UTC ngày 14 tháng 9 năm 2026, mọi yêu cầu gửi tới deepseek-v4-pro sẽ tự động được chuyển đến DeepSeek V4.1 Flash và được lập hóa đơn theo mức giá Flash. 

Sắp xếp này sẽ tiếp tục cho đến khi V4.1 Pro được ra mắt. Các điểm cuối V4-Flash và V4-Flash-Vision-Exp cũ đã bị nghỉ, với các bí danh tương thích tạm thời điều hướng đến mẫu mới.

join bitrue to get 938 usdt

Điểm rút ra chính

  • DeepSeek V4.1 Flash là một mô hình Mixture-of-Experts với 552B tham số và chỉ 8B tham số hoạt động trên đầu vào và 16B trên đầu ra, mang lại kết quả mạnh hơn V4 Pro với chi phí và độ trễ thấp hơn nhiều.
  • Tính đa phương tiện bản địa, bộ nhớ KV nhỏ hơn đáng kể (1/4 HBM, 1/8 SSD của thế hệ trước), trọng số mở MIT cấp phép, và mức giá tối đa $0.30/$1.20 cho mỗi 1 triệu token khiến nó trở nên hấp dẫn cho các khối lượng công việc tác động và cao.
  • Từ 04:00 UTC ngày 14 tháng 9 năm 2026, tất cả các yêu cầu deepseek-v4-pro sẽ chuyển đến DeepSeek V4.1 Flash với mức giá Flash cho đến khi V4.1 Pro ra mắt; các nhà phát triển nên chủ động di chuyển và thử nghiệm những thay đổi về lời nhắc/hành vi.

Tại sao sự chuyển đổi đột ngột lại gây tranh cãi

DeepSeek V4.1-Flash Released - Bitrue.png

Nguồn: X/Deepseek

Cui Tianyi của đội nhóm Harness của DeepSeek đã nhấn mạnh trên X rằng V4.1 Flash hoàn toàn vượt trội V4 Pro về các chỉ số quan trọng, khiến việc duy trì mô hình cũ, đắt đỏ và chậm chạp trở nên không hiệu quả. 

Từ góc độ của DeepSeek, sự thay đổi là đơn giản: người dùng nhận được một mô hình mạnh hơn, nhanh hơn và rẻ hơn trong khi công ty giải phóng tài nguyên tính toán.

Nhiều nhà phát triển không đồng ý với cách thực hiện. Sự chuyển đổi được thông báo với khoảng một ngày thông báo và không có khoảng thời gian di chuyển song song.

Các hệ thống sản xuất mà đã tinh chỉnh cẩn thận các lời nhắc, định dạng đầu ra, chuỗi gọi công cụ, và kiểm tra kiểm soát chất lượng cho V4 Pro có nguy cơ gặp những thay đổi bất ngờ trong việc thực hiện chỉ dẫn, độ dài câu trả lời, hành vi từ chối, hoặc cấu trúc. 

Các nhóm nghiên cứu sử dụng DeepSeek-V4-Pro-0813 cho các thí nghiệm đang diễn ra cũng đã bày tỏ mối quan tâm về khả năng tái sản xuất. 

Các bình luận viên nhấn mạnh các thực hành kỹ thuật phần mềm tiêu chuẩn, các ID mô hình khác biệt, các khoảng thời gian chuyển tiếp kéo dài nhiều tuần, và tùy chọn quay trở lại, đặc biệt là khi các mô hình trở thành phụ thuộc trong các quy trình tác động và logic kinh doanh.

Đọc thêm: Người trong cuộc tiết lộ DeepSeek V4 vượt trội hơn các đối thủ AI lập trình.

Các tính năng và kiến trúc của DeepSeek V4.1

DeepSeek V4.1-Flash Released - Bitrue.png

Nguồn: datacamp

DeepSeek V4.1 Flash là một mô hình Mixture-of-Experts thưa thớt với tổng cộng 552 tỷ tham số. Chỉ khoảng 8 tỷ tham số được kích hoạt trong quá trình điền trước (đầu vào) và 16 tỷ trong quá trình giải mã. 

Nó sử dụng kiến trúc Bộ mã hóa-giải mã Causal (CED): một Transformer 40 lớp chia thành 20 lớp bộ mã hóa nguyên nhân và 20 lớp bộ giải mã. 

Bộ nhớ KV toàn cầu của bộ giải mã được dự đoán từ các trạng thái ẩn cuối cùng của bộ mã hóa thay vì được xây dựng lại lớp theo lớp. 

Kết hợp với Sự chú ý thưa thớt nén 2 (CSA2), lưu trữ KV FP4, và SWA Bounded Replay, bộ nhớ KV toàn cầu co lại còn khoảng 890 byte cho mỗi token, khoảng một phần tư HBM và một phần tám SSD của thế hệ Flash trước đó.

Các thành phần bổ sung bao gồm bộ nhớ điều kiện Engram (196B tham số được truy cập thưa thớt qua tìm kiếm token), 

Trộn lẫn mHC đơn pass, và giải mã dự đoán DSpark. Mỗi lớp MoE có 1 chuyên gia chia sẻ và 384 chuyên gia điều hướng, kích hoạt 6 chuyên gia điều hướng cho mỗi token.

Mô hình được đào tạo từ đầu trên một tập dữ liệu đa phương tiện 45 nghìn tỷ token, với ngữ cảnh mở rộng đến 1 triệu token. Nó nhận đầu vào là hình ảnh và văn bản thông qua một bộ mã hóa thị giác (DeepSeek-ViT) và máy chiếu được đào tạo đồng thời từ đầu quá trình đào tạo trước. 

Hậu đào tạo theo con đường quen thuộc SFT → RL → chưng cất theo chính sách, với sự nhấn mạnh mạnh mẽ vào việc tổng hợp tự động quy mô lớn các nhiệm vụ và môi trường tác động. 

Nỗ lực lập luận có thể kiểm soát liên tục từ 1 đến 100, cho phép người dùng trao đổi chi phí với độ chính xác trên mỗi yêu cầu.

Các tính năng DeepSeek V4.1 này chuyển thành những lợi thế cụ thể cho các khối lượng công việc tác động: đọc lại bối cảnh dài với chi phí thấp hơn, độ đồng thời cao hơn và áp lực bộ nhớ thấp hơn trên phần cứng phục vụ.

Đọc thêm: DeepSeek và Qwen của Alibaba đánh bại OpenAI ChatGPT trong cuộc thi giao dịch tiền điện tử.

Hiệu suất tiêu chuẩn

DeepSeek báo cáo kết quả mạnh mẽ trên các chuẩn tác động và lập trình với nỗ lực lập luận tối đa. Các so sánh được chọn:

Tiêu chuẩn

DeepSeek V4.1 Flash

Ghi chú / Tham khảo trước hoặc biên giới

Terminal-Bench 2.1

90.6

V4-Flash-0731 trước đó ~82.7

DeepSWE v1.1

74.2

Cạnh tranh với hoặc vượt qua các mẫu biên giới gần đây trong nhiệm vụ này

AutomationBench

54.8

Trình diễn mạnh mẽ tương đối

Kỳ thi cuối cùng của đại lý

31.8

Vượt qua một số đồng nghiệp

CyberGym

88.1

Điểm số nhiệm vụ an ninh mạng mạnh mẽ

GPQA Diamond

90.9

Khoa học tốt nghiệp ở mức độ cao

Xếp hạng Codeforces

3471

Cải thiện hơn V4 Pro

MathArena Apex

65.6

Khớp với những người đồng cấp được báo cáo hàng đầu

Kỳ thi cuối cùng của nhân loại (chỉ văn bản)

36.8 / 39.1†

Thử nghiệm cài đặt chuyên gia khó nhất

Terminal-Bench 3.0 / 4.0

30.0 / 31.2

Sự sụt giảm đáng chú ý trên các bộ dài hạn hơn

Hiệu suất mạnh nhất trên các vòng lặp tác nhân ngắn hạn, khối lượng cao và yếu hơn trong các đánh giá an ninh dài hạn hoặc chuyên biệt nhất.

Mô hình được ưa chuộng để định tuyến lưu lượng tác nhân khối đến DeepSeek V4.1 Flash trong khi giữ lại các mô hình biên nặng hơn cho các nhiệm vụ dư thừa khó nhất.

Giá cả và Tính khả dụng

DeepSeek V4.1-Flash Released - Bitrue.png

Nguồn: X/Deepseek

Giá cập nhật cho DeepSeek V4.1 Flash có hiệu lực lúc 04:00 UTC ngày 10 tháng 9 năm 2026:

Tỷ lệ

Đỉnh cao

Ngoài giờ cao điểm

Đầu vào (thiếu bộ nhớ đệm) trên mỗi 1M token

$0.30

$0.15

Đầu vào (có bộ nhớ đệm) trên mỗi 1M token

$0.006

$0.003

Đầu ra trên mỗi 1M token

$1.20

$0.60

Tỷ lệ ngoài giờ cao điểm bằng một nửa tỷ lệ cao điểm. Các khoảng thời gian cao điểm thường từ 01:00–04:00 và 06:00–10:00 UTC vào các ngày trong tuần.

Giá bộ nhớ đệm khiến các thông báo hệ thống hoặc tài liệu được lặp lại cực kỳ rẻ, một lợi thế quan trọng cho các tác nhân đọc lại các ngữ cảnh ổn định lớn.

Mô hình có sẵn thông qua API DeepSeek (tương thích với OpenAI) dưới định danh deepseek-flash. Các trọng số có giấy phép MIT được công bố cho việc tự lưu trữ, sử dụng thương mại, tinh chỉnh và phân phối lại.

Cách sử dụng DeepSeek V4.1

API (được khuyến nghị cho hầu hết người dùng):

Thay đổi URL cơ sở và tên mô hình trong bất kỳ khách hàng tương thích với OpenAI nào:

DeepSeek V4.1-Flash Released - Bitrue.png

Đầu vào hình ảnh gốc được hỗ trợ trong cùng một yêu cầu. Các đối tác chính thức bao gồm WorkBuddy/CodeBuddy và OpenCode đã tiết lộ mô hình.

DeepSeek Harness (cập nhật lên 0.1.5) tích hợp sâu với V4.1 Flash, thêm hỗ trợ cho các công cụ chuẩn, gọi chương trình, và chế độ tối giản, cùng với các điểm mở rộng UI được cải thiện và xử lý tệp.

Tự lưu trữ: Tải xuống các trọng số MIT và phục vụ với bộ nhớ GPU thích hợp.

DeepSeek lập kế hoạch hợp tác với cộng đồng mã nguồn mở về hỗ trợ suy diễn và cấu hình triển khai lớn hơn.

Ghi chú di chuyển: Nếu bạn vẫn gọi deepseek-v4-pro, hãy chuẩn bị chuyển sang deepseek-flash trước hoặc ngay sau ngày 14 tháng 9 năm 2026. Thử lại các thông báo, sơ đồ đầu ra, chuỗi công cụ, và bảo đảm chất lượng, vì khả năng trung bình cao hơn nhưng chi tiết hành vi có thể khác nhau.

Bối cảnh rộng hơn: Quy mô Kỹ thuật và Kế hoạch Tương lai

DeepSeek V4.1-Flash Released - Bitrue.png

Nguồn: datacamp

Hai ngày trước thông báo định tuyến, DeepSeek đã đăng khoảng 150 vị trí kỹ sư backend và máy chủ cao cấp.

Hầu như không có vị trí nào tập trung vào việc đào tạo mô hình; trọng tâm là hệ điều hành, ảo hóa, mạng, lưu trữ, lập lịch, container, các mặt phẳng kiểm soát, và điện toán đàn hồi của Agent (DSec).

DSec là hạ tầng hộp cát của DeepSeek cho các triển khai tác nhân quy mô lớn, hỗ trợ các container được làm ấm trước, môi trường tương thích với Docker, micro-VM Firecracker, và VM QEMU đầy đủ, được hỗ trợ bởi hệ thống tệp phân tán 3FS và nhật ký theo dõi thứ tự toàn cầu để phục hồi đáng tin cậy sau gián đoạn.

Làn sóng tuyển dụng cho thấy rằng DeepSeek đang đầu tư mạnh mẽ vào các hệ thống bên dưới mô hình của nó để hỗ trợ khối lượng dữ liệu ngày càng tăng, môi trường tác nhân đồng thời, và tải yêu cầu.

DeepSeek cũng đã hợp tác với CITIC Securities như một trong những đơn vị bảo lãnh chuẩn bị cho một可能的IPO trên Thị trường sao Thượng Hải, với mục tiêu bắt đầu quy trình vào cuối năm 2026.

Nguồn vốn trước đó đã định giá công ty trên 50 tỷ đô la, với các báo cáo sau đó thảo luận về các định giá tiềm năng khoảng 75 tỷ đô la.

Vốn được kỳ vọng sẽ hỗ trợ cơ sở hạ tầng tính toán, phát triển mô hình, và giữ chân nhân tài.

Đọc thêm: DeepSeek AI Gây sốc cho các nhà giao dịch: Altcoin này có thể là Dogecoin tiếp theo

Kết luận

DeepSeek V4.1 Flash chứng minh rằng sự đổi mới kiến trúc mạnh mẽ, thiết kế Bộ mã hóa-Giải mã Causal, nén KV-cache cực đoan, kích hoạt thưa thớt, và đa dạng tính năng gốc, có thể cung cấp hiệu suất tác nhân gần phía biên với một phần chi phí của các đối thủ khóa kín.

Mô hình đặc biệt hấp dẫn đối với các tác nhân lập trình khối lượng cao, lý luận theo nhóm, quy trình nhiều tài liệu, và bất kỳ khối lượng công việc nào được hưởng lợi từ việc tái sử dụng bối cảnh dài hạn rẻ tiền.

Những cảnh báo chính của nó là kết quả yếu hơn trên các bộ tác nhân dài hạn nhất và ma sát hoạt động của việc lập lịch cao điểm/người ngoài giờ hoặc yêu cầu phần cứng tự lưu trữ.

Cuộc tranh cãi xung quanh sự chuyển hướng đột ngột của V4 Pro nhấn mạnh một điểm rộng hơn: khi các mô hình trở thành sự phụ thuộc trong sản xuất, việc tách biệt phiên bản, thông báo trước, và các khoảng thời gian chuyển tiếp có ý nghĩa quan trọng như khả năng thô.

Sự sẵn sàng của DeepSeek để thuê 150 kỹ sư cho các hệ thống cơ bản cho thấy họ hiểu yêu cầu kỹ thuật ở quy mô lớn; việc áp dụng cùng một sự nghiêm ngặt cho hợp đồng phiên bản mô hình mà nhà phát triển thấy sẽ tăng cường thêm niềm tin.

Dù bạn truy cập DeepSeek V4.1 Flash qua API hay tự lưu trữ các trọng số mở, sự kết hợp giữa hiệu suất, giá cả, sự mở cửa, và hỗ trợ đa phương thức nội tại khiến nó trở thành một trong những bản phát hành tập trung vào hiệu quả thú vị nhất vào cuối năm 2026.

Kiểm tra nó trên các tải công việc của bạn, đo lường độ trễ thực tế và sự chênh lệch chất lượng, và quyết định liệu kinh tế có biện minh cho việc chuyển đổi khối lượng lưu lượng của bạn hay không.

Giữ thông tin về những phát triển mới nhất trong công nghệ, thị trường, và các xu hướng nổi bật. Để có thông tin liên tục về thị trường crypto và các hiểu biết liên quan, hãy tiếp tục đọc các bài viết mới nhất trên blog Bitrue.

Câu hỏi thường gặp

1. DeepSeek V4.1 Flash là gì?

Đó là mô hình Mixture-of-Experts đa phương thức hiệu quả nhất của DeepSeek (tổng cộng 552B tham số, 8B/16B hoạt động), được phát hành vào tháng 9 năm 2026. Nó có kiến trúc Bộ Mã hóa-Giải mã Causal, khả năng hiểu hình ảnh nội tại, một cửa sổ bối cảnh 1M-token, và các trọng số mở có giấy phép MIT.

2. DeepSeek V4.1 Flash so sánh với V4 Pro như thế nào?

DeepSeek cho biết rằng sau các bài kiểm tra nội bộ và bên ngoài, V4.1 Flash vượt trội hoàn toàn V4 Pro về hiệu suất, chi phí, tốc độ, và tổng thời gian hoàn thành nhiệm vụ. Do đó, lưu lượng V4 Pro đang được chuyển hướng sang Flash.

3. Giá của DeepSeek V4.1 Flash là bao nhiêu?

Giá cao nhất là $0.30 cho đầu vào / $1.20 cho đầu ra mỗi 1M token; giá ngoài giờ cao điểm chỉ bằng một nửa. Đầu vào trúng bộ nhớ có giá thấp nhất chỉ $0.006 (cao điểm) / $0.003 (ngoài giờ cao điểm). Giá sẽ có hiệu lực từ 10 tháng 9 năm 2026.

4. Làm thế nào để tôi sử dụng DeepSeek V4.1 / DeepSeek V4.1 Flash?

Sử dụng API tương thích với OpenAI với model="deepseek-flash" và base_url="https://api.deepseek.com", hoặc tải xuống các trọng số MIT để tự lưu trữ. Các đối tác như CodeBuddy và OpenCode đã hỗ trợ; DeepSeek Harness cung cấp thêm cơ sở hạ tầng cho tác nhân.

5. Khi nào V4 Pro ngừng hoạt động và điều gì sẽ xảy ra tiếp theo?

Từ 04:00 UTC ngày 14 tháng 9 năm 2026, tất cả các yêu cầu deepseek-v4-pro sẽ được chuyển hướng đến DeepSeek V4.1 Flash với giá Flash cho đến khi V4.1 Pro được phát hành. Người dùng nên di chuyển và xác thực lại các đường ống của mình kịp thời.

 

Lưu ý: Các quan điểm được thể hiện hoàn toàn thuộc về tác giả và không phản ánh quan điểm của nền tảng này. Nền tảng này và các công ty con của nó từ chối bất kỳ trách nhiệm nào về độ chính xác hoặc tính phù hợp của thông tin được cung cấp. Nó chỉ mang tính chất thông tin và không được coi là lời khuyên tài chính hoặc đầu tư.

Tuyên bố từ chối trách nhiệm: Nội dung của bài viết này không cấu thành lời khuyên tài chính hoặc đầu tư.

Đăng ký ngay để nhận gói quà tặng người mới trị giá 6752 USDT

Tham gia Bitrue để nhận phần thưởng độc quyền

Đăng ký Ngay
register

Được đề xuất

Hệ sinh thái Arc: Các dự án hàng đầu, đối tác và DApps cần chú ý
Hệ sinh thái Arc: Các dự án hàng đầu, đối tác và DApps cần chú ý

Khám phá các dự án hàng đầu, đối tác và dApps tốt nhất trong hệ sinh thái Arc trên blockchain Layer 1 gốc của Circle cho thanh toán và DeFi. Kiểm tra ngay tại đây!

2026-09-11Đọc