DeepSeek V4.1-Flash publié : Fonctionnalités, Benchmark et Comment y Accéder

2026-09-11
DeepSeek V4.1-Flash publié : Fonctionnalités, Benchmark et Comment y Accéder

DeepSeek a lancé son dernier fleuron efficace, DeepSeek V4.1 Flash, positionnant le nouveau modèle de DeepSeek comme une étape décisive en termes de capacité, de vitesse, de coût et de scalabilité. 

Lancé autour du 10 septembre 2026, le modèle est décrit par la société comme le membre le plus compact de sa nouvelle famille architecturale. Il est conçu pour améliorer les capacités, accélérer la production, augmenter le débit et ouvrir la voie à des modèles plus grands.

Selon DeepSeek et les tests internes/externes, DeepSeek V4.1 Flash surpasse de manière exhaustive le précédent V4 Pro en termes de performance, de coût, de vitesse et de latence totale/temps d'achèvement des tâches. 

En conséquence, DeepSeek retire V4 Pro. À partir de 04:00 UTC le 14 septembre 2026, chaque demande envoyée à deepseek-v4-pro est automatiquement dirigée vers DeepSeek V4.1 Flash et facturée aux tarifs du niveau Flash. 

Cet arrangement continue jusqu'au lancement futur de V4.1 Pro. Les anciens points de terminaison V4-Flash et V4-Flash-Vision-Exp ont déjà été retirés, avec des alias de compatibilité temporaire redirigeant vers le nouveau modèle.

join bitrue to get 938 usdt

Points Clés

  • DeepSeek V4.1 Flash est un modèle Mixture-of-Experts de 552 milliards de paramètres avec seulement 8 milliards de paramètres actifs en entrée et 16 milliards en sortie, offrant des résultats plus solides que V4 Pro à un coût et une latence beaucoup plus bas.
  • Multimodalité native, cache KV nettement plus petit (1/4 HBM, 1/8 SSD de la génération précédente), poids ouverts sous licence MIT, et tarification maximale de 0,30 $/1,20 $ par 1M de tokens en font un choix très attractif pour les charges de travail agissantes et à fort volume.
  • À partir de 04:00 UTC le 14 septembre 2026, toutes les demandes deepseek-v4-pro seront redirigées vers DeepSeek V4.1 Flash aux tarifs Flash jusqu'au lancement de V4.1 Pro ; les développeurs devraient migrer de manière proactive et tester les changements de demande/comportement.

Pourquoi le Changement Soudain a Déclenché un Débat

DeepSeek V4.1-Flash Released - Bitrue.png

Source : X/Deepseek

Cui Tianyi de l'équipe Harness de DeepSeek a souligné sur X que V4.1 Flash surpasse entièrement V4 Pro sur les métriques clés, rendant la maintenance continue de l'ancien modèle, plus coûteux et plus lent, inefficace. 

Du point de vue de DeepSeek, le changement est simple : les utilisateurs reçoivent un modèle plus puissant, plus rapide et moins cher tandis que la société libère des ressources de calcul.

De nombreux développeurs n'étaient pas d'accord avec l'exécution. Le changement a été annoncé avec environ un jour de préavis et sans fenêtre de migration parallèle.

Les systèmes de production qui avaient soigneusement ajusté les demandes, les formats de sortie, les séquences d'appels d'outils et les contrôles de qualité pour V4 Pro risquaient des changements inattendus dans le suivi des instructions, la longueur des réponses, le comportement de refus ou la structure. 

Les équipes de recherche utilisant DeepSeek-V4-Pro-0813 pour des expériences en cours ont également exprimé des préoccupations concernant la reproductibilité. 

Les commentateurs ont insisté sur des pratiques d'ingénierie logicielle standard, des identifiants de modèle distincts, des périodes de transition de plusieurs semaines et des options de retour en arrière, surtout une fois que les modèles deviennent des dépendances à l'intérieur des pipelines d'agents et de la logique commerciale.

Lire aussi : Des initiés révèlent que DeepSeek V4 surpasse les concurrents en codage IA

Fonctionnalités et Architecture de DeepSeek V4.1

DeepSeek V4.1-Flash Released - Bitrue.png

Source : datacamp

DeepSeek V4.1 Flash est un modèle Mixture-of-Experts clairsemé avec 552 milliards de paramètres au total. Environ 8 milliards de paramètres s'activent pendant le pré-remplissage (entrée) et 16 milliards pendant le décodage. 

Il utilise une architecture Causal Encoder-Decoder (CED) : un Transformer à 40 couches divisé en un encodeur causal à 20 couches et un décodeur à 20 couches. 

Le cache KV global du décodeur est projeté à partir des derniers états cachés de l'encodeur plutôt que reconstruit couche par couche. 

Associé à la Compression Attention Clairsemée 2 (CSA2), au cache KV FP4, et au SWA Bounded Replay, le cache KV global se réduit à environ 890 octets par token, soit environ un quart de l'HBM et un huitième du stockage SSD de la génération Flash précédente.

Les composants supplémentaires incluent la mémoire conditionnelle Engram (196B de paramètres accessibles de manière éparse via la recherche de token), 

Le mélange résiduel mHC en un seul passage et le décodage spéculatif DSpark. Chaque couche MoE a 1 expert partagé et 384 experts routés, activant 6 experts routés par token.

Le modèle a été entraîné à partir de zéro sur un corpus multimodal de 45 trillions de tokens, avec une extension du contexte à 1 million de tokens. Il accepte nativement des images et du texte via un encodeur de vision (DeepSeek-ViT) et un projecteur entraîné conjointement dès le début de la pré-formation. 

Le post-entraînement suit le chemin habituel SFT → RL → distillation sur politique, avec un accent lourd sur la synthèse automatisée à grande échelle des tâches et environnements d'agents. 

L'effort de raisonnement est continuellement contrôlable de 1 à 100, permettant aux utilisateurs d'échanger coût contre précision pour chaque demande.

Ces fonctionnalités de DeepSeek V4.1 se traduisent par des avantages concrets pour les charges de travail agissantes : des relectures économiques de long contexte, une concurrence plus élevée et une pression mémoire plus faible sur le matériel de service.

Lire aussi : DeepSeek et le Qwen d'Alibaba battent OpenAI ChatGPT dans le concours de trading crypto

Performance de Benchmark

DeepSeek rapporte de solides résultats sur les benchmarks agissants et de codage à l'effort de raisonnement maximal. Comparaisons sélectionnées :

Benchmark

DeepSeek V4.1 Flash

Notes / Référence précédente ou de frontière

Terminal-Bench 2.1

90.6

Ancien V4-Flash-0731 ~82.7

DeepSWE v1.1

74.2

Compétitif avec ou à l'avant des modèles de frontière récents sur cette tâche

AutomationBench

54.8

Forte performance relative

Dernier Examen de l'Agent

31.8

En avance sur plusieurs pairs

CyberGym

88.1

Score fort de tâche en cybersécurité

GPQA Diamant

90.9

Science de niveau graduate solide

Note Codeforces

3471

Amélioré par rapport à V4 Pro

MathArena Apex

65.6

Correspond aux meilleurs pairs signalés

Le dernier examen de l'humanité (texte uniquement)

36.8 / 39.1†

Parcours des paramètres d'expert les plus difficiles

Terminal-Bench 3.0 / 4.0

30.0 / 31.2

Diminution notable sur des suites à long terme

Les performances sont les plus fortes sur des boucles d'agents à court terme à fort volume et plus faibles sur les évaluations de sécurité les plus exigeantes à long terme ou spécialisées. 

Le schéma favorise le routage du trafic des agents en masse vers DeepSeek V4.1 Flash tout en réservant des modèles frontaliers plus lourds pour les tâches résiduelles les plus difficiles.

Tarification et Disponibilité

DeepSeek V4.1-Flash Released - Bitrue.png

Source : X/Deepseek

Les nouvelles tarifications pour DeepSeek V4.1 Flash sont entrées en vigueur à 04:00 UTC le 10 septembre 2026 :

Taux

Pointe

Hors pointe

Entrée (échec de cache) par 1M de tokens

$0.30

$0.15

Entrée (cache réussi) par 1M de tokens

$0.006

$0.003

Sortie par 1M de tokens

$1.20

$0.60

Les tarifs hors pointe sont la moitié de ceux de la pointe. Les fenêtres de pointe sont généralement de 01:00 à 04:00 et de 06:00 à 10:00 UTC les jours de semaine. 

La tarification en cas de succès de cache rend les invites système ou les documents répétés extrêmement bon marché, un avantage important pour les agents qui relisent de grands contextes stables. 

Le modèle est disponible via l'officiel API DeepSeek (compatible avec OpenAI) sous l'identifiant deepseek-flash. Les poids sous licence MIT sont publiés pour l'auto-hébergement, l'utilisation commerciale, l'affinage et la redistribution.

Comment utiliser DeepSeek V4.1

API (recommandé pour la plupart des utilisateurs) :

Changez l'URL de base et le nom du modèle dans tout client compatible avec OpenAI :

DeepSeek V4.1-Flash Released - Bitrue.png

L'entrée d'image native est supportée dans la même demande. Les partenaires officiels, y compris WorkBuddy/CodeBuddy et OpenCode, exposent déjà le modèle. 

DeepSeek Harness (mis à jour à 0.1.5) s'intègre profondément avec V4.1 Flash, ajoutant le support pour les modes standard, appel d'outils programmatique et minimaliste, en plus d'améliorer les points d'extension de l'interface utilisateur et la gestion des fichiers.

Auto-hébergement : Téléchargez les poids MIT et servez avec une mémoire GPU appropriée. 

DeepSeek prévoit une collaboration avec la communauté open-source sur le support d'inférence et de plus grandes configurations de déploiement.

Note de migration : Si vous appelez encore deepseek-v4-pro, préparez-vous à passer à deepseek-flash avant ou immédiatement après le 14 septembre 2026. Re-testez les invites, schémas de sortie, séquences d'outils et portes de qualité, car la capacité moyenne est plus élevée mais les détails comportementaux peuvent différer.

Contexte général : Échelle d'ingénierie et Plans futurs

DeepSeek V4.1-Flash Released - Bitrue.png

Source : datacamp

Deux jours avant l'annonce de routage, DeepSeek a publié environ 150 offres d'emploi pour des ingénieurs backend et serveurs seniors. 

Presque aucun ne se concentre sur l'entraînement des modèles ; l'accent est mis sur les systèmes d'exploitation, la virtualisation, le réseau, le stockage, la planification, les conteneurs, les plans de contrôle et le calcul élastique des agents (DSec). 

DSec est l'infrastructure de bac à sable de DeepSeek pour les déploiements d'agents à grande échelle, prenant en charge des conteneurs préchauffés, des environnements compatibles Docker, des micro-VM Firecracker et des VM QEMU complètes, soutenues par le système de fichiers distribué 3FS et des journaux de traces ordonnés mondiaux pour une récupération fiable après des interruptions. 

La vague de recrutement signale que DeepSeek investit massivement dans les systèmes sous ses modèles pour soutenir les volumes de données croissants, les environnements d'agents concurrents et la charge de requête.

DeepSeek a également engagé CITIC Securities comme l'un des souscripteurs préparant une éventuelle introduction en bourse sur le marché STAR de Shanghai, avec un démarrage prévu d'ici la fin de 2026. 

Le financement précédent a évalué l'entreprise à plus de 50 milliards de dollars, avec des rapports ultérieurs discutant de valorisations potentielles autour de 75 milliards de dollars. 

Le capital devrait soutenir l'infrastructure de calcul, le développement de modèles et la rétention de talents.

Lire Aussi : DeepSeek AI choque les commerçants : Cet Altcoin pourrait être le prochain Dogecoin

Conclusion

DeepSeek V4.1 Flash démontre qu'une innovation architecturale agressive, un design d'encodeur-décodeur causal, une compression extrême du cache KV, une activation sparse et une multimodalité native peuvent offrir des performances d'agents adjacentes à la frontière à une fraction du coût des concurrents fermés. 

Le modèle est particulièrement convaincant pour les agents de codage à fort volume, le raisonnement par lots, les pipelines riches en documents, et toute charge de travail qui bénéficie d'une réutilisation à long contexte bon marché. 

Ses principaux avertissements sont des résultats plus faibles sur les suites d'agents à l'horizon le plus long et le frottement opérationnel de la planification de pointe/hors pointe ou des exigences matérielles d'auto-hébergement.

La controverse autour de la redirection abrupte de V4 Pro souligne un point plus large : lorsque les modèles deviennent des dépendances de production, l'isolement des versions, l'avertissement préalable et les fenêtres de transition comptent tout autant que la capacité brute.

La volonté de DeepSeek d'embaucher 150 ingénieurs pour les systèmes sous-jacents montre qu'elle comprend l'ingénierie requise à grande échelle ; appliquer la même rigueur au contrat orienté développeur des versions de modèles renforcerait encore la confiance.

Que vous accédiez à DeepSeek V4.1 Flash via l'API ou que vous auto-hébergiez les poids ouverts, la combinaison de la performance, du prix, de l'ouverture et du support multimodal natif en fait l'un des lancements les plus intéressants axés sur l'efficacité de fin 2026.

Testez-le sur vos charges de travail, mesurez la latence réelle et le delta de qualité, et décidez si l'économie justifie le changement de la majorité de votre trafic d'agent.

Restez informé sur les derniers développements en technologie, marchés et tendances émergentes. Pour une couverture continue du marché de la crypto et des informations connexes, continuez à lire les derniers articles sur le blog Bitrue.

FAQ

1. Qu'est-ce que DeepSeek V4.1 Flash ?

C'est le modèle multimodal Mixture-of-Experts le plus récent et efficace de DeepSeek (552 milliards de paramètres au total, 8B/16B actifs), publié en septembre 2026. Il dispose d'une architecture d'encodeur-décodeur causale, d'une compréhension d'image native, d'une fenêtre de contexte de 1 million de tokens et de poids ouverts sous licence MIT.

2. Comment DeepSeek V4.1 Flash se compare-t-il à V4 Pro ?

DeepSeek déclare qu'après des tests internes et externes, V4.1 Flash dépasse de manière exhaustive V4 Pro en performance, coût, vitesse et temps total d'achèvement des tâches. Par conséquent, le trafic de V4 Pro est redirigé vers Flash.

3. Quel est le tarif pour DeepSeek V4.1 Flash ?

Les tarifs de pointe sont de 0,30 $ input / 1,20 $ output par 1 million de tokens ; les tarifs hors pointe sont moitié moins. L'entrée en cache est aussi basse que 0,006 $ (pointe) / 0,003 $ (hors pointe). Les prix sont devenus effectifs le 10 septembre 2026.

4. Comment utiliser DeepSeek V4.1 / DeepSeek V4.1 Flash ?

Utilisez l'API compatible OpenAI avec model="deepseek-flash" et base_url="https://api.deepseek.com", ou téléchargez les poids MIT pour l'auto-hébergement. Des partenaires tels que CodeBuddy et OpenCode le prennent déjà en charge ; DeepSeek Harness fournit une structure d'agent supplémentaire.

5. Quand V4 Pro cesse-t-il de fonctionner et que se passe-t-il ensuite ?

À partir de 04:00 UTC le 14 septembre 2026, toutes les requêtes deepseek-v4-pro sont routées vers DeepSeek V4.1 Flash aux tarifs Flash jusqu'à ce que V4.1 Pro soit publié. Les utilisateurs doivent migrer et re-valider leurs pipelines rapidement.

 

Avertissement : Les opinions exprimées appartiennent exclusivement à l'auteur et ne reflètent pas les opinions de cette plateforme. Cette plateforme et ses affiliés déclinent toute responsabilité quant à l'exactitude ou à la pertinence des informations fournies. Cela est uniquement à des fins d'information et n'est pas destiné comme un conseil financier ou d'investissement.

Feragatname: Bu makalenin içeriği finansal veya yatırım tavsiyesi niteliğinde değildir.

Inscrivez-vous maintenant pour réclamer un package cadeau de 6752 USDT pour les nouveaux arrivants

Rejoignez Bitrue pour des récompenses exclusives

Inscrivez-vous maintenant
register

Recommandé

Où acheter le jeton FLYBRAIN ?
Où acheter le jeton FLYBRAIN ?

FLYBRAIN est un jeton à faible capitalisation disponible sur Robinhood Chain. Ce guide explique où acheter FLYBRAIN, comment connecter un portefeuilles compatible, vérifier l'adresse du contrat, compléter un échange et évaluer la liquidité, le glissement et d'autres risques avant de trader.

2026-09-11Lire