Formation IA 20 min de lecture

DeepSeek V4.1 Flash : prix de l'API dès 0,15 $, fin annoncée puis suspendue de V4-Pro

Au 16 septembre 2026, l'API DeepSeek V4.1 Flash coûte 0,15 à 1,20 $ par million de tokens selon l'heure ; V4-Pro devait s'effacer le 14, il reste servi.

DeepSeek V4.1 Flash : prix de l'API dès 0,15 $, fin annoncée puis suspendue de V4-Pro — Blog ADN IA

L'essentiel

Au 16 septembre 2026, DeepSeek V4.1-Flash est le modèle par défaut de l'API DeepSeek, sous l'identifiant deepseek-flash, depuis sa sortie le 10 septembre 2026. Tarifs relevés sur la page officielle : 0,30 $ par million de tokens en entrée (0,006 $ si le préfixe est déjà en cache) et 1,20 $ en sortie en heures pleines ; moitié prix en heures creuses, soit 0,15 $, 0,003 $ et 0,60 $. Les heures pleines couvrent 3 h-6 h et 8 h-12 h, heure de Paris, du lundi au vendredi : vos après-midis et vos week-ends sont en heures creuses. Le modèle compte 552 milliards de paramètres, en active 8 milliards en lecture et 16 en écriture, accepte 1 million de tokens de contexte et les images ; ses poids sont publiés sous licence MIT. DeepSeek avait annoncé que les requêtes deepseek-v4-pro seraient routées vers V4.1-Flash dès le 14 septembre à 4 h 00 UTC ; la page tarifs indique désormais que V4-Pro reste servi, au même prix, avec préavis promis avant tout changement. Aucune région européenne n'existe côté DeepSeek : les données sont stockées en Chine. Pour une PME française, V4.1-Flash est un très bon outil de prototypage et de traitement de données non personnelles ; pour le reste, il faut héberger les poids ailleurs.

DeepSeek V4.1 Flash, c'est quoi et qu'est-ce qui change par rapport à V4 ?

Publié le 10 septembre 2026, V4.1-Flash est « le plus petit modèle » d'une nouvelle famille d'architecture, et le premier de DeepSeek à lire nativement les images. Ce qu'écrit l'éditeur :

  • 552 milliards de paramètres, 8 milliards actifs en entrée et 16 en sortie : l'architecture « Causal Encoder-Decoder » (20 couches d'encodeur, 20 de décodeur) lit à moindre coût et ne mobilise le décodeur complet que pour écrire.
  • Cache KV divisé par quatre : 890 octets par token en mémoire GPU ; stockage SSD du cache persistant divisé par huit.
  • Contexte de 1 million de tokens, sortie jusqu'à 384 000 tokens, réflexion activée par défaut.
  • Vision native : JPEG, PNG, GIF et WebP, 600 images par requête au plus, 1 024 tokens par image au maximum.
  • Entraînement : 45 000 milliards de tokens, date d'arrêt des connaissances non publiée.
ModèleParamètres totauxParamètres actifsStatut API au 16 septembre 2026
DeepSeek-V4-Flash (0731)284 milliards13 milliardsRetiré ; deepseek-v4-flash est routé vers V4.1-Flash, au tarif Flash
DeepSeek-V4-Pro (0813)1 600 milliards49 milliardsMaintenu jusqu'à nouvel avis, au tarif V4-Pro
DeepSeek-V4.1-Flash552 milliards8 milliards en entrée, 16 en sortieModèle par défaut, deepseek-flash

DeepSeek V4.1 Flash, combien ça coûte via l'API ?

En heures pleines, 0,30 $ par million de tokens en entrée et 1,20 $ en sortie ; en heures creuses, la moitié. Grille relevée le 16 septembre 2026 sur la page « Models & Pricing », qui fait foi, en vigueur depuis le 10 septembre 2026 à 4 h 00 UTC (6 h 00 à Paris), en dollars par million de tokens.

PosteV4.1-Flash, heures pleinesV4.1-Flash, heures creusesV4-Pro, heures pleinesV4-Pro, heures creuses
Entrée, préfixe en cache (cache hit)0,006 $0,003 $0,044 $0,022 $
Entrée, hors cache (cache miss)0,30 $0,15 $1,32 $0,66 $
Sortie1,20 $0,60 $3,96 $1,98 $
Requêtes simultanées par compte2 5002 500500500
  • Baisse réelle mais inégale. La grille V4-Flash d'août (voir notre article d'août) affichait en heures pleines 0,014 $ en cache, 0,44 $ hors cache et 1,32 $ en sortie : 57 % de moins sur le cache, 32 % en entrée, 9 % en sortie. Les usages qui lisent beaucoup gagnent le plus.
  • V4-Pro coûte 4,4 fois plus en entrée et 3,3 fois plus en sortie, pour des scores que l'éditeur annonce inférieurs sur la plupart de ses tests.
  • Compteur prépayé : solde rechargé en dollars, solde offert consommé en premier, solde vide qui bloque les appels ; aucun palier gratuit permanent n'est documenté.

Heures creuses DeepSeek : quelles heures en France ?

La page tarifs définit les heures pleines en UTC : 1 h 00-4 h 00 et 6 h 00-10 h 00, du lundi au vendredi ; tout le reste est à moitié prix. À Paris, cela donne 3 h-6 h et 8 h-12 h jusqu'au 24 octobre 2026 (UTC+2), puis 2 h-5 h et 7 h-11 h dès le passage à l'heure d'hiver le 25 octobre (UTC+1) ; samedi et dimanche sont entièrement en heures creuses. La mention « du lundi au vendredi » n'existait pas sur la grille d'août.

Une PME qui lance ses lots l'après-midi, en soirée ou le week-end paie donc 0,15 $ en entrée et 0,60 $ en sortie ; en semaine, seuls 3 h-6 h et la matinée de travail (8 h-12 h) sont au plein tarif. Les éditeurs américains n'ont pas de tarif horaire : leurs remises passent par le traitement par lots, à moitié prix chez OpenAI, Anthropic et Google.

Le cache DeepSeek, comment ça marche et combien ça rapporte ?

Le cache est activé par défaut, sans changement de code. DeepSeek enregistre sur disque le préfixe de chaque prompt ; si une requête suivante commence exactement par le même préfixe, cette partie est facturée « cache hit », soit 0,006 $ au lieu de 0,30 $ : 50 fois moins cher. La réponse détaille le résultat dans deux champs, prompt_cache_hit_tokens et prompt_cache_miss_tokens.

Trois limites : le cache fonctionne par « unités de préfixe » complètes (un même document suivi de deux questions différentes n'est reconnu qu'à partir de la troisième requête) ; il est fourni « au mieux », sans taux garanti ; une entrée inutilisée est purgée « en quelques heures à quelques jours ». DeepSeek écrit que les frais de cache « représentent souvent une large part du coût des agents » : placez consignes, grille d'analyse et exemples en tête de prompt, la partie variable à la fin.

Que devient DeepSeek V4 Pro, et quel modèle sert le chat gratuit ?

Côté API, DeepSeek a fait machine arrière avant l'échéance. L'annonce du 10 septembre 2026 est nette : « à partir du 14 septembre 2026 à 04 h 00 UTC, toutes les requêtes deepseek-v4-pro seront routées vers V4.1-Flash, au tarif de V4.1-Flash », jusqu'à un futur V4.1-Pro. Mais la page tarifs et le journal des mises à jour, relus le 16 septembre, portent une autre note : « en réponse à la demande des utilisateurs », DeepSeek continue de fournir l'API V4 Pro après le 14 septembre 2026, « sans changement de facturation », et « informera de tout changement ». La page tarifs prime : V4-Pro reste disponible, à 1,32 $ et 3,96 $ en heures pleines, sans date de fin ; la presse chinoise date ce revirement du 11 septembre, DeepSeek ne l'a pas daté. V4-Flash et V4-Flash-Vision-Exp, eux, sont retirés : leurs anciens identifiants sont « temporairement » servis par V4.1-Flash, au tarif Flash ; changez-les dans votre code.

Côté application et site chat.deepseek.com, l'éditeur ne nomme pas le modèle servi au 16 septembre 2026. La dernière mention officielle date du 13 août 2026 (V4-Pro déployé dans l'application et sur le web) ; l'annonce de V4.1-Flash ne parle que de l'API. Seule trace : les notes de la version 2.5.1 de l'application iOS, datée du 12 septembre 2026 sur l'App Store, annoncent un « nouveau modèle disponible : fusion et mise à niveau des modes Instantané, Expert et Vision », sans le nommer. Le chat reste gratuit, sur inscription, aux mêmes conditions de traitement des données.

DeepSeek API vs GPT-6, Claude, Gemini : le coût d'un même travail

Prenons un traitement réel : classer et résumer 2 000 documents de 3 000 tokens, avec 500 tokens de réponse chacun, soit 6 millions de tokens en entrée et 1 million en sortie, sans cache. Résultat : de 1,50 $ chez DeepSeek en heures creuses à 110 $ pour les modèles phares américains, aux tarifs standards du 16 septembre 2026, hors résidence européenne et remises par lots.

Modèle (entrée / sortie par million de tokens)Coût du lot
DeepSeek V4.1-Flash, heures creuses (0,15 $ / 0,60 $)1,50 $
DeepSeek V4.1-Flash, heures pleines (0,30 $ / 1,20 $)3,00 $
DeepSeek V4-Pro, heures creuses (0,66 $ / 1,98 $)5,94 $
Gemini 3.8 Flash (0,75 $ / 3,75 $ jusqu'au 31 décembre 2026)8,25 $
DeepSeek V4-Pro, heures pleines (1,32 $ / 3,96 $)11,88 $
Claude Sonnet 5 (2 $ / 10 $)22,00 $
GPT-5.6 Sol (4 $ / 20 $, promotion garantie jusqu'au 21 novembre 2026)44,00 $
GPT-6 Astra (10 $ / 50 $)110,00 $
Claude Fable 5.1 (10 $ / 50 $)110,00 $

Trois réserves. Le prix au token ne dit rien du nombre de tokens consommés pour réussir : la réflexion de V4.1-Flash, activée par défaut, allonge la sortie, et le rapport technique montre que les tokens produits croissent avec l'effort demandé. Les remises par lots d'OpenAI, d'Anthropic et de Google divisent leurs montants par deux : V4.1-Flash reste le moins cher, même en heures pleines. Et Gemini 3.8 Flash doublera au 1er janvier 2027 (1,50 $ / 7,50 $). Les gammes concurrentes sont détaillées dans nos articles sur GPT-6 Astra, Claude Fable 5.1 et Gemini 3.8 Flash.

DeepSeek V4.1 Flash est-il vraiment au niveau de V4 Pro et des modèles américains ?

Oui sur la plupart de ses propres tests, non sur les plus durs. Chiffres du tableau 3 du rapport technique, effort de raisonnement maximal, tels que DeepSeek les publie ; les scores des concurrents ne coïncident pas avec ceux de leurs éditeurs (Anthropic donne 52,3 % à Opus 5 sur Terminal-Bench 4.0, DeepSeek 51,8), les protocoles diffèrent.

TestV4.1-FlashV4-ProClaude Opus 5GPT-5.6 Sol
GPQA Diamond (sciences)90,992,493,494,1
Terminal-Bench 2.1 (agent en terminal)90,687,989,188,8
Terminal-Bench 4.0 (tâches scientifiques)31,212,451,839,9
DeepSWE v1.1 (correction de code)74,262,774,073,0
HLE avec outils63,960,063,6non publié
Automation-Bench (tâches administratives)54,843,250,345,8
Agents' Last Exam31,825,728,626,7

Précision : la fiche Hugging Face de V4-Pro (préversion d'avril 2026, non mise à jour depuis le 22 juin) lui donnait 90,1 sur GPQA Diamond ; le rapport V4.1 mesure la version en service à 92,4. Deux enseignements :

  • V4.1-Flash dépasse V4-Pro sur tous les tests d'agent et de code du tableau et ne lui cède que sur les questions de sciences (GPQA Diamond, HLE sans outils) : c'est ce qui a décidé DeepSeek à vouloir retirer le grand modèle.
  • L'écart avec les modèles géants persiste sur les tâches d'expert : 31,2 contre 51,8 pour Opus 5 sur Terminal-Bench 4.0 ; « un écart demeure avec les modèles géants sur les tâches agentiques à dominante scientifique », écrit DeepSeek. Anthropic publie 55,8 % pour Claude Fable 5.1 sur ce test, OpenAI 57,9 % pour GPT-6 Astra (annonce du 3 septembre, reprise dans notre article GPT-6 Astra). Sur la vision, DeepSeek reconnaît « un écart global net » face aux systèmes fermés.

Le rapport ajoute un avertissement rare : la nouvelle architecture crée « des frontières de robustesse pas encore entièrement caractérisées », notamment sur la recherche dans de très longs contextes et la reprise de cache. Testez sur vos documents avant de généraliser.

Comment utiliser l'API DeepSeek depuis la France ?

Rien n'est bloqué géographiquement dans la documentation, mais rien n'est localisé non plus.

  • Compte et paiement : inscription sur la plateforme DeepSeek, clé API, solde prépayé. Les conditions, en vigueur depuis le 29 avril 2026, sont celles de Hangzhou DeepSeek Artificial Intelligence Co., qui « ne garantit pas que les services sont ou resteront disponibles dans certaines juridictions » et désigne les tribunaux de son siège en cas de litige.
  • Deux formats d'API : https://api.deepseek.com au format OpenAI (Chat Completions et Responses API) et https://api.deepseek.com/anthropic au format Anthropic, où un nom de modèle commençant par claude-opus est redirigé vers deepseek-v4-pro, facturé au tarif V4-Pro, et claude-sonnet ou claude-haiku vers deepseek-flash.
  • Outils prêts à l'emploi : DeepSeek documente Claude Code (modèle deepseek-flash[1m] pour le contexte d'un million de tokens), OpenCode et GitHub Copilot ; 2 500 requêtes simultanées par compte au plus.
  • Résidence des données : aucune option. Une seule adresse d'API, pas de région européenne, et une politique de confidentialité (10 février 2026) qui écrit que DeepSeek « collecte, traite et stocke directement vos données personnelles en République populaire de Chine », en évoquant des « garanties appropriées » pour les transferts sans en nommer aucune. RGPD, décisions des régulateurs italien et berlinois et alternatives : voir notre analyse DeepSeek et souveraineté ; obligations applicables depuis le 2 août 2026 : notre article sur l'AI Act.

Les poids sont-ils ouverts, et peut-on héberger V4.1 Flash en Europe ?

Oui pour les poids. La fiche Hugging Face, créée le 10 septembre 2026, indique que « ce dépôt et les poids du modèle sont sous licence MIT » : usage commercial, modification et redistribution libres. Le point de contrôle pèse environ 510 Go en 48 fichiers, en précision mixte FP4 pour les experts et FP8 pour le reste.

Non pour un serveur de PME. La recette vLLM, mise à jour le 16 septembre 2026, demande au minimum 614 Go de mémoire GPU, soit un nœud de huit H200 ou un plateau GB200 : des GPU loués, pas un placard technique. Où le trouve-t-on hors de Chine, au 16 septembre 2026 ?

  • Hébergeurs américains : Fireworks AI (0,22 $ en entrée, 0,66 $ en sortie par million), DeepInfra (0,20 $ / 0,60 $, cache 0,006 $), Novita et Baseten, listés « live » sur Hugging Face ; OpenRouter recense 18 fournisseurs.
  • Grands clouds : ni Microsoft Foundry, ni Amazon Bedrock, ni Gemini Enterprise Agent Platform de Google Cloud (ex-Vertex AI) ne listent V4.1-Flash. Microsoft sert DeepSeek-V4-Flash-0731 et V4-Pro (version du 23 avril 2026) dans ses régions européennes, dont France Central ; Bedrock s'arrête à V3.2 ; Google à V3.2, V3.1, R1-0528 et OCR.
  • Hébergeurs européens : Scaleway sert DeepSeek-V4-Flash-0731 (0,40 € en entrée, 0,80 € en sortie par million, contexte limité à 256 000 tokens pendant la préversion) mais pas V4.1 ; le catalogue AI Endpoints d'OVHcloud ne propose aucun modèle DeepSeek.

Pour V4.1-Flash sur des données qui doivent rester en Europe, il faut donc louer les GPU soi-même ; V4-Flash-0731, servi en Europe par Scaleway et Microsoft, reste la génération précédente.

Quand choisir DeepSeek V4.1 Flash en PME, et quand l'exclure ?

Bon choix, via l'API DeepSeek : prototyper (quelques milliers d'appels coûtent quelques dollars) ; traiter à grande échelle des données non personnelles (documentation publique, fiches produits, code sans secret métier) ; faire tourner des agents lecteurs sur des dépôts ouverts ou de longs rapports publics, de préférence en heures creuses.

À exclure, via l'API DeepSeek :

  • Toute donnée personnelle de clients, prospects ou salariés, et tout document couvert par le secret des affaires : contrats, prix négociés, code propriétaire. Les données partent en Chine, sans mécanisme de transfert nommé.
  • Les tâches d'expert scientifique ou de sécurité offensive, où l'éditeur reconnaît lui-même l'écart avec les modèles géants.
  • Un service en production sans plan de repli : cache « au mieux », robustesse « pas entièrement caractérisée », V4-Pro maintenu « jusqu'à nouvel avis ». Prévoyez une bascule.

Avec les poids auto-hébergés en Europe, la première exclusion tombe : les données ne quittent pas votre périmètre. Restent 614 Go de mémoire GPU à financer et l'exploitation à assumer.

FAQ

Quel est le prix de l'API DeepSeek V4.1 Flash ?

En heures pleines, 0,30 $ par million de tokens en entrée (0,006 $ si le préfixe est en cache) et 1,20 $ en sortie ; en heures creuses, 0,15 $, 0,003 $ et 0,60 $ (grille officielle relevée le 16 septembre 2026).

Quelles sont les heures creuses de DeepSeek en France ?

Tout sauf 3 h-6 h et 8 h-12 h, heure de Paris, du lundi au vendredi (1 h-4 h et 6 h-10 h UTC), jusqu'au passage à l'heure d'hiver le 25 octobre 2026, où ces plages deviennent 2 h-5 h et 7 h-11 h. Les week-ends sont entièrement en heures creuses, à moitié prix.

DeepSeek V4 Pro va-t-il disparaître ?

Pas pour l'instant. L'annonce du 10 septembre 2026 prévoyait de router deepseek-v4-pro vers V4.1-Flash dès le 14 septembre, mais la page tarifs indique, au 16 septembre, que V4-Pro reste servi au même tarif, avec préavis promis avant tout changement. V4-Flash et V4-Flash-Vision-Exp sont, eux, retirés.

DeepSeek est-il gratuit ?

Le chat (application et site) est gratuit sur inscription, avec des données traitées en Chine. L'API est payante, sur solde prépayé, sans palier gratuit permanent documenté.

Quelle est la différence entre DeepSeek V4 et V4.1 ?

V4 (avril-août 2026) comprenait V4-Flash (284 milliards de paramètres, 13 actifs) et V4-Pro (1 600 milliards, 49 actifs). V4.1-Flash (10 septembre 2026) passe à 552 milliards, 8 actifs en lecture et 16 en écriture, lit les images, divise le cache par quatre et dépasse V4-Pro sur la plupart des tests de DeepSeek. Un V4.1-Pro est évoqué, sans date.

Peut-on utiliser DeepSeek V4.1 Flash en respectant le RGPD ?

Pas via l'API DeepSeek pour des données personnelles : la politique de confidentialité indique un stockage en République populaire de Chine et aucune région européenne n'existe. Les poids MIT peuvent en revanche être hébergés en Europe, sans transfert ; au 16 septembre 2026, aucun hébergeur européen ne propose V4.1-Flash en service géré.

Notre lecture

V4.1-Flash est le meilleur rapport capacité-prix que nous ayons vu passer en 2026 : un lot de 2 000 documents revient à 1,50 $ en heures creuses, contre 110 $ pour les modèles phares américains. Lire avec 8 milliards de paramètres et écrire avec 16, c'est l'architecture des agents qui ingèrent beaucoup et écrivent peu, soit la majorité des automatisations utiles en PME.

Trois réserves. Le revirement sur V4-Pro montre une feuille de route qui se décide en public : ne construisez pas sur un identifiant sans plan B. L'éditeur reconnaît un écart sur les tâches d'expert et des zones de robustesse non caractérisées. Et la question des données n'a pas bougé : sur des informations sensibles, la seule voie est d'héberger les poids en Europe, avec 614 Go de mémoire GPU et une équipe.

Selon notre expérience projet, la bonne séquence est de prototyper sur l'API DeepSeek avec des données anonymisées ou publiques, de mesurer le coût par tâche réussie, puis de choisir entre un modèle européen géré et un auto-hébergement. C'est le travail de nos missions d'intégration d'intelligence artificielle ; pour en parler, contactez-nous, nous intervenons partout en France depuis Vannes.

Sources

Sources

deepseekapiprixllmpoids-ouvertspme

Besoin d'aide pour votre projet ?

Premier audit gratuit — on analyse votre situation en 30 minutes.

Articles similaires