QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

DeepSeek V4 Flash Vision Exp : premier multimodal ouvert

Un paysage découpé en patches traverse un module de traitement pour produire une représentation textuelle.
Illustration conceptuelle du passage de l’image au texte par un modèle multimodal.

Analyse du dépôt publié le 31 août 2026, de ce que l'encodeur visuel ajoute à l'architecture V4 Flash, et de ce que le suffixe expérimental engage pour qui envisage de le déployer.

Réponse courte. DeepSeek V4 Flash Vision Exp est le premier modèle multimodal de la famille DeepSeek V4, publié le 31 août 2026 sous licence MIT. Il reprend l'architecture de V4 Flash 0731, soit 284 milliards de paramètres dont 13 actifs par token et une fenêtre de 1 048 576 tokens, et lui adjoint un encodeur visuel de 32 couches. Les poids occupent 168 gigaoctets répartis sur 48 fichiers. L'éditeur le qualifie lui-même d'expérimental, ce que le suffixe Exp inscrit dans le nom du dépôt, et il ne publie qu'une implémentation de référence en PyTorch.

Méthodologie

Chaque chiffre de cette page a été relevé le 31 août 2026 directement sur le dépôt : le fichier config.json pour l'architecture, l'API de Hugging Face pour le poids des fichiers et la nature des tenseurs, la carte du modèle pour les scores.

La comparaison avec DeepSeek V4 Flash 0731 procède d'une différence terme à terme entre les deux fichiers de configuration, ce qui isole exactement ce que la version visuelle modifie.

Les scores présentés plus bas sont ceux que DeepSeek déclare dans sa propre carte de modèle. Aucun tiers ne les a reproduits à la date de publication de cet article, le dépôt ayant alors quelques heures d'existence. Nous les rapportons donc comme des déclarations d'éditeur, pas comme des mesures indépendantes, et la distinction est maintenue partout où ils apparaissent.

Que publie exactement le dépôt ?

La publication se compose de trois choses distinctes, qu'il vaut mieux ne pas confondre. Les poids d'abord, distribués en 48 fichiers au format safetensors totalisant 168 gigaoctets. Une chaîne d'encodage des invites ensuite, qui transforme des messages au format OpenAI en invite destinée au modèle.

Une implémentation d'inférence minimale en PyTorch enfin, que la documentation décrit comme couvrant l'encodeur visuel, l'aligneur, l'attention DFlash, le mélange d'experts, les Hyper-Connections et le chemin DSpark.

Cette implémentation de référence est le seul moyen d'exécution que l'éditeur fournit à ce stade. Le dépôt n'annonce ni recette pour un moteur de service établi, ni portage vers les runtimes que la production utilise habituellement. C'est une différence importante avec DeepSeek V4 Flash 0731, dont l'écosystème d'outillage s'est constitué depuis la fin du mois de juillet.

Deux notations d'invite coexistent et produisent, selon la documentation, des identifiants de token identiques : les blocs de contenu au format JSON d'OpenAI, et une notation textuelle compacte de la forme <image>chemin</image>. Le dépôt fournit un exemple de chacune.

Qu'ajoute l'encodeur visuel ?

La différence entre les deux fichiers de configuration livre l'ajout de façon nette. Le tronc de langage ne bouge pas : 43 couches, 256 experts routés dont 6 actifs par token, dimension cachée de 4096, fenêtre de 1 048 576 tokens. Tout ce qui est nouveau concerne la vision.

ParamètreValeurCe qu'il gouverne
vision_n_layers32Profondeur de la tour visuelle.
vision_dim1024Dimension des représentations visuelles.
vision_n_heads16Têtes d'attention de l'encodeur.
vision_inter_dim2816Dimension interne des couches de projection.
vision_patch_size14Côté en pixels d'un carreau élémentaire.
vision_downsample_ratio3Facteur de réduction avant passage au tronc.
vision_max_n_token384Plafond de tokens visuels par image.
vision_min_pixels147 456Surface minimale acceptée, soit 384 par 384.
vision_max_wh_ratio8Rapport largeur sur hauteur maximal admis.
vision_rope_theta10 000Base de l'encodage positionnel rotatif visuel.

Le coût de cet ajout se lit dans la composition des tenseurs publiés. Les éléments en BF16 passent de 1,5 à 1,9 milliard entre 0731 et la version visuelle, tandis que le gros du modèle reste inchangé, avec 296,4 milliards d'éléments en INT8 et 6,3 milliards en FP8. La tour visuelle représente donc environ 0,4 milliard d'éléments supplémentaires, ce qui explique que le poids sur disque ne progresse que de 167 à 168 gigaoctets. Ajouter la vision à ce modèle coûte moins d'un pour cent de son empreinte.

Deux modifications qui ne relèvent pas de la vision

La comparaison des configurations révèle deux changements qu'un lecteur pressé attribuerait à tort à la multimodalité, et qui pèsent pourtant sur le déploiement.

Le premier porte sur la prédiction multi-tokens, dont la profondeur passe de une à trois couches. Ce mécanisme sert au décodage spéculatif, où le modèle propose plusieurs tokens d'avance qu'une vérification valide ou rejette. Tripler cette profondeur modifie le compromis entre le coût de la proposition et le gain de débit, et tout réglage transposé depuis 0731 demande donc à être réévalué.

Le second est plus discret : la constante de stabilisation de la normalisation passe de 1e-06 à 1e-20. Cette valeur protège une division contre un dénominateur nul. La réduire de quatorze ordres de grandeur suppose que le calcul se fait dans une précision qui le supporte, et une conversion négligente vers un format plus étroit expose à des valeurs non numériques.

Enfin, le dépôt déclare exiger la version 5.0.0 de la bibliothèque Transformers, là où 0731 se contentait de la 4.57.1. Ce n'est pas un détail d'intendance : un environnement figé sur la branche 4 ne chargera pas ce modèle.

Quels scores l'éditeur de DeepSeek déclare-t-il ?

DeepSeek publie deux séries de résultats, obtenus selon sa propre note avec le mode minimal de son harnais d'agent, un niveau d'effort de raisonnement maximal, une température de 1,0 et un top_p de 0,95. Rappelons qu'il s'agit de déclarations de l'éditeur sur ses propres modèles.

Épreuve textuelleVision ExpFlash 0731Opus 4.8
Terminal Bench 2.183,982,785,0
NL2Repo57,754,269,7
Cybergym75,376,778,3
DeepSWE59,354,458,0
Toolathlon Verified75,970,376,2
DSBench-Hard63,659,671,7
AutomationBench25,725,127,2

Le résultat notable tient dans ce que ces chiffres ne montrent pas. Adjoindre une modalité visuelle dégrade fréquemment les capacités textuelles, puisque l'entraînement complémentaire déplace le modèle. Ici la carte annonce des performances comparables, et les valeurs relevées vont au-delà : six épreuves sur sept progressent, dont Toolathlon qui gagne 5,6 points et DeepSWE 4,9. Seule Cybergym recule, de 1,4 point.

Épreuve multimodaleVision ExpFlash 0731Opus 4.8
ApexBench (Pass@1)36,526,239,4
Agents' Last Exam27,325,225,7
Chartography64,3non évalué65,0
ZeroBench (Pass@5)35,0non évalué34,0

Le piège de la seconde table

Les deux premières lignes de la table multimodale portent dans la carte du modèle un appel de note dont la lecture change tout. DeepSeek précise que sur ApexBench et sur Agents' Last Exam, la version 0731 ignore purement et simplement les éléments visuels de l'entrée.

La colonne de référence ne mesure donc pas une vision moins bonne, elle mesure l'absence de vision.

L'écart de 10,3 points sur ApexBench ne compare pas deux encodeurs visuels : il compare un modèle qui voit à un modèle qui répond sans regarder. C'est une information utile sur ce que la vision apporte à une tâche donnée, ce n'est pas une comparaison de qualité visuelle. Les deux lignes suivantes, Chartography et ZeroBench, ne portent d'ailleurs aucune valeur pour 0731, ce qui est plus honnête et plus lisible.

Empreinte mémoire et matériel

Les 168 gigaoctets de poids constituent le plancher, jamais le besoin réel. À cette quantité s'ajoute le cache des clés et des valeurs, qui croît avec la longueur du contexte servi et avec le nombre de sessions simultanées.

Sur un modèle annonçant une fenêtre de 1 048 576 tokens, ce cache devient rapidement le poste dominant, et le dimensionnement doit partir de la fenêtre réellement servie plutôt que de la fenêtre maximale.

Ce calcul, et non cette mesure, situe le modèle parmi les machines à mémoire unifiée abondante ou les serveurs à plusieurs accélérateurs. Nous ne publions pas de débit pour ce modèle : nous ne l'avons pas mesuré, et recopier une valeur obtenue sur 0731 serait d'autant plus trompeur que la profondeur de prédiction multi-tokens a changé.

Ce que le qualificatif expérimental engage

Le suffixe Exp n'est pas une précaution de langage. Il signale une publication dont l'éditeur n'annonce ni stabilité d'interface, ni engagement de maintenance, ni disponibilité sur les moteurs de service établis. Un modèle expérimental peut voir sa configuration changer, son format d'invite évoluer, ou sa publication être remplacée par une version différemment nommée.

Pour une plateforme en production, cela place ce modèle du côté de l'évaluation et non du service. L'usage raisonnable consiste à l'essayer sur un jeu de tâches représentatif, à mesurer ce qu'il apporte sur vos propres documents, et à conserver DeepSeek V4 Flash 0731 comme socle tant que la version visuelle n'a pas de successeur stable.

Quand l'envisager

Quand ne pas l'envisager

Sources officielles

Vous évaluez un modèle multimodal en poids ouverts ?

Atelier de cadrage offert en une demi-journée, mené sur vos propres documents et vos contraintes de déploiement.

Réserver un échange

Questions fréquentes

DeepSeek V4 Flash Vision Exp est-il en poids ouverts ?

Oui. Le dépôt publie 168 gigaoctets de poids en 48 fichiers safetensors sous licence MIT, accompagnés du tokeniseur, de la chaîne d'encodage des invites et d'une implémentation d'inférence minimale en PyTorch.

En quoi diffère-t-il de DeepSeek V4 Flash 0731 ?

Le tronc de langage est identique, avec 43 couches, 256 experts routés dont 6 actifs et une fenêtre de 1 048 576 tokens. S'y ajoutent un encodeur visuel de 32 couches, une profondeur de prédiction multi-tokens portée de une à trois couches, une constante de normalisation abaissée de 1e-06 à 1e-20, et l'exigence de Transformers 5.0.0.

La vision dégrade-t-elle les performances textuelles ?

Selon les scores déclarés par DeepSeek, non. Six des sept épreuves textuelles progressent par rapport à 0731, Toolathlon gagnant 5,6 points et DeepSWE 4,9. Seule Cybergym recule de 1,4 point. Aucun tiers n'a reproduit ces mesures à ce jour.

Peut-on le mettre en production ?

L'éditeur le qualifie d'expérimental et ne fournit qu'une implémentation de référence en PyTorch, sans recette pour un moteur de service établi ni engagement de stabilité. Il relève donc de l'évaluation. DeepSeek V4 Flash 0731 reste le choix de service tant qu'une version visuelle stable n'est pas publiée.

Combien de tokens coûte une image ?

La configuration plafonne à 384 tokens visuels par image, impose une surface minimale de 147 456 pixels, soit 384 par 384, et refuse un rapport largeur sur hauteur supérieur à huit.

Pour aller plus loin