DeepSeek V4 Flash Vision Exp : premier multimodal ouvert
Analyse du dépôt publié le 31 août 2026, de ce que l'encodeur visuel ajoute à l'architecture V4 Flash, et de ce que le suffixe expérimental engage pour qui envisage de le déployer.
Méthodologie
Chaque chiffre de cette page a été relevé le 31 août 2026 directement sur le dépôt :
le fichier config.json pour l'architecture, l'API de Hugging Face pour le
poids des fichiers et la nature des tenseurs, la carte du modèle pour les scores.
La comparaison avec DeepSeek V4 Flash 0731 procède d'une différence terme à terme entre les deux fichiers de configuration, ce qui isole exactement ce que la version visuelle modifie.
Les scores présentés plus bas sont ceux que DeepSeek déclare dans sa propre carte de modèle. Aucun tiers ne les a reproduits à la date de publication de cet article, le dépôt ayant alors quelques heures d'existence. Nous les rapportons donc comme des déclarations d'éditeur, pas comme des mesures indépendantes, et la distinction est maintenue partout où ils apparaissent.
Que publie exactement le dépôt ?
La publication se compose de trois choses distinctes, qu'il vaut mieux ne pas confondre. Les poids d'abord, distribués en 48 fichiers au format safetensors totalisant 168 gigaoctets. Une chaîne d'encodage des invites ensuite, qui transforme des messages au format OpenAI en invite destinée au modèle.
Une implémentation d'inférence minimale en PyTorch enfin, que la documentation décrit comme couvrant l'encodeur visuel, l'aligneur, l'attention DFlash, le mélange d'experts, les Hyper-Connections et le chemin DSpark.
Cette implémentation de référence est le seul moyen d'exécution que l'éditeur fournit à ce stade. Le dépôt n'annonce ni recette pour un moteur de service établi, ni portage vers les runtimes que la production utilise habituellement. C'est une différence importante avec DeepSeek V4 Flash 0731, dont l'écosystème d'outillage s'est constitué depuis la fin du mois de juillet.
Deux notations d'invite coexistent et produisent, selon la documentation, des
identifiants de token identiques : les blocs de contenu au format JSON d'OpenAI, et une
notation textuelle compacte de la forme <image>chemin</image>.
Le dépôt fournit un exemple de chacune.
Qu'ajoute l'encodeur visuel ?
La différence entre les deux fichiers de configuration livre l'ajout de façon nette. Le tronc de langage ne bouge pas : 43 couches, 256 experts routés dont 6 actifs par token, dimension cachée de 4096, fenêtre de 1 048 576 tokens. Tout ce qui est nouveau concerne la vision.
| Paramètre | Valeur | Ce qu'il gouverne |
|---|---|---|
| vision_n_layers | 32 | Profondeur de la tour visuelle. |
| vision_dim | 1024 | Dimension des représentations visuelles. |
| vision_n_heads | 16 | Têtes d'attention de l'encodeur. |
| vision_inter_dim | 2816 | Dimension interne des couches de projection. |
| vision_patch_size | 14 | Côté en pixels d'un carreau élémentaire. |
| vision_downsample_ratio | 3 | Facteur de réduction avant passage au tronc. |
| vision_max_n_token | 384 | Plafond de tokens visuels par image. |
| vision_min_pixels | 147 456 | Surface minimale acceptée, soit 384 par 384. |
| vision_max_wh_ratio | 8 | Rapport largeur sur hauteur maximal admis. |
| vision_rope_theta | 10 000 | Base de l'encodage positionnel rotatif visuel. |
Le coût de cet ajout se lit dans la composition des tenseurs publiés. Les éléments en BF16 passent de 1,5 à 1,9 milliard entre 0731 et la version visuelle, tandis que le gros du modèle reste inchangé, avec 296,4 milliards d'éléments en INT8 et 6,3 milliards en FP8. La tour visuelle représente donc environ 0,4 milliard d'éléments supplémentaires, ce qui explique que le poids sur disque ne progresse que de 167 à 168 gigaoctets. Ajouter la vision à ce modèle coûte moins d'un pour cent de son empreinte.
Deux modifications qui ne relèvent pas de la vision
La comparaison des configurations révèle deux changements qu'un lecteur pressé attribuerait à tort à la multimodalité, et qui pèsent pourtant sur le déploiement.
Le premier porte sur la prédiction multi-tokens, dont la profondeur passe de une à trois couches. Ce mécanisme sert au décodage spéculatif, où le modèle propose plusieurs tokens d'avance qu'une vérification valide ou rejette. Tripler cette profondeur modifie le compromis entre le coût de la proposition et le gain de débit, et tout réglage transposé depuis 0731 demande donc à être réévalué.
Le second est plus discret : la constante de stabilisation de la normalisation passe de 1e-06 à 1e-20. Cette valeur protège une division contre un dénominateur nul. La réduire de quatorze ordres de grandeur suppose que le calcul se fait dans une précision qui le supporte, et une conversion négligente vers un format plus étroit expose à des valeurs non numériques.
Enfin, le dépôt déclare exiger la version 5.0.0 de la bibliothèque Transformers, là où 0731 se contentait de la 4.57.1. Ce n'est pas un détail d'intendance : un environnement figé sur la branche 4 ne chargera pas ce modèle.
Quels scores l'éditeur de DeepSeek déclare-t-il ?
DeepSeek publie deux séries de résultats, obtenus selon sa propre note avec le mode minimal de son harnais d'agent, un niveau d'effort de raisonnement maximal, une température de 1,0 et un top_p de 0,95. Rappelons qu'il s'agit de déclarations de l'éditeur sur ses propres modèles.
| Épreuve textuelle | Vision Exp | Flash 0731 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83,9 | 82,7 | 85,0 |
| NL2Repo | 57,7 | 54,2 | 69,7 |
| Cybergym | 75,3 | 76,7 | 78,3 |
| DeepSWE | 59,3 | 54,4 | 58,0 |
| Toolathlon Verified | 75,9 | 70,3 | 76,2 |
| DSBench-Hard | 63,6 | 59,6 | 71,7 |
| AutomationBench | 25,7 | 25,1 | 27,2 |
Le résultat notable tient dans ce que ces chiffres ne montrent pas. Adjoindre une modalité visuelle dégrade fréquemment les capacités textuelles, puisque l'entraînement complémentaire déplace le modèle. Ici la carte annonce des performances comparables, et les valeurs relevées vont au-delà : six épreuves sur sept progressent, dont Toolathlon qui gagne 5,6 points et DeepSWE 4,9. Seule Cybergym recule, de 1,4 point.
| Épreuve multimodale | Vision Exp | Flash 0731 | Opus 4.8 |
|---|---|---|---|
| ApexBench (Pass@1) | 36,5 | 26,2 | 39,4 |
| Agents' Last Exam | 27,3 | 25,2 | 25,7 |
| Chartography | 64,3 | non évalué | 65,0 |
| ZeroBench (Pass@5) | 35,0 | non évalué | 34,0 |
Le piège de la seconde table
Les deux premières lignes de la table multimodale portent dans la carte du modèle un appel de note dont la lecture change tout. DeepSeek précise que sur ApexBench et sur Agents' Last Exam, la version 0731 ignore purement et simplement les éléments visuels de l'entrée.
La colonne de référence ne mesure donc pas une vision moins bonne, elle mesure l'absence de vision.
L'écart de 10,3 points sur ApexBench ne compare pas deux encodeurs visuels : il compare un modèle qui voit à un modèle qui répond sans regarder. C'est une information utile sur ce que la vision apporte à une tâche donnée, ce n'est pas une comparaison de qualité visuelle. Les deux lignes suivantes, Chartography et ZeroBench, ne portent d'ailleurs aucune valeur pour 0731, ce qui est plus honnête et plus lisible.
Empreinte mémoire et matériel
Les 168 gigaoctets de poids constituent le plancher, jamais le besoin réel. À cette quantité s'ajoute le cache des clés et des valeurs, qui croît avec la longueur du contexte servi et avec le nombre de sessions simultanées.
Sur un modèle annonçant une fenêtre de 1 048 576 tokens, ce cache devient rapidement le poste dominant, et le dimensionnement doit partir de la fenêtre réellement servie plutôt que de la fenêtre maximale.
Ce calcul, et non cette mesure, situe le modèle parmi les machines à mémoire unifiée abondante ou les serveurs à plusieurs accélérateurs. Nous ne publions pas de débit pour ce modèle : nous ne l'avons pas mesuré, et recopier une valeur obtenue sur 0731 serait d'autant plus trompeur que la profondeur de prédiction multi-tokens a changé.
Ce que le qualificatif expérimental engage
Le suffixe Exp n'est pas une précaution de langage. Il signale une publication dont l'éditeur n'annonce ni stabilité d'interface, ni engagement de maintenance, ni disponibilité sur les moteurs de service établis. Un modèle expérimental peut voir sa configuration changer, son format d'invite évoluer, ou sa publication être remplacée par une version différemment nommée.
Pour une plateforme en production, cela place ce modèle du côté de l'évaluation et non du service. L'usage raisonnable consiste à l'essayer sur un jeu de tâches représentatif, à mesurer ce qu'il apporte sur vos propres documents, et à conserver DeepSeek V4 Flash 0731 comme socle tant que la version visuelle n'a pas de successeur stable.
Quand l'envisager
- Vos agents traitent des captures d'écran, des graphiques ou des documents numérisés, et vous voulez rester en poids ouverts sous licence MIT.
- Vous disposez déjà d'un déploiement DeepSeek V4 Flash et cherchez à mesurer ce que la vision changerait, à architecture de tronc identique.
- Vous évaluez, sur votre propre corpus, l'écart entre un modèle qui lit les images et un modèle qui les ignore.
Quand ne pas l'envisager
- Vous cherchez un modèle de service stable : le dépôt ne fournit qu'une implémentation de référence et se déclare expérimental.
- Votre environnement est figé sur Transformers 4 : le dépôt demande la version 5.
- Votre besoin est purement textuel : le tronc étant celui de 0731, la version visuelle ajoute une dépendance sans changer la nature du modèle.
- Vous transposez des réglages de décodage spéculatif depuis 0731 sans les réévaluer.
Sources officielles
- DeepSeek V4 Flash Vision Exp : dépôt officiel Hugging Face
- DeepSeek V4 Flash 0731 : dépôt officiel Hugging Face
- DeepSeek : annonce de la famille V4
- NVIDIA Developer : construire avec DeepSeek V4 sur Blackwell
Vous évaluez un modèle multimodal en poids ouverts ?
Atelier de cadrage offert en une demi-journée, mené sur vos propres documents et vos contraintes de déploiement.
Réserver un échangeQuestions fréquentes
DeepSeek V4 Flash Vision Exp est-il en poids ouverts ?
Oui. Le dépôt publie 168 gigaoctets de poids en 48 fichiers safetensors sous licence MIT, accompagnés du tokeniseur, de la chaîne d'encodage des invites et d'une implémentation d'inférence minimale en PyTorch.
En quoi diffère-t-il de DeepSeek V4 Flash 0731 ?
Le tronc de langage est identique, avec 43 couches, 256 experts routés dont 6 actifs et une fenêtre de 1 048 576 tokens. S'y ajoutent un encodeur visuel de 32 couches, une profondeur de prédiction multi-tokens portée de une à trois couches, une constante de normalisation abaissée de 1e-06 à 1e-20, et l'exigence de Transformers 5.0.0.
La vision dégrade-t-elle les performances textuelles ?
Selon les scores déclarés par DeepSeek, non. Six des sept épreuves textuelles progressent par rapport à 0731, Toolathlon gagnant 5,6 points et DeepSWE 4,9. Seule Cybergym recule de 1,4 point. Aucun tiers n'a reproduit ces mesures à ce jour.
Peut-on le mettre en production ?
L'éditeur le qualifie d'expérimental et ne fournit qu'une implémentation de référence en PyTorch, sans recette pour un moteur de service établi ni engagement de stabilité. Il relève donc de l'évaluation. DeepSeek V4 Flash 0731 reste le choix de service tant qu'une version visuelle stable n'est pas publiée.
Combien de tokens coûte une image ?
La configuration plafonne à 384 tokens visuels par image, impose une surface minimale de 147 456 pixels, soit 384 par 384, et refuse un rapport largeur sur hauteur supérieur à huit.