Servir DeepSeek V4 avec Triton Inference Server
DeepSeek V4 compte 1600 milliards de paramètres. Triton Inference Server vise mise en service industrielle, multi-modèles. Cette page donne la mémoire nécessaire et les plateformes qui conviennent.
Quelle mémoire faut-il au minimum ?
DeepSeek V4 totalise 1600 milliards de paramètres. En NVFP4, ses poids occupent environ 920 Go, marge d’exécution comprise. En FP8 l’empreinte double, à environ 1 840 Go. Le cache d’attention s’ajoute et dépend du contexte servi.
À quoi sert Triton Inference Server ?
Triton Inference Server vise mise en service industrielle, multi-modèles. Voir la fiche Triton Inference Server et la fiche DeepSeek V4.
Sur quelles plateformes ?
- DeepSeek V4 sur Serveur H200 SXM
- DeepSeek V4 sur B200 SXM
- DeepSeek V4 sur B300 SXM
- DeepSeek V4 sur GB300 NVL72
Quelle mémoire pour DeepSeek V4 avec Triton Inference Server ?
Environ 920 Go en NVFP4 pour les poids, hors cache d’attention.
Triton Inference Server convient-il à DeepSeek V4 ?
Triton Inference Server sert DeepSeek V4 dès lors que la machine offre au moins 920 Go de mémoire, empreinte des poids en NVFP4. 4 des 8 plateformes du catalogue y parviennent.
Méthode
Les valeurs proviennent des fiches du site. Les empreintes mémoire sont calculées, elles ne sont pas mesurées : un relevé sur machine peut s’en écarter selon le moteur et le format exact des poids. Les prix sont indicatifs et non contractuels.