QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

DeepSeek V4

DeepSeek

DeepSeek V4

DeepSeek V4 offre un niveau frontière pour un coût réduit. Son architecture à mélange d’experts atteint 1600 milliards de paramètres. La version Pro sert le raisonnement, la version Flash traite le quotidien avec rapidité. Ce modèle constitue le socle de dwarfstar.

Points clés : Rapport prix-performance · Mélange d’experts 1600 Md · Pro et Flash · Socle dwarfstar.

Architecture

DeepSeek V4 est un modèle à mélange d’experts de 1600 milliards de paramètres, décliné en une version Pro pour le raisonnement et une version Flash pour le débit.

Points forts

Il offre un niveau frontière pour un coût réduit, ce qui en fait une référence du rapport prix-performance parmi les modèles ouverts.

Cas d’usage

La version Pro sert le raisonnement exigeant, la version Flash traite le quotidien avec rapidité. DeepSeek V4 constitue le socle de la pile dwarfstar.

Déploiement

Servi par vLLM ou llama.cpp selon la quantification. Il tourne en local sur serveur RTX PRO 6000 au sein de dwarfstar.

Tous les modèles de la plateforme sont interchangeables via une passerelle unique : changer de modèle revient à changer une ligne de configuration, sans réécrire le code. La priorité reste l’exécution locale.

Déployer ce modèle chez vous

Sur votre matériel, sans que vos données sortent.

Réserver un échange

Sur quelle machine faire tourner DeepSeek V4 ?

DeepSeek V4 totalise 1600 milliards de paramètres, soit environ 920 Go en NVFP4. 4 plateformes du catalogue disposent d’assez de mémoire.

Voir aussi DeepSeek V4 en NVFP4 et la matrice complète.