QDNAConseil et architecture de plateformes d'inférence et d'entraînement de LLM, en local ou hybride

ninfer

Runtime d’inférence

ninfer

ninfer est un moteur d’inférence C++/CUDA conçu pour maximiser le débit sur GPU unique. Optimisé pour les cartes NVIDIA GeForce RTX 5090 et RTX PRO 6000 reposant sur l’architecture Blackwell (sm_120), il intègre le décodage spéculatif, la quantification native NVFP4 et INT8, et expose des interfaces compatibles avec les API OpenAI et Anthropic.

Points clés : Débit GPU unique · GeForce RTX 5090 · RTX PRO 6000 Blackwell sm_120 · C++/CUDA · Décodage spéculatif · Quantification NVFP4 · API OpenAI et Anthropic.

Rôle

ninfer maximise le débit d’inférence sur station individuelle ou serveur mono-GPU. Il s’adresse aux cas d’usage où un modèle résident doit être exécuté avec une latence minimale par jeton, sans la complexité d’un ordonnanceur distribué multi-cartes.

Fonctionnement et architecture

Le moteur est programmé en C++ et noyaux CUDA sans surcoût d'interpréteur pour l’exécution du graphe de calcul. Il exploite les unités matérielles de l’architecture Blackwell (sm_120), notamment sur la GeForce RTX 5090 (32 Go) et la RTX PRO 6000 (96 Go). ninfer emploie des artefacts autonomes regroupant poids encodés, configuration, tokenizer et têtes de décodage spéculatif (MTP, DFlash). La gestion du cache clé-valeur intègre les formats FP8 et NVFP4 pour maintenir une empreinte mémoire compacte.

Cas d’usage

ninfer convient aux postes de travail d’ingénierie et aux serveurs dédiés à un modèle à fort volume de décodage, tels que les assistants de code ou les agents interactifs. Il assure une cadence de génération élevée pour un utilisateur individuel ou une équipe restreinte.

Intégration

ninfer expose des points de terminaison HTTP compatibles avec les API OpenAI et Anthropic, ainsi qu’une interface en ligne de commande locale. Il s’intègre à la passerelle LiteLLM et aux serveurs d’orchestration multi-agents.

Licence et code source

ninfer est un logiciel open-source écrit en C++ et CUDA. Le code source est accessible sur GitHub : Neroued/ninfer.

En parler avec un spécialiste

Un échange sans engagement.

Réserver un échange