llama.cpp
Runtime d’inférence

llama.cpp reste léger. Il exploite le format GGUF, combine processeur et carte graphique, et applique une quantification de Q4 à Q8. Il convient au DGX Spark, au Mac Studio, au poste unique et aux usages hors ligne.
Points clés : Périphérie · Format GGUF · Processeur et carte · Quantification Q4 à Q8 · Hors ligne.
Rôle
llama.cpp reste léger. Il sert les modèles en local, y compris sans connexion, sur du matériel modeste.
Fonctionnement
Il exploite le format GGUF, combine processeur et carte graphique, et applique une quantification de Q4 à Q8 pour tenir en mémoire.
Cas d’usage
llama.cpp convient au DGX Spark, au Mac Studio, au poste unique et aux usages hors ligne.
Intégration
Il sert de moteur local à dwarfstar et s’expose à la plateforme via LiteLLM.
Quels modèles servir avec llama.cpp ?
Voir l’ensemble des combinaisons de moteur et de modèle.