Dépôts open source suivis de jmaczan, triés par étoiles.
Construisez votre propre moteur d'inférence LLM haute performance en C++ et CUDA - une version allégée de vLLM