Repositorios de código abierto monitorizados de jmaczan, ordenados por estrellas.
Construye tu propio motor de inferencia LLM de alto rendimiento en C++ y CUDA: una versión más pequeña de vLLM.