Pular para o conteúdo principal
buildradar
Sign in

jmaczan/tiny-vllm

@jmaczan

Construa seu próprio motor de inferência LLM de alto desempenho em C++ e CUDA - uma versão reduzida do vLLM.

Estrelas
1.094
Bifurcações
85
Linguagem
C++
Licença
Apache-2.0
Último push
há 2 semanas
C++cppaillmcudallm-inferencevllmhpcinferencecourseattentionbatchingpagedattentiontiny-vllm

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.