Pular para o conteúdo principal
buildradar
Entrar

ztxz16/fastllm

@ztxz16

fastllm é uma biblioteca de inferência de grandes modelos de alto desempenho sem dependências de backend. Suporta inferência de paralelismo de tensores para modelos densos e inferência de modo misto para modelos MOE. Qualquer placa de vídeo com mais de 10GB pode executar o DeepSeek em capacidade total. Com um servidor dual 9004/9005 e uma única GPU, o modelo original DeepSeek em precisão total atinge 20tps em concorrência única; o modelo quantizado INT4 atinge 30tps em concorrência única, podendo chegar a 60+ em múltiplas concorrências.

Estrelas
4.954
Bifurcações
485
Linguagem
C++
Licença
Apache-2.0
Último push
há 1 semana
C++

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.