patchy631/time-to-first-token
@patchy631Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.
Estrelas
881
Bifurcações
103
Linguagem
HTML
Licença
Apache-2.0
Último push
há 3 semanas
Intel relacionado (0)
Ainda não há intel relacionado
Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.