vllm
Repositórios de código aberto acompanhados marcados com vllm, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de vllm no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com vllm.
- #1
UniRL é um framework para aprendizado por reforço de modelos multimodais unificados
★ 921 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.
★ 808
- #1
Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.
★ 20.072+108Variação de estrelas nos últimos 7 dias - #2
Bem-vindo ao Llama Cookbook! Este é o seu guia principal para construir com o Llama: Primeiros passos com Inferência, Fine-Tuning e RAG. Também mostramos como resolver problemas ponta a ponta usando a família de modelos Llama e como usá-los em vários provedores de serviços
★ 18.559-2Variação de estrelas nos últimos 7 dias - #3
Análises profundas de código-fonte, design de sistemas e blogs de engenharia
★ 13.220+3Variação de estrelas nos últimos 7 dias - #4
Biblioteca de código aberto abrangente de habilidades de engenharia e pesquisa em IA para qualquer modelo. Empacote as habilidades e seu agente Claude Code/Codex/Gemini se tornará um agente de pesquisa em IA de alto desempenho. Mantido pela Orchestra Research.
★ 12.152+222Variação de estrelas nos últimos 7 dias - #5★ 11.562+256Variação de estrelas nos últimos 7 dias
- #6
Framework de RL agentic fácil de usar, escalável e de alto desempenho baseado em Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray e Async RL)
★ 9.960+19Variação de estrelas nos últimos 7 dias - #7
Troque o GPT por qualquer LLM alterando apenas uma linha de código. O Xinference permite executar modelos de código aberto, de fala e multimodais na nuvem, localmente ou no seu laptop — tudo através de uma API de inferência unificada e pronta para produção.
★ 9.528+21Variação de estrelas nos últimos 7 dias - #8★ 7.908+86Variação de estrelas nos últimos 7 dias
- #9
Mooncake é a plataforma de serviço para o Kimi, um serviço de LLM líder fornecido pela Moonshot AI.
★ 6.430+90Variação de estrelas nos últimos 7 dias - #10
Plataforma padronizada de inferência de IA generativa e preditiva distribuída para implantação escalável em múltiplos frameworks no Kubernetes.
★ 5.840+25Variação de estrelas nos últimos 7 dias - #11★ 5.674+6Variação de estrelas nos últimos 7 dias
- #12
Um gerenciador de cluster de GPU para servir modelos de IA de alto desempenho (vLLM, SGLang) e instâncias de GPU acessíveis via SSH sob demanda.
★ 5.572+37Variação de estrelas nos últimos 7 dias - #13
Troca de modelo confiável para qualquer servidor local compatível com OpenAI/Anthropic - llama.cpp, vllm, etc.
★ 5.513+77Variação de estrelas nos últimos 7 dias - #14
📚 Uma lista curada de artigos incríveis sobre inferência de LLM/VLM com código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉
★ 5.479+8Variação de estrelas nos últimos 7 dias - #15
Um roteador programável de Mistura de Modelos (Mixture-of-Models) para inferência heterogênea de LLM
★ 5.405+190Variação de estrelas nos últimos 7 dias - #16
Extração de dados estruturados, chamada de instruções e fluxos de trabalho de agentes com ML, LLM e Vision LLM.
★ 5.207+9Variação de estrelas nos últimos 7 dias - #17
Aprenda o sistema de inferência de LLM em Apple Silicon para engenheiros de sistemas: construa um pequeno vLLM + Qwen
★ 4.529+17Variação de estrelas nos últimos 7 dias - #18
Runtime em cascata para agentes de IA. Otimize custo, latência, qualidade e decisões de política dentro do loop do agente.
★ 3.979-12Variação de estrelas nos últimos 7 dias - #19
Kit de ferramentas de inferência e implantação de alto desempenho para LLMs e VLMs baseado em PaddlePaddle.
★ 3.711+2Variação de estrelas nos últimos 7 dias - #20
RamaLama é uma ferramenta de código aberto para desenvolvedores que simplifica a hospedagem local de modelos de IA de qualquer fonte e facilita seu uso para inferência em produção, tudo através da linguagem familiar de containers.
★ 3.025+17Variação de estrelas nos últimos 7 dias - #21
Plugin de hardware mantido pela comunidade para vLLM em Ascend.
★ 2.730+53Variação de estrelas nos últimos 7 dias - #22
Painel de controle para VLLM, Sglang, llama.cpp, exllamav3
★ 1.745+10Variação de estrelas nos últimos 7 dias - #23
Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.
★ 1.594+15Variação de estrelas nos últimos 7 dias - #24
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.585+159Variação de estrelas nos últimos 7 dias - #25
Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.
★ 1.552+17Variação de estrelas nos últimos 7 dias - #26
Operador de inferência de IA para Kubernetes. A maneira mais fácil de servir modelos de ML em produção. Suporta VLMs, LLMs, embeddings e conversão de fala em texto.
★ 1.254+6Variação de estrelas nos últimos 7 dias - #27
Kit de ferramentas de quantização (compressão) de modelos LLM com suporte a aceleração de hardware para GPUs Nvidia, AMD, Intel e CPUs Intel/AMD/Apple via HF, vLLM e SGLang.
★ 1.248+12Variação de estrelas nos últimos 7 dias - #28
Gateway de API de nível empresarial que ajuda a monitorar e impor limites de custo ou taxa por chave de API. Obtenha controle de acesso granular e monitoramento por usuário, aplicação ou ambiente. Suporta OpenAI, Azure OpenAI, Anthropic, vLLM e LLMs open source.
★ 1.229+4Variação de estrelas nos últimos 7 dias - #29
Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais
★ 1.145+5Variação de estrelas nos últimos 7 dias - #30
Avalie a resposta do seu LLM com Prometheus e GPT4 💯
★ 1.107+0Variação de estrelas nos últimos 7 dias