Pular para o conteúdo principal
buildradar
Sign in
Tópico · vllm

vllm

Repositórios de código aberto acompanhados marcados com vllm, ordenados por estrelas.

Repositórios
51
Total de estrelas
193.269
Média de estrelas
3.790
Participação
0,01%

Tópicos que aparecem com frequência ao lado de vllm no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com vllm.

  • UniRL@Tencent-Hunyuan

    UniRL é um framework para aprendizado por reforço de modelos multimodais unificados

    921
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • Um roteiro de 10 semanas, com 30 minutos por dia, para inferência e otimização de LLMs. vLLM, SGLang, quantização, decodificação especulativa, benchmarking.

    808
  • FunASR@modelscope

    Kit de ferramentas de reconhecimento de fala de código aberto para treinamento, inferência, streaming ASR, VAD, pontuação, pipelines de diarização de locutores e atendimento compatível com OpenAI/MCP.

    20.072+108Variação de estrelas nos últimos 7 dias
  • llama-cookbook@meta-llama

    Bem-vindo ao Llama Cookbook! Este é o seu guia principal para construir com o Llama: Primeiros passos com Inferência, Fine-Tuning e RAG. Também mostramos como resolver problemas ponta a ponta usando a família de modelos Llama e como usá-los em vários provedores de serviços

    18.559-2Variação de estrelas nos últimos 7 dias
  • Análises profundas de código-fonte, design de sistemas e blogs de engenharia

    13.220+3Variação de estrelas nos últimos 7 dias
  • AI-Research-SKILLs@Orchestra-Research

    Biblioteca de código aberto abrangente de habilidades de engenharia e pesquisa em IA para qualquer modelo. Empacote as habilidades e seu agente Claude Code/Codex/Gemini se tornará um agente de pesquisa em IA de alto desempenho. Mantido pela Orchestra Research.

    12.152+222Variação de estrelas nos últimos 7 dias
  • LMCache@LMCache

    LMCache: Potencialize seu LLM com a camada de cache KV mais rápida

    11.562+256Variação de estrelas nos últimos 7 dias
  • OpenRLHF@OpenRLHF

    Framework de RL agentic fácil de usar, escalável e de alto desempenho baseado em Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray e Async RL)

    9.960+19Variação de estrelas nos últimos 7 dias
  • inference@xorbitsai

    Troque o GPT por qualquer LLM alterando apenas uma linha de código. O Xinference permite executar modelos de código aberto, de fala e multimodais na nuvem, localmente ou no seu laptop — tudo através de uma API de inferência unificada e pronta para produção.

    9.528+21Variação de estrelas nos últimos 7 dias
  • dynamo@ai-dynamo

    Um framework de serviço de inferência distribuída em escala de datacenter.

    7.908+86Variação de estrelas nos últimos 7 dias
  • Mooncake@kvcache-ai

    Mooncake é a plataforma de serviço para o Kimi, um serviço de LLM líder fornecido pela Moonshot AI.

    6.430+90Variação de estrelas nos últimos 7 dias
  • kserve@kserve

    Plataforma padronizada de inferência de IA generativa e preditiva distribuída para implantação escalável em múltiplos frameworks no Kubernetes.

    5.840+25Variação de estrelas nos últimos 7 dias
  • UltraRAG@OpenBMB

    Um framework MCP low-code para construir pipelines de RAG complexos e inovadores.

    5.674+6Variação de estrelas nos últimos 7 dias
  • gpustack@gpustack

    Um gerenciador de cluster de GPU para servir modelos de IA de alto desempenho (vLLM, SGLang) e instâncias de GPU acessíveis via SSH sob demanda.

    5.572+37Variação de estrelas nos últimos 7 dias
  • llama-swap@mostlygeek

    Troca de modelo confiável para qualquer servidor local compatível com OpenAI/Anthropic - llama.cpp, vllm, etc.

    5.513+77Variação de estrelas nos últimos 7 dias
  • Awesome-LLM-Inference@xlite-dev

    📚 Uma lista curada de artigos incríveis sobre inferência de LLM/VLM com código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉

    5.479+8Variação de estrelas nos últimos 7 dias
  • semantic-router@vllm-project

    Um roteador programável de Mistura de Modelos (Mixture-of-Models) para inferência heterogênea de LLM

    5.405+190Variação de estrelas nos últimos 7 dias
  • sparrow@katanaml

    Extração de dados estruturados, chamada de instruções e fluxos de trabalho de agentes com ML, LLM e Vision LLM.

    5.207+9Variação de estrelas nos últimos 7 dias
  • tiny-llm@skyzh

    Aprenda o sistema de inferência de LLM em Apple Silicon para engenheiros de sistemas: construa um pequeno vLLM + Qwen

    4.529+17Variação de estrelas nos últimos 7 dias
  • cascadeflow@lemony-ai

    Runtime em cascata para agentes de IA. Otimize custo, latência, qualidade e decisões de política dentro do loop do agente.

    3.979-12Variação de estrelas nos últimos 7 dias
  • FastDeploy@PaddlePaddle

    Kit de ferramentas de inferência e implantação de alto desempenho para LLMs e VLMs baseado em PaddlePaddle.

    3.711+2Variação de estrelas nos últimos 7 dias
  • ramalama@containers

    RamaLama é uma ferramenta de código aberto para desenvolvedores que simplifica a hospedagem local de modelos de IA de qualquer fonte e facilita seu uso para inferência em produção, tudo através da linguagem familiar de containers.

    3.025+17Variação de estrelas nos últimos 7 dias
  • vllm-ascend@vllm-project

    Plugin de hardware mantido pela comunidade para vLLM em Ascend.

    2.730+53Variação de estrelas nos últimos 7 dias
  • local-studio@sybil-solutions

    Painel de controle para VLLM, Sglang, llama.cpp, exllamav3

    1.745+10Variação de estrelas nos últimos 7 dias
  • auto-round@intel

    Um algoritmo de quantização SOTA para inferência de LLM de baixo bit e alta precisão, otimizado para CPU/XPU/CUDA, com suporte a múltiplos tipos de dados e compatibilidade total com vLLM, SGLang e Transformers.

    1.594+15Variação de estrelas nos últimos 7 dias
  • InferenceX@SemiAnalysisAI

    Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3

    1.585+159Variação de estrelas nos últimos 7 dias
  • vllm-mlx@waybarrios

    Servidor de inferência LLM de alto desempenho compatível com OpenAI e Anthropic para Apple Silicon. MLX nativo, processamento contínuo, modelos multimodais, chamada de ferramentas MCP e suporte ao Claude Code.

    1.552+17Variação de estrelas nos últimos 7 dias
  • kubeai@kubeai-project

    Operador de inferência de IA para Kubernetes. A maneira mais fácil de servir modelos de ML em produção. Suporta VLMs, LLMs, embeddings e conversão de fala em texto.

    1.254+6Variação de estrelas nos últimos 7 dias
  • GPTQModel@ModelCloud

    Kit de ferramentas de quantização (compressão) de modelos LLM com suporte a aceleração de hardware para GPUs Nvidia, AMD, Intel e CPUs Intel/AMD/Apple via HF, vLLM e SGLang.

    1.248+12Variação de estrelas nos últimos 7 dias
  • BricksLLM@bricks-cloud

    Gateway de API de nível empresarial que ajuda a monitorar e impor limites de custo ou taxa por chave de API. Obtenha controle de acesso granular e monitoramento por usuário, aplicação ou ambiente. Suporta OpenAI, Azure OpenAI, Anthropic, vLLM e LLMs open source.

    1.229+4Variação de estrelas nos últimos 7 dias
  • kvcached@ovg-project

    Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais

    1.145+5Variação de estrelas nos últimos 7 dias
  • prometheus-eval@prometheus-eval

    Avalie a resposta do seu LLM com Prometheus e GPT4 💯

    1.107+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos