Pular para o conteúdo principal
buildradar
Sign in
Tópico · llm-serving

llm-serving

Repositórios de código aberto acompanhados marcados com llm-serving, ordenados por estrelas.

Repositórios
25
Total de estrelas
244.794
Média de estrelas
9.792
Participação
0,01%

Tópicos que aparecem com frequência ao lado de llm-serving no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com llm-serving.

  • kaggle-tpu-lab@ARahim3

    Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.

    146
  • vllm@vllm-project

    Um mecanismo de inferência e atendimento de alto rendimento e eficiente em memória para LLMs

    90.817+402Variação de estrelas nos últimos 7 dias
  • ray@ray-project

    Ray é um motor de computação de IA. O Ray consiste em um runtime distribuído principal e um conjunto de bibliotecas de IA para acelerar cargas de trabalho de ML.

    43.688+41Variação de estrelas nos últimos 7 dias
  • llm-action@liguodongiot

    Este projeto visa compartilhar princípios técnicos e experiências práticas relacionadas a grandes modelos de linguagem (engenharia de LLM, implementação de aplicações de LLM).

    24.995+21Variação de estrelas nos últimos 7 dias
  • TensorRT-LLM@NVIDIA

    O TensorRT LLM oferece aos usuários uma API Python fácil de usar para definir Large Language Models (LLMs) e suporta otimizações de ponta para realizar inferências de forma eficiente em GPUs NVIDIA. O TensorRT LLM também contém componentes para criar runtimes em Python e C++ que orquestram a execução da inferência de maneira performática.

    14.536+38Variação de estrelas nos últimos 7 dias
  • OpenLLM@bentoml

    Execute qualquer LLM de código aberto, como DeepSeek e Llama, como um endpoint de API compatível com OpenAI na nuvem.

    12.524+1Variação de estrelas nos últimos 7 dias
  • skypilot@skypilot-org

    A plataforma de computação de IA para equipes de fronteira. O SkyPilot transforma computação de IA fragmentada em um supercomputador de IA, permitindo que equipes de IA de fronteira construam inteligência personalizada mais rapidamente.

    10.550+16Variação de estrelas nos últimos 7 dias
  • BentoML@bentoml

    A maneira mais fácil de servir aplicativos e modelos de IA - Crie APIs de inferência de modelos, filas de tarefas, aplicativos de LLM, pipelines multimodelo e muito mais!

    8.817+4Variação de estrelas nos últimos 7 dias
  • gpustack@gpustack

    Um gerenciador de cluster de GPU para servir modelos de IA de alto desempenho (vLLM, SGLang) e instâncias de GPU acessíveis via SSH sob demanda.

    5.593+21Variação de estrelas nos últimos 7 dias
  • superduper@superduper-io

    Superduper: Framework de ponta a ponta para construir aplicações e agentes de IA personalizados.

    5.318+1Variação de estrelas nos últimos 7 dias
  • lorax@predibase

    Servidor de inferência Multi-LoRA que escala para milhares de LLMs ajustados

    3.827+1Variação de estrelas nos últimos 7 dias
  • FastDeploy@PaddlePaddle

    Kit de ferramentas de inferência e implantação de alto desempenho para LLMs e VLMs baseado em PaddlePaddle.

    3.714+3Variação de estrelas nos últimos 7 dias
  • chitu@thu-pacman

    Framework de inferência de alto desempenho para grandes modelos de linguagem, com foco em eficiência, flexibilidade e disponibilidade.

    2.997-1Variação de estrelas nos últimos 7 dias
  • vllm-ascend@vllm-project

    Plugin de hardware mantido pela comunidade para vLLM em Ascend.

    2.749+19Variação de estrelas nos últimos 7 dias
  • MoBA@MoonshotAI

    MoBA: Mixture of Block Attention para LLMs de contexto longo

    2.174+1Variação de estrelas nos últimos 7 dias
  • aici@microsoft

    AICI: Prompts como Programas (Wasm)

    2.076+0Variação de estrelas nos últimos 7 dias
  • InferenceX@SemiAnalysisAI

    Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3

    1.613+33Variação de estrelas nos últimos 7 dias
  • parallax@GradientHQ

    Parallax é um framework de serviço de modelos distribuídos que permite criar seu próprio cluster de IA em qualquer lugar.

    1.372+4Variação de estrelas nos últimos 7 dias
  • rtp-llm@alibaba

    RTP-LLM: motor de inferência LLM de alto desempenho da Alibaba para diversas aplicações.

    1.325+6Variação de estrelas nos últimos 7 dias
  • kvcached@ovg-project

    Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais

    1.275+130Variação de estrelas nos últimos 7 dias
  • Nanoflow@efeslab

    Uma estrutura de atendimento de alto desempenho orientada a vazão para LLMs

    975+1Variação de estrelas nos últimos 7 dias
  • ZhiLight@zhihu

    Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.

    908+0Variação de estrelas nos últimos 7 dias
  • mosec@mosecorg

    Um framework de atendimento de modelos ML de alto desempenho, oferece loteamento dinâmico e pipelines de CPU/GPU para explorar totalmente sua máquina de computação

    902+0Variação de estrelas nos últimos 7 dias
  • helix@helixml

    ♾️ Frota de agentes privados com Spec Coding. Cada agente possui seu próprio desktop com aceleração por GPU. Execute Claude, Codex, Gemini e modelos abertos em uma pilha de IA totalmente privada ♾️

    805+2Variação de estrelas nos últimos 7 dias
  • pegainfer@pegainfer-project

    Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2

    677+18Variação de estrelas nos últimos 7 dias
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    Fine-tuning de LLM (Large Language Model)

    579+1Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos