llm-serving
Repositórios de código aberto acompanhados marcados com llm-serving, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de llm-serving no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com llm-serving.
- #1
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1
Um mecanismo de inferência e atendimento de alto rendimento e eficiente em memória para LLMs
★ 90.817+402Variação de estrelas nos últimos 7 dias - #2
Ray é um motor de computação de IA. O Ray consiste em um runtime distribuído principal e um conjunto de bibliotecas de IA para acelerar cargas de trabalho de ML.
★ 43.688+41Variação de estrelas nos últimos 7 dias - #3
Este projeto visa compartilhar princípios técnicos e experiências práticas relacionadas a grandes modelos de linguagem (engenharia de LLM, implementação de aplicações de LLM).
★ 24.995+21Variação de estrelas nos últimos 7 dias - #4
O TensorRT LLM oferece aos usuários uma API Python fácil de usar para definir Large Language Models (LLMs) e suporta otimizações de ponta para realizar inferências de forma eficiente em GPUs NVIDIA. O TensorRT LLM também contém componentes para criar runtimes em Python e C++ que orquestram a execução da inferência de maneira performática.
★ 14.536+38Variação de estrelas nos últimos 7 dias - #5
Execute qualquer LLM de código aberto, como DeepSeek e Llama, como um endpoint de API compatível com OpenAI na nuvem.
★ 12.524+1Variação de estrelas nos últimos 7 dias - #6
A plataforma de computação de IA para equipes de fronteira. O SkyPilot transforma computação de IA fragmentada em um supercomputador de IA, permitindo que equipes de IA de fronteira construam inteligência personalizada mais rapidamente.
★ 10.550+16Variação de estrelas nos últimos 7 dias - #7
A maneira mais fácil de servir aplicativos e modelos de IA - Crie APIs de inferência de modelos, filas de tarefas, aplicativos de LLM, pipelines multimodelo e muito mais!
★ 8.817+4Variação de estrelas nos últimos 7 dias - #8
Um gerenciador de cluster de GPU para servir modelos de IA de alto desempenho (vLLM, SGLang) e instâncias de GPU acessíveis via SSH sob demanda.
★ 5.593+21Variação de estrelas nos últimos 7 dias - #9
Superduper: Framework de ponta a ponta para construir aplicações e agentes de IA personalizados.
★ 5.318+1Variação de estrelas nos últimos 7 dias - #10★ 3.827+1Variação de estrelas nos últimos 7 dias
- #11
Kit de ferramentas de inferência e implantação de alto desempenho para LLMs e VLMs baseado em PaddlePaddle.
★ 3.714+3Variação de estrelas nos últimos 7 dias - #12
Framework de inferência de alto desempenho para grandes modelos de linguagem, com foco em eficiência, flexibilidade e disponibilidade.
★ 2.997-1Variação de estrelas nos últimos 7 dias - #13
Plugin de hardware mantido pela comunidade para vLLM em Ascend.
★ 2.749+19Variação de estrelas nos últimos 7 dias - #14★ 2.174+1Variação de estrelas nos últimos 7 dias
- #15★ 2.076+0Variação de estrelas nos últimos 7 dias
- #16
Plataforma de pesquisa de benchmark de inferência contínua de código aberto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 e em breve™ TPUv6e/v7/Trainium2/3
★ 1.613+33Variação de estrelas nos últimos 7 dias - #17
Parallax é um framework de serviço de modelos distribuídos que permite criar seu próprio cluster de IA em qualquer lugar.
★ 1.372+4Variação de estrelas nos últimos 7 dias - #18
RTP-LLM: motor de inferência LLM de alto desempenho da Alibaba para diversas aplicações.
★ 1.325+6Variação de estrelas nos últimos 7 dias - #19
Cache KV elástico virtualizado para compartilhamento dinâmico de GPU e muito mais
★ 1.275+130Variação de estrelas nos últimos 7 dias - #20★ 975+1Variação de estrelas nos últimos 7 dias
- #21
Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.
★ 908+0Variação de estrelas nos últimos 7 dias - #22
Um framework de atendimento de modelos ML de alto desempenho, oferece loteamento dinâmico e pipelines de CPU/GPU para explorar totalmente sua máquina de computação
★ 902+0Variação de estrelas nos últimos 7 dias - #23
♾️ Frota de agentes privados com Spec Coding. Cada agente possui seu próprio desktop com aceleração por GPU. Execute Claude, Codex, Gemini e modelos abertos em uma pilha de IA totalmente privada ♾️
★ 805+2Variação de estrelas nos últimos 7 dias - #24
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 677+18Variação de estrelas nos últimos 7 dias - #25
Fine-tuning de LLM (Large Language Model)
★ 579+1Variação de estrelas nos últimos 7 dias