model-serving
Repositórios de código aberto acompanhados marcados com model-serving, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de model-serving no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com model-serving.
Nenhum repositório novo marcado com este tópico nos últimos 90 dias.
- #1
Um mecanismo de inferência e atendimento de alto rendimento e eficiente em memória para LLMs
★ 90.415+745Variação de estrelas nos últimos 7 dias - #2
A maneira mais fácil de servir aplicativos e modelos de IA - Crie APIs de inferência de modelos, filas de tarefas, aplicativos de LLM, pipelines multimodelo e muito mais!
★ 8.813+18Variação de estrelas nos últimos 7 dias - #3
Um framework para inferência eficiente de modelos com modelos de omnimodalidade
★ 6.457+229Variação de estrelas nos últimos 7 dias - #4
Plataforma padronizada de inferência de IA generativa e preditiva distribuída para implantação escalável em múltiplos frameworks no Kubernetes.
★ 5.840+25Variação de estrelas nos últimos 7 dias - #5★ 5.243+10Variação de estrelas nos últimos 7 dias
- #6
Neste repositório, compartilharei algumas notas e referências úteis sobre como implantar modelos baseados em aprendizado profundo em produção.
★ 4.376+1Variação de estrelas nos últimos 7 dias - #7
🚀 Awesome System for Machine Learning ⚡️ Artigos sobre sistemas de IA e práticas da indústria. ⚡️ Sistemas para Machine Learning, LLM (Large Language Model), GenAI (Generative AI). 🍻 OSDI, NSDI, SIGCOMM, SoCC, MLSys, etc. 🗃️ Llama3, Mistral, etc. 🧑💻 Tutoriais em vídeo.
★ 4.318+27Variação de estrelas nos últimos 7 dias - #8
LightLLM é um framework de inferência e atendimento para LLMs (Modelos de Linguagem Grande) baseado em Python, notável por seu design leve, fácil escalabilidade e alto desempenho.
★ 4.251+21Variação de estrelas nos últimos 7 dias - #9
FEDML - A biblioteca de ML unificada e escalável para treinamento distribuído em larga escala, serviço de modelos e aprendizado federado. O FEDML Launch, um agendador cross-cloud, permite executar qualquer trabalho de IA em qualquer nuvem de GPU ou cluster local. Construída sobre esta biblioteca, a TensorOpera AI (https://TensorOpera.ai) é sua plataforma de IA generativa em escala.
★ 4.061-1Variação de estrelas nos últimos 7 dias - #10★ 3.826-2Variação de estrelas nos últimos 7 dias
- #11
Framework de inferência de alto desempenho para grandes modelos de linguagem, com foco em eficiência, flexibilidade e disponibilidade.
★ 2.998+5Variação de estrelas nos últimos 7 dias - #12
Plugin de hardware mantido pela comunidade para vLLM em Ascend.
★ 2.730+53Variação de estrelas nos últimos 7 dias - #13
OpenLake é um motor de armazenamento de alto desempenho para inferência eficiente de LLM e treinamento em GPU
★ 2.346+9Variação de estrelas nos últimos 7 dias - #14★ 2.227+3Variação de estrelas nos últimos 7 dias
- #15★ 2.076+0Variação de estrelas nos últimos 7 dias
- #16
MLRun é uma plataforma MLOps de código aberto para construir e gerenciar rapidamente aplicações de ML contínuas ao longo de seu ciclo de vida. O MLRun integra-se ao seu ambiente de desenvolvimento e CI/CD, automatizando a entrega de dados de produção, pipelines de ML e aplicações online.
★ 1.694+0Variação de estrelas nos últimos 7 dias - #17
Uma ferramenta DevOps de código aberto da CNCF para empacotar e versionar modelos de IA/ML, conjuntos de dados, código e configurações em um OCI Artifact.
★ 1.409+5Variação de estrelas nos últimos 7 dias - #18
RTP-LLM: motor de inferência LLM de alto desempenho da Alibaba para diversas aplicações.
★ 1.320+6Variação de estrelas nos últimos 7 dias - #19★ 1.303+1Variação de estrelas nos últimos 7 dias
- #20★ 1.196+1Variação de estrelas nos últimos 7 dias
- #21
O SGLang-Omni capacita o atendimento de alto desempenho para modelos TTS, ASR, de fala e onidirecionais.
★ 978+70Variação de estrelas nos últimos 7 dias - #22★ 974+0Variação de estrelas nos últimos 7 dias
- #23
Servidor de inferência escalável para modelos otimizados com OpenVINO™
★ 921+3Variação de estrelas nos últimos 7 dias - #24
Um motor de aceleração de inferência de LLM altamente otimizado para Llama e suas variantes.
★ 908+0Variação de estrelas nos últimos 7 dias - #25
Um framework de atendimento de modelos ML de alto desempenho, oferece loteamento dinâmico e pipelines de CPU/GPU para explorar totalmente sua máquina de computação
★ 902+0Variação de estrelas nos últimos 7 dias - #26
Serviço de LLM serverless para todos.
★ 711+6Variação de estrelas nos últimos 7 dias - #27
Ollama para modelos de ML clássicos. Compilador AOT que transforma modelos XGBoost, LightGBM, scikit-learn, CatBoost e ONNX em código de inferência C99 nativo. Um comando para carregar, um comando para servir. 336x mais rápido que a inferência em Python.
★ 687-1Variação de estrelas nos últimos 7 dias - #28
Mecanismo de inferência de LLM em Pure Rust + CUDA — sem PyTorch, compatível com OpenAI, serve de Qwen3 a Kimi-K2
★ 660+4Variação de estrelas nos últimos 7 dias - #29
Aplicação esqueleto em FastAPI para servir modelos de aprendizado de máquina prontos para produção.
★ 603-1Variação de estrelas nos últimos 7 dias - #30
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 502—Variação de estrelas nos últimos 7 dias