model-serving
Repositorios de código abierto monitorizados etiquetados con model-serving, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a model-serving en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con model-serving.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Un motor de inferencia y servicio de alto rendimiento y eficiente en memoria para LLMs
★ 90.415+745Variación de estrellas de los últimos 7 días - #2
La forma más sencilla de servir aplicaciones y modelos de IA: ¡crea APIs de inferencia de modelos, colas de trabajos, aplicaciones LLM, pipelines de múltiples modelos y más!
★ 8813+18Variación de estrellas de los últimos 7 días - #3★ 6457+229Variación de estrellas de los últimos 7 días
- #4
Plataforma de inferencia de IA generativa y predictiva distribuida estandarizada para despliegue escalable y multi-framework en Kubernetes
★ 5840+25Variación de estrellas de los últimos 7 días - #5★ 5243+10Variación de estrellas de los últimos 7 días
- #6
En este repositorio compartiré algunas notas y referencias útiles sobre el despliegue de modelos basados en aprendizaje profundo en producción.
★ 4376+1Variación de estrellas de los últimos 7 días - #7
Sistema integral para Machine Learning, artículos académicos y prácticas industriales sobre sistemas de IA, LLM y GenAI. Incluye recursos de conferencias como OSDI, NSDI, SIGCOMM, SoCC, MLSys, modelos como Llama3 y Mistral, y tutoriales en video.
★ 4318+27Variación de estrellas de los últimos 7 días - #8
LightLLM es un framework de inferencia y servicio de LLM (Large Language Model) basado en Python, destacado por su diseño ligero, fácil escalabilidad y rendimiento de alta velocidad.
★ 4251+21Variación de estrellas de los últimos 7 días - #9
FEDML: la biblioteca de ML unificada y escalable para entrenamiento distribuido a gran escala, servicio de modelos y aprendizaje federado. FEDML Launch, un programador multinube, permite además ejecutar cualquier tarea de IA en cualquier nube de GPU o clúster local. Basada en esta biblioteca, TensorOpera AI (https://TensorOpera.ai) es tu plataforma de IA generativa a escala.
★ 4061-1Variación de estrellas de los últimos 7 días - #10★ 3826-2Variación de estrellas de los últimos 7 días
- #11
Framework de inferencia de alto rendimiento para grandes modelos de lenguaje, enfocado en la eficiencia, flexibilidad y disponibilidad.
★ 2998+5Variación de estrellas de los últimos 7 días - #12
Plugin de hardware mantenido por la comunidad para vLLM en Ascend
★ 2730+53Variación de estrellas de los últimos 7 días - #13
OpenLake es un motor de almacenamiento de alto rendimiento para inferencia de LLM y entrenamiento de GPU eficientes
★ 2346+9Variación de estrellas de los últimos 7 días - #14★ 2227+3Variación de estrellas de los últimos 7 días
- #15★ 2076+0Variación de estrellas de los últimos 7 días
- #16
MLRun es una plataforma MLOps de código abierto para construir y gestionar rápidamente aplicaciones de ML continuas a lo largo de su ciclo de vida. MLRun se integra en tu entorno de desarrollo y CI/CD, automatizando la entrega de datos de producción, pipelines de ML y aplicaciones en línea.
★ 1694+0Variación de estrellas de los últimos 7 días - #17
Una herramienta DevOps de código abierto de la CNCF para empaquetar y versionar modelos de IA/ML, conjuntos de datos, código y configuraciones en un artefacto OCI.
★ 1409+5Variación de estrellas de los últimos 7 días - #18
RTP-LLM: motor de inferencia de LLM de alto rendimiento de Alibaba para diversas aplicaciones.
★ 1320+6Variación de estrellas de los últimos 7 días - #19★ 1303+1Variación de estrellas de los últimos 7 días
- #20★ 1196+1Variación de estrellas de los últimos 7 días
- #21
SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.
★ 978+70Variación de estrellas de los últimos 7 días - #22★ 974+0Variación de estrellas de los últimos 7 días
- #23
Un servidor de inferencia escalable para modelos optimizados con OpenVINO™.
★ 921+3Variación de estrellas de los últimos 7 días - #24
Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.
★ 908+0Variación de estrellas de los últimos 7 días - #25
Un framework de alto rendimiento para servir modelos de ML, que ofrece procesamiento por lotes dinámico y pipelines de CPU/GPU para aprovechar al máximo su equipo de cómputo
★ 902+0Variación de estrellas de los últimos 7 días - #26
Servicio de LLM sin servidor para todos.
★ 711+6Variación de estrellas de los últimos 7 días - #27
Ollama para modelos de ML clásico. Compilador AOT que convierte modelos de XGBoost, LightGBM, scikit-learn, CatBoost y ONNX en código de inferencia C99 nativo. Un comando para cargar, un comando para servir. 336 veces más rápido que la inferencia en Python.
★ 687-1Variación de estrellas de los últimos 7 días - #28
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 667+4Variación de estrellas de los últimos 7 días - #29
Esqueleto de aplicación FastAPI para servir modelos de aprendizaje automático listos para producción.
★ 603-1Variación de estrellas de los últimos 7 días - #30
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 502—Variación de estrellas de los últimos 7 días