llm-serving
Repositorios de código abierto monitorizados etiquetados con llm-serving, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a llm-serving en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con llm-serving.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Un motor de inferencia y servicio de alto rendimiento y eficiente en memoria para LLMs
★ 90.817+402Variación de estrellas de los últimos 7 días - #2
Ray es un motor de cómputo para IA. Consta de un entorno de ejecución distribuido central y un conjunto de librerías de IA para acelerar las cargas de trabajo de ML.
★ 43.688+41Variación de estrellas de los últimos 7 días - #3
Este proyecto tiene como objetivo compartir principios tecnológicos y experiencias prácticas relacionados con modelos grandes (ingeniería de LLM, implementación de aplicaciones de LLM).
★ 24.995+21Variación de estrellas de los últimos 7 días - #4
TensorRT LLM ofrece a los usuarios una API de Python fácil de usar para definir Modelos de Lenguaje Grande (LLMs) y admite optimizaciones de vanguardia para realizar inferencias de manera eficiente en GPUs NVIDIA. TensorRT LLM también contiene componentes para crear entornos de ejecución en Python y C++ que organizan la ejecución de inferencias de alto rendimiento.
★ 14.536+38Variación de estrellas de los últimos 7 días - #5
Ejecuta cualquier LLM de código abierto, como DeepSeek y Llama, como un endpoint de API compatible con OpenAI en la nube.
★ 12.524+1Variación de estrellas de los últimos 7 días - #6
La plataforma de computación de IA para equipos de vanguardia. SkyPilot convierte la computación de IA fragmentada en una supercomputadora de IA, permitiendo a los equipos de IA de vanguardia construir inteligencia personalizada más rápido.
★ 10.550+16Variación de estrellas de los últimos 7 días - #7
La forma más sencilla de servir aplicaciones y modelos de IA: ¡crea APIs de inferencia de modelos, colas de trabajos, aplicaciones LLM, pipelines de múltiples modelos y más!
★ 8817+4Variación de estrellas de los últimos 7 días - #8
Un administrador de clústeres de GPU para el servicio de modelos de IA de alto rendimiento (vLLM, SGLang) e instancias de GPU accesibles por SSH bajo demanda.
★ 5593+21Variación de estrellas de los últimos 7 días - #9
Superduper: marco de trabajo integral para construir aplicaciones y agentes de IA personalizados.
★ 5318+1Variación de estrellas de los últimos 7 días - #10★ 3827+1Variación de estrellas de los últimos 7 días
- #11
Toolkit de inferencia y despliegue de alto rendimiento para LLMs y VLMs basado en PaddlePaddle
★ 3714+3Variación de estrellas de los últimos 7 días - #12
Framework de inferencia de alto rendimiento para grandes modelos de lenguaje, enfocado en la eficiencia, flexibilidad y disponibilidad.
★ 2997-1Variación de estrellas de los últimos 7 días - #13
Plugin de hardware mantenido por la comunidad para vLLM en Ascend
★ 2749+19Variación de estrellas de los últimos 7 días - #14★ 2174+1Variación de estrellas de los últimos 7 días
- #15★ 2076+0Variación de estrellas de los últimos 7 días
- #16
Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3
★ 1613+33Variación de estrellas de los últimos 7 días - #17
Parallax es un framework de servicio de modelos distribuido que permite construir su propio clúster de IA en cualquier lugar
★ 1372+4Variación de estrellas de los últimos 7 días - #18
RTP-LLM: motor de inferencia de LLM de alto rendimiento de Alibaba para diversas aplicaciones.
★ 1325+6Variación de estrellas de los últimos 7 días - #19★ 1275+130Variación de estrellas de los últimos 7 días
- #20★ 975+1Variación de estrellas de los últimos 7 días
- #21
Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.
★ 908+0Variación de estrellas de los últimos 7 días - #22
Un framework de alto rendimiento para servir modelos de ML, que ofrece procesamiento por lotes dinámico y pipelines de CPU/GPU para aprovechar al máximo su equipo de cómputo
★ 902+0Variación de estrellas de los últimos 7 días - #23
Flota de agentes privados con codificación Spec. Cada agente obtiene su propio escritorio acelerado por GPU. Ejecute Claude, Codex, Gemini y modelos abiertos en una pila de IA totalmente privada
★ 805+1Variación de estrellas de los últimos 7 días - #24
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 677+14Variación de estrellas de los últimos 7 días - #25
Ajuste fino de LLM (Modelos de Lenguaje Grande)
★ 579+1Variación de estrellas de los últimos 7 días