vllm
Repositorios de código abierto monitorizados etiquetados con vllm, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a vllm en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con vllm.
- #1
UniRL es un framework para el aprendizaje por refuerzo de modelos multimodales unificados.
★ 921 - #2
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 908 - #3
Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.
★ 808
- #1
Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.
★ 20.072+108Variación de estrellas de los últimos 7 días - #2
¡Bienvenido al Llama Cookbook! Tu guía definitiva para construir con Llama: primeros pasos con inferencia, ajuste fino y RAG. También te mostramos cómo resolver problemas de extremo a extremo utilizando la familia de modelos Llama y usándolos en varios servicios de proveedores.
★ 18.559-2Variación de estrellas de los últimos 7 días - #3
✍🏻 Análisis profundos de código fuente, diseño de sistemas y blogs de ingeniería | Halfrost-Field: notas de análisis de código fuente, diseño de sistemas y prácticas de ingeniería
★ 13.220+3Variación de estrellas de los últimos 7 días - #4
Biblioteca integral de código abierto de habilidades de investigación e ingeniería de IA para cualquier modelo de IA. Empaqueta las habilidades y tu agente de claude code/codex/gemini será un agente de investigación de IA con toda su potencia. Mantenido por Orchestra Research.
★ 12.152+222Variación de estrellas de los últimos 7 días - #5★ 11.562+256Variación de estrellas de los últimos 7 días
- #6
Un framework de RL basado en agentes fácil de usar, escalable y de alto rendimiento basado en Ray (PPO y DAPO y REINFORCE++ y VLM y TIS y vLLM y Ray y Async RL)
★ 9960+19Variación de estrellas de los últimos 7 días - #7
Intercambia GPT por cualquier LLM cambiando una sola línea de código. Xinference te permite ejecutar modelos de código abierto, de voz y multimodales en la nube, localmente o en tu laptop, todo a través de una API de inferencia unificada y lista para producción.
★ 9528+21Variación de estrellas de los últimos 7 días - #8★ 7908+86Variación de estrellas de los últimos 7 días
- #9
Mooncake es la plataforma de servicio para Kimi, un servicio de LLM líder proporcionado por Moonshot AI.
★ 6430+90Variación de estrellas de los últimos 7 días - #10
Plataforma de inferencia de IA generativa y predictiva distribuida estandarizada para despliegue escalable y multi-framework en Kubernetes
★ 5840+25Variación de estrellas de los últimos 7 días - #11
Un framework MCP de código bajo para construir pipelines RAG complejos e innovadores
★ 5674+6Variación de estrellas de los últimos 7 días - #12
Un administrador de clústeres de GPU para el servicio de modelos de IA de alto rendimiento (vLLM, SGLang) e instancias de GPU accesibles por SSH bajo demanda.
★ 5572+37Variación de estrellas de los últimos 7 días - #13
Intercambio de modelos confiable para cualquier servidor local compatible con OpenAI/Anthropic: llama.cpp, vllm, etc.
★ 5513+77Variación de estrellas de los últimos 7 días - #14
📚 Una lista seleccionada de los mejores artículos de inferencia LLM/VLM con código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉
★ 5479+8Variación de estrellas de los últimos 7 días - #15
Un enrutador programable de mezcla de modelos (Mixture-of-Models) para inferencia de LLM heterogénea
★ 5405+190Variación de estrellas de los últimos 7 días - #16
Extracción de datos estructurados, llamadas de instrucciones y flujos de trabajo de agentes con ML, LLM y Vision LLM
★ 5207+9Variación de estrellas de los últimos 7 días - #17
Aprende el sistema de inferencia de LLM en Apple Silicon para ingenieros de sistemas: construye un pequeño vLLM + Qwen
★ 4529+17Variación de estrellas de los últimos 7 días - #18
Entorno de ejecución en cascada para agentes de IA. Optimiza el costo, la latencia, la calidad y las decisiones de políticas dentro del bucle del agente.
★ 3979-12Variación de estrellas de los últimos 7 días - #19
Toolkit de inferencia y despliegue de alto rendimiento para LLMs y VLMs basado en PaddlePaddle
★ 3711+2Variación de estrellas de los últimos 7 días - #20
RamaLama es una herramienta de desarrollo de código abierto que simplifica el alojamiento local de modelos de IA desde cualquier fuente y facilita su uso para inferencia en producción, todo mediante el lenguaje familiar de los contenedores.
★ 3025+17Variación de estrellas de los últimos 7 días - #21
Plugin de hardware mantenido por la comunidad para vLLM en Ascend
★ 2730+53Variación de estrellas de los últimos 7 días - #22
Panel de control para VLLM, Sglang, llama.cpp y exllamav3.
★ 1745+10Variación de estrellas de los últimos 7 días - #23
Un algoritmo de cuantización SOTA para inferencia de LLM de bajo bit y alta precisión, optimizado para CPU/XPU/CUDA, con soporte para múltiples tipos de datos y compatibilidad total con vLLM, SGLang y Transformers.
★ 1594+15Variación de estrellas de los últimos 7 días - #24
Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3
★ 1585+159Variación de estrellas de los últimos 7 días - #25
Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.
★ 1552+17Variación de estrellas de los últimos 7 días - #26
Operador de inferencia de IA para Kubernetes. La forma más sencilla de servir modelos de ML en producción. Compatible con VLM, LLM, embeddings y conversión de voz a texto.
★ 1254+6Variación de estrellas de los últimos 7 días - #27
Kit de herramientas de cuantización (compresión) de modelos LLM con soporte de aceleración por hardware para GPU Nvidia, AMD, Intel y CPU Intel/AMD/Apple a través de HF, vLLM y SGLang.
★ 1248+12Variación de estrellas de los últimos 7 días - #28
🔒 Gateway de API de nivel empresarial que te ayuda a supervisar y aplicar límites de costos o de tasa por clave de API. Obtén control de acceso detallado y monitoreo por usuario, aplicación o entorno. Compatible con OpenAI, Azure OpenAI, Anthropic, vLLM y LLMs de código abierto.
★ 1229+4Variación de estrellas de los últimos 7 días - #29★ 1145+5Variación de estrellas de los últimos 7 días
- #30
Evalúa la respuesta de tu LLM con Prometheus y GPT4 💯
★ 1107+0Variación de estrellas de los últimos 7 días