Saltar al contenido principal
buildradar
Sign in
Tema · vllm

vllm

Repositorios de código abierto monitorizados etiquetados con vllm, ordenados por estrellas.

Repositorios
51
Estrellas totales
193.269
Estrellas de media
3790
Proporción
0,01%

Temas que aparecen con frecuencia junto a vllm en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con vllm.

  • UniRL@Tencent-Hunyuan

    UniRL es un framework para el aprendizaje por refuerzo de modelos multimodales unificados.

    921
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    908
  • Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.

    808
  • FunASR@modelscope

    Kit de herramientas de reconocimiento de voz de código abierto para entrenamiento, inferencia, ASR en streaming, VAD, puntuación, canalizaciones de diarización de altavoces y servicio compatible con OpenAI/MCP.

    20.072+108Variación de estrellas de los últimos 7 días
  • llama-cookbook@meta-llama

    ¡Bienvenido al Llama Cookbook! Tu guía definitiva para construir con Llama: primeros pasos con inferencia, ajuste fino y RAG. También te mostramos cómo resolver problemas de extremo a extremo utilizando la familia de modelos Llama y usándolos en varios servicios de proveedores.

    18.559-2Variación de estrellas de los últimos 7 días
  • ✍🏻 Análisis profundos de código fuente, diseño de sistemas y blogs de ingeniería | Halfrost-Field: notas de análisis de código fuente, diseño de sistemas y prácticas de ingeniería

    13.220+3Variación de estrellas de los últimos 7 días
  • AI-Research-SKILLs@Orchestra-Research

    Biblioteca integral de código abierto de habilidades de investigación e ingeniería de IA para cualquier modelo de IA. Empaqueta las habilidades y tu agente de claude code/codex/gemini será un agente de investigación de IA con toda su potencia. Mantenido por Orchestra Research.

    12.152+222Variación de estrellas de los últimos 7 días
  • LMCache@LMCache

    LMCache: Potencia tu LLM con la capa de caché KV más rápida

    11.562+256Variación de estrellas de los últimos 7 días
  • OpenRLHF@OpenRLHF

    Un framework de RL basado en agentes fácil de usar, escalable y de alto rendimiento basado en Ray (PPO y DAPO y REINFORCE++ y VLM y TIS y vLLM y Ray y Async RL)

    9960+19Variación de estrellas de los últimos 7 días
  • inference@xorbitsai

    Intercambia GPT por cualquier LLM cambiando una sola línea de código. Xinference te permite ejecutar modelos de código abierto, de voz y multimodales en la nube, localmente o en tu laptop, todo a través de una API de inferencia unificada y lista para producción.

    9528+21Variación de estrellas de los últimos 7 días
  • dynamo@ai-dynamo

    Un framework de servicio de inferencia distribuida a escala de centro de datos

    7908+86Variación de estrellas de los últimos 7 días
  • Mooncake@kvcache-ai

    Mooncake es la plataforma de servicio para Kimi, un servicio de LLM líder proporcionado por Moonshot AI.

    6430+90Variación de estrellas de los últimos 7 días
  • kserve@kserve

    Plataforma de inferencia de IA generativa y predictiva distribuida estandarizada para despliegue escalable y multi-framework en Kubernetes

    5840+25Variación de estrellas de los últimos 7 días
  • UltraRAG@OpenBMB

    Un framework MCP de código bajo para construir pipelines RAG complejos e innovadores

    5674+6Variación de estrellas de los últimos 7 días
  • gpustack@gpustack

    Un administrador de clústeres de GPU para el servicio de modelos de IA de alto rendimiento (vLLM, SGLang) e instancias de GPU accesibles por SSH bajo demanda.

    5572+37Variación de estrellas de los últimos 7 días
  • llama-swap@mostlygeek

    Intercambio de modelos confiable para cualquier servidor local compatible con OpenAI/Anthropic: llama.cpp, vllm, etc.

    5513+77Variación de estrellas de los últimos 7 días
  • Awesome-LLM-Inference@xlite-dev

    📚 Una lista seleccionada de los mejores artículos de inferencia LLM/VLM con código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉

    5479+8Variación de estrellas de los últimos 7 días
  • semantic-router@vllm-project

    Un enrutador programable de mezcla de modelos (Mixture-of-Models) para inferencia de LLM heterogénea

    5405+190Variación de estrellas de los últimos 7 días
  • sparrow@katanaml

    Extracción de datos estructurados, llamadas de instrucciones y flujos de trabajo de agentes con ML, LLM y Vision LLM

    5207+9Variación de estrellas de los últimos 7 días
  • tiny-llm@skyzh

    Aprende el sistema de inferencia de LLM en Apple Silicon para ingenieros de sistemas: construye un pequeño vLLM + Qwen

    4529+17Variación de estrellas de los últimos 7 días
  • cascadeflow@lemony-ai

    Entorno de ejecución en cascada para agentes de IA. Optimiza el costo, la latencia, la calidad y las decisiones de políticas dentro del bucle del agente.

    3979-12Variación de estrellas de los últimos 7 días
  • FastDeploy@PaddlePaddle

    Toolkit de inferencia y despliegue de alto rendimiento para LLMs y VLMs basado en PaddlePaddle

    3711+2Variación de estrellas de los últimos 7 días
  • ramalama@containers

    RamaLama es una herramienta de desarrollo de código abierto que simplifica el alojamiento local de modelos de IA desde cualquier fuente y facilita su uso para inferencia en producción, todo mediante el lenguaje familiar de los contenedores.

    3025+17Variación de estrellas de los últimos 7 días
  • vllm-ascend@vllm-project

    Plugin de hardware mantenido por la comunidad para vLLM en Ascend

    2730+53Variación de estrellas de los últimos 7 días
  • local-studio@sybil-solutions

    Panel de control para VLLM, Sglang, llama.cpp y exllamav3.

    1745+10Variación de estrellas de los últimos 7 días
  • auto-round@intel

    Un algoritmo de cuantización SOTA para inferencia de LLM de bajo bit y alta precisión, optimizado para CPU/XPU/CUDA, con soporte para múltiples tipos de datos y compatibilidad total con vLLM, SGLang y Transformers.

    1594+15Variación de estrellas de los últimos 7 días
  • InferenceX@SemiAnalysisAI

    Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3

    1585+159Variación de estrellas de los últimos 7 días
  • vllm-mlx@waybarrios

    Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.

    1552+17Variación de estrellas de los últimos 7 días
  • kubeai@kubeai-project

    Operador de inferencia de IA para Kubernetes. La forma más sencilla de servir modelos de ML en producción. Compatible con VLM, LLM, embeddings y conversión de voz a texto.

    1254+6Variación de estrellas de los últimos 7 días
  • GPTQModel@ModelCloud

    Kit de herramientas de cuantización (compresión) de modelos LLM con soporte de aceleración por hardware para GPU Nvidia, AMD, Intel y CPU Intel/AMD/Apple a través de HF, vLLM y SGLang.

    1248+12Variación de estrellas de los últimos 7 días
  • BricksLLM@bricks-cloud

    🔒 Gateway de API de nivel empresarial que te ayuda a supervisar y aplicar límites de costos o de tasa por clave de API. Obtén control de acceso detallado y monitoreo por usuario, aplicación o entorno. Compatible con OpenAI, Azure OpenAI, Anthropic, vLLM y LLMs de código abierto.

    1229+4Variación de estrellas de los últimos 7 días
  • kvcached@ovg-project

    Caché KV elástica virtualizada para el uso compartido dinámico de GPU y más.

    1145+5Variación de estrellas de los últimos 7 días
  • prometheus-eval@prometheus-eval

    Evalúa la respuesta de tu LLM con Prometheus y GPT4 💯

    1107+0Variación de estrellas de los últimos 7 días
← Volver a temas