vllm
Repositorios de código abierto monitorizados etiquetados con vllm, ordenados por estrellas.
- #31
Evalúa la respuesta de tu LLM con Prometheus y GPT4 💯
★ 1111+4Variación de estrellas de los últimos 7 días - #32
Construye tu propio motor de inferencia LLM de alto rendimiento en C++ y CUDA: una versión más pequeña de vLLM.
★ 1094+15Variación de estrellas de los últimos 7 días - #33
Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales
★ 959+64Variación de estrellas de los últimos 7 días - #34
UniRL es un framework para el aprendizaje por refuerzo de modelos multimodales unificados.
★ 935+17Variación de estrellas de los últimos 7 días - #35
Notas sobre LLM, incluyendo inferencia de modelos, estructura de modelos transformer y análisis de código de frameworks de LLM.
★ 889+1Variación de estrellas de los últimos 7 días - #36
Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.
★ 881+77Variación de estrellas de los últimos 7 días - #37
Software de OCR local, portátil y sin conexión (tras la configuración inicial) que puede procesar imágenes y archivos PDF utilizando la IA DeepSeek-OCR-2 (ejecutándose directamente en tu máquina).
★ 873+3Variación de estrellas de los últimos 7 días - #38
Documentación integral para configurar tu propio servidor LLM local y totalmente privado en Debian. Equipado con chat, búsqueda web, RAG, gestión de modelos, servidores MCP, generación de imágenes y TTS.
★ 834-2Variación de estrellas de los últimos 7 días - #39
Convierte Discord en tu frontend de LLM - Soporta cualquier API compatible con OpenAI (OpenRouter, Ollama y más).
★ 829+4Variación de estrellas de los últimos 7 días - #40
Biblioteca de Python impulsada por modelos de lenguaje (LLM) para el descubrimiento y análisis de datos conversacionales.
★ 787+1Variación de estrellas de los últimos 7 días - #41
[EMNLP 2024 & AAAI 2026] Un potente kit de herramientas para comprimir modelos grandes, incluyendo LLMs, VLMs y modelos generativos de video.
★ 747+4Variación de estrellas de los últimos 7 días - #42
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 676+18Variación de estrellas de los últimos 7 días - #43★ 673+5Variación de estrellas de los últimos 7 días
- #44
EfficientSAM3 comprime SAM3 en modelos ligeros y aptos para dispositivos de borde mediante destilación de conocimiento progresiva para una segmentación y seguimiento rápido de conceptos mediante prompts.
★ 667+9Variación de estrellas de los últimos 7 días - #45
Servicio de síntesis de voz y clonación de voz en chino de alta calidad, basado en modelos como SparkTTS y OrpheusTTS.
★ 613+1Variación de estrellas de los últimos 7 días - #46
[CVPR 2025] RoboBrain: un modelo cerebral unificado para la manipulación robótica, desde lo abstracto hasta lo concreto. Repositorio oficial.
★ 564+0Variación de estrellas de los últimos 7 días - #47★ 554+1Variación de estrellas de los últimos 7 días
- #48
Una interfaz web moderna para gestionar e interactuar con servidores vLLM (www.github.com/vllm-project/vllm). Soporta modos GPU y CPU, con optimizaciones especiales para Apple Silicon en macOS y despliegue empresarial en OpenShift/Kubernetes.
★ 530+8Variación de estrellas de los últimos 7 días - #49
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 519+14Variación de estrellas de los últimos 7 días - #50
Engine-agnostic LLM gateway in Rust. Full OpenAI & Anthropic API compatibility across vLLM, TRT-LLM, TokenSpeed, SGLang, OpenAI, Gemini & more. Industry-first gRPC pipeline, KV cache-aware routing, chat history, tokenization caching, Responses API, embeddings, WASM plugins, MCP, and multi-tenant auth.
★ 512—Variación de estrellas de los últimos 7 días - #51
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 507—Variación de estrellas de los últimos 7 días - #52★ 505-1Variación de estrellas de los últimos 7 días