llm-inference
Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a llm-inference en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con llm-inference.
- #1
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 7187 - #2
Inferencia de Gemma 4 26B-A4B en ~2 GB de RAM en cualquier MacBook con chip de la serie M
★ 6664 - #3
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1200 - #4
Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.
★ 881 - #5
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 640
- #1
GPT4All: ejecute LLMs locales en cualquier dispositivo. De código abierto y disponible para uso comercial.
★ 77.387-9Variación de estrellas de los últimos 7 días - #2
Ray es un motor de cómputo para IA. Consta de un entorno de ejecución distribuido central y un conjunto de librerías de IA para acelerar las cargas de trabajo de ML.
★ 43.688+41Variación de estrellas de los últimos 7 días - #3★ 29.078+70Variación de estrellas de los últimos 7 días
- #4
Este proyecto tiene como objetivo compartir principios tecnológicos y experiencias prácticas relacionados con modelos grandes (ingeniería de LLM, implementación de aplicaciones de LLM).
★ 24.995+21Variación de estrellas de los últimos 7 días - #5
Más de 20 LLMs de alto rendimiento con recetas para preentrenar, ajustar y desplegar a escala.
★ 13.645+9Variación de estrellas de los últimos 7 días - #6
Ejecuta cualquier LLM de código abierto, como DeepSeek y Llama, como un endpoint de API compatible con OpenAI en la nube.
★ 12.524+1Variación de estrellas de los últimos 7 días - #7
OpenVINO™ es un kit de herramientas de código abierto para optimizar y desplegar inferencia de IA
★ 10.793+30Variación de estrellas de los últimos 7 días - #8
Servicio de modelos de lenguaje grandes de alta velocidad para implementación local
★ 9765+7Variación de estrellas de los últimos 7 días - #9
La forma más sencilla de servir aplicaciones y modelos de IA: ¡crea APIs de inferencia de modelos, colas de trabajos, aplicaciones LLM, pipelines de múltiples modelos y más!
★ 8817+4Variación de estrellas de los últimos 7 días - #10★ 8041+8Variación de estrellas de los últimos 7 días
- #11★ 7952+44Variación de estrellas de los últimos 7 días
- #12
Implementación de código abierto de AlphaEvolve
★ 7307+22Variación de estrellas de los últimos 7 días - #13
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 7187+468Variación de estrellas de los últimos 7 días - #14
Plano es un servidor proxy nativo de IA y plano de datos para aplicaciones agénticas. Enrutamiento inteligente de LLM, observabilidad, orquestación de agentes y barreras de seguridad para que te concentres en la lógica central de tus agentes.
★ 7033+11Variación de estrellas de los últimos 7 días - #15
Inferencia de Gemma 4 26B-A4B en ~2 GB de RAM en cualquier MacBook con chip de la serie M
★ 6664+178Variación de estrellas de los últimos 7 días - #16
FlashInfer: Biblioteca de kernels para servir LLM
★ 6321+38Variación de estrellas de los últimos 7 días - #17
Cuantización, núcleos, entorno de ejecución y motor de inferencia para dispositivos móviles, wearables, hogares inteligentes y robots.
★ 5975+20Variación de estrellas de los últimos 7 días - #18
Plataforma de inferencia de IA generativa y predictiva distribuida estandarizada para despliegue escalable y multi-framework en Kubernetes
★ 5853+13Variación de estrellas de los últimos 7 días - #19
⚡ Motor de inferencia WebGPU en Rust puro: compatible con la API de OpenAI, nativo de GGUF, se ejecuta en cualquier GPU. Sin Python. Sin llama.cpp. Binario único.
★ 5816+6Variación de estrellas de los últimos 7 días - #20
Un administrador de clústeres de GPU para el servicio de modelos de IA de alto rendimiento (vLLM, SGLang) e instancias de GPU accesibles por SSH bajo demanda.
★ 5593+21Variación de estrellas de los últimos 7 días - #21
Lemonade ayuda a los usuarios a descubrir y ejecutar aplicaciones de IA locales sirviendo LLMs optimizados directamente desde sus propias GPU y NPU. Únete a nuestro discord: https://discord.gg/5xXzkMu8Zk
★ 5585+55Variación de estrellas de los últimos 7 días - #22
📚 Una lista seleccionada de los mejores artículos de inferencia LLM/VLM con código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉
★ 5482+3Variación de estrellas de los últimos 7 días - #23
Superduper: marco de trabajo integral para construir aplicaciones y agentes de IA personalizados.
★ 5318+1Variación de estrellas de los últimos 7 días - #24
Eko (Eko Keeps Operating) - Crea flujos de trabajo de agentes listos para producción con lenguaje natural - eko.fellou.ai
★ 4954+2Variación de estrellas de los últimos 7 días - #25
RuVector es una base de datos de memoria Vector GNN, IA de autoaprendizaje en tiempo real y de alto rendimiento, construida en Rust.
★ 4473+6Variación de estrellas de los últimos 7 días - #26★ 4260+3Variación de estrellas de los últimos 7 días
- #27
Flujos de trabajo de referencia de IA generativa optimizados para infraestructura acelerada y arquitectura de microservicios.
★ 4169+4Variación de estrellas de los últimos 7 días - #28★ 3827+1Variación de estrellas de los últimos 7 días
- #29
Una colección de métodos científicos, procesos, algoritmos y sistemas para construir historias y modelos.
★ 3676+2Variación de estrellas de los últimos 7 días - #30
Agrega un nodo de análisis en tiempo real a tu base de datos operacional. Spice es un motor portátil y acelerado de consultas SQL, búsquedas y inferencia de LLM en Rust para aplicaciones y agentes de IA basados en datos.
★ 3075+1Variación de estrellas de los últimos 7 días