llm-inference
Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.
- #61
Inferencia de Llama 3+ en Java puro.
★ 816+0Variación de estrellas de los últimos 7 días - #62
LeaderWorkerSet: Una API para desplegar un grupo de pods como una unidad de replicación.
★ 807+7Variación de estrellas de los últimos 7 días - #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: Libere el potencial de los LLM a través de tutoriales seleccionados, mejores prácticas y código listo para usar para entrenamiento e inferencia personalizados.
★ 731+0Variación de estrellas de los últimos 7 días - #64★ 707+0Variación de estrellas de los últimos 7 días
- #65
USP: Atención paralela de secuencia unificada (híbrida, 2D) para entrenamiento e inferencia de modelos Transformers de contexto largo
★ 691+3Variación de estrellas de los últimos 7 días - #66★ 677+5Variación de estrellas de los últimos 7 días
- #67
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 673+13Variación de estrellas de los últimos 7 días - #68
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 637+20Variación de estrellas de los últimos 7 días - #69★ 605+35Variación de estrellas de los últimos 7 días
- #70
Alternativa a Ollama para Rockchip NPU: Una solución eficiente para ejecutar modelos de IA y aprendizaje profundo en dispositivos Rockchip con soporte optimizado para NPU (rkllm)
★ 598+3Variación de estrellas de los últimos 7 días - #71
Yet Another Language Model: inferencia de LLM en C++/CUDA, sin bibliotecas excepto para E/S
★ 596+0Variación de estrellas de los últimos 7 días - #72
SDK de IA local de código abierto: ejecute IA en el dispositivo sin nube ni claves API. Soporta GGUF, RAG, generación de imágenes, música y video, voz a texto, inferencia P2P y más. Multiplataforma: Linux, macOS, Windows, Android, iOS.
★ 588+28Variación de estrellas de los últimos 7 días - #73
Plataforma de búsqueda web minimalista con un asistente de IA que se ejecuta directamente desde el navegador. Demo: https://felladrin-minisearch.hf.space
★ 585+3Variación de estrellas de los últimos 7 días - #74
CLI para ejecutar un gran número de agentes de codificación en paralelo utilizando git worktrees.
★ 582+0Variación de estrellas de los últimos 7 días - #75
Ajuste fino de LLM (Modelos de Lenguaje Grande)
★ 579+0Variación de estrellas de los últimos 7 días - #76★ 577+12Variación de estrellas de los últimos 7 días
- #77
Proyecto ideal para contrataciones universitarias, de otoño, primavera y pasantías, que te guía en la implementación desde cero de un marco de inferencia de grandes modelos compatible con Llama2/3 y Qwen2.5.
★ 573+2Variación de estrellas de los últimos 7 días - #78★ 559+0Variación de estrellas de los últimos 7 días
- #79
Un motor de servicio de baja latencia y alto rendimiento para LLMs.
★ 520+0Variación de estrellas de los últimos 7 días - #80
Krasis es un entorno de ejecución de LLM híbrido que se centra en la ejecución eficiente de modelos grandes en hardware de consumo con VRAM limitada.
★ 518-1Variación de estrellas de los últimos 7 días - #81
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 514—Variación de estrellas de los últimos 7 días - #82
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 506—Variación de estrellas de los últimos 7 días - #83★ 506+0Variación de estrellas de los últimos 7 días