inference-engine
Repositorios de código abierto monitorizados etiquetados con inference-engine, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a inference-engine en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con inference-engine.
- #1
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 6888 - #2
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 624 - #3
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 552
- #1
✍🏻 Análisis profundos de código fuente, diseño de sistemas y blogs de ingeniería | Halfrost-Field: notas de análisis de código fuente, diseño de sistemas y prácticas de ingeniería
★ 13.220+3Variación de estrellas de los últimos 7 días - #2
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 6888+485Variación de estrellas de los últimos 7 días - #3
FEDML: la biblioteca de ML unificada y escalable para entrenamiento distribuido a gran escala, servicio de modelos y aprendizaje federado. FEDML Launch, un programador multinube, permite además ejecutar cualquier tarea de IA en cualquier nube de GPU o clúster local. Basada en esta biblioteca, TensorOpera AI (https://TensorOpera.ai) es tu plataforma de IA generativa a escala.
★ 4061-1Variación de estrellas de los últimos 7 días - #4
¡Excelente proyecto para reclutamiento universitario, de otoño, de primavera y pasantías! Te guía para implementar desde cero una biblioteca de inferencia de aprendizaje profundo de alto rendimiento, compatible con la inferencia de modelos grandes como llama2, Unet, Yolov5, Resnet, etc.
★ 3497+1Variación de estrellas de los últimos 7 días - #5
Implementación de motor de reglas en Golang
★ 2522+0Variación de estrellas de los últimos 7 días - #6
OneDiff: Una biblioteca de aceleración lista para usar para modelos de difusión.
★ 1964+1Variación de estrellas de los últimos 7 días - #7★ 1844+2Variación de estrellas de los últimos 7 días
- #8
Velocidades 3 veces más rápidas en MLX | Qwen 3.8 27B | Decodificación especulativa MTP nativa en Apple Silicon sin necesidad de un borrador externo.
★ 1805+235Variación de estrellas de los últimos 7 días - #9
Un motor de inferencia de alto rendimiento para modelos LLM, VLM, DiT y REC, optimizado para diversos aceleradores de IA. Está alojado en la OpenAtom Foundation.
★ 1541+12Variación de estrellas de los últimos 7 días - #10
Qualcomm® AI Hub Models es nuestra colección de modelos de aprendizaje automático de última generación optimizados para el rendimiento (latencia, memoria, etc.) y listos para implementar en dispositivos Qualcomm®.
★ 1194+3Variación de estrellas de los últimos 7 días - #11★ 1145+5Variación de estrellas de los últimos 7 días
- #12
Paddle.js es un proyecto web para Baidu PaddlePaddle, un framework de aprendizaje profundo de código abierto que se ejecuta en el navegador. Paddle.js puede cargar modelos preentrenados o transformar modelos desde paddle-hub mediante herramientas de conversión. Funciona en cualquier navegador con soporte para WebGL, WebGPU o WebAssembly, además de ser compatible con Baidu Smartprogram y WX miniprogram.
★ 1103+0Variación de estrellas de los últimos 7 días - #13
NobodyWho es un motor de inferencia que permite ejecutar LLMs local y eficientemente en cualquier dispositivo.
★ 1081+11Variación de estrellas de los últimos 7 días - #14
MLX Studio - Hogar de JANG_Q - Generación/Edición de imágenes + Chat/Código todo en uno - + OpenClaw (API de Anthropic)
★ 960+11Variación de estrellas de los últimos 7 días - #15
Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.
★ 908+0Variación de estrellas de los últimos 7 días - #16
Framework de visión artificial y análisis de video en Python con todo incluido.
★ 849+1Variación de estrellas de los últimos 7 días - #17
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 660+4Variación de estrellas de los últimos 7 días - #18
Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.
★ 624+98Variación de estrellas de los últimos 7 días - #19
Yet Another Language Model: inferencia de LLM en C++/CUDA, sin bibliotecas excepto para E/S
★ 597+1Variación de estrellas de los últimos 7 días - #20
Una representación base común del código fuente de Python para pylint y otros proyectos
★ 582+1Variación de estrellas de los últimos 7 días - #21
Proyecto ideal para contrataciones universitarias, de otoño, primavera y pasantías, que te guía en la implementación desde cero de un marco de inferencia de grandes modelos compatible con Llama2/3 y Qwen2.5.
★ 572+9Variación de estrellas de los últimos 7 días - #22
De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.
★ 552+35Variación de estrellas de los últimos 7 días - #23
Krasis es un entorno de ejecución de LLM híbrido que se centra en la ejecución eficiente de modelos grandes en hardware de consumo con VRAM limitada.
★ 516+3Variación de estrellas de los últimos 7 días - #24
Motor de inferencia para dispositivos Intel. Sirve modelos LLM, VLM, Whisper, Kokoro-TTS, Embedding y Rerank a través de endpoints de OpenAI.
★ 513+4Variación de estrellas de los últimos 7 días