Saltar al contenido principal
buildradar
Sign in
Tema · inference-engine

inference-engine

Repositorios de código abierto monitorizados etiquetados con inference-engine, ordenados por estrellas.

Repositorios
24
Estrellas totales
48.964
Estrellas de media
2040
Proporción
0,00%

Temas que aparecen con frecuencia junto a inference-engine en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con inference-engine.

  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    6888
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    624
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    552
  • ✍🏻 Análisis profundos de código fuente, diseño de sistemas y blogs de ingeniería | Halfrost-Field: notas de análisis de código fuente, diseño de sistemas y prácticas de ingeniería

    13.220+3Variación de estrellas de los últimos 7 días
  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    6888+485Variación de estrellas de los últimos 7 días
  • FedML@FedML-AI

    FEDML: la biblioteca de ML unificada y escalable para entrenamiento distribuido a gran escala, servicio de modelos y aprendizaje federado. FEDML Launch, un programador multinube, permite además ejecutar cualquier tarea de IA en cualquier nube de GPU o clúster local. Basada en esta biblioteca, TensorOpera AI (https://TensorOpera.ai) es tu plataforma de IA generativa a escala.

    4061-1Variación de estrellas de los últimos 7 días
  • KuiperInfer@zjhellofss

    ¡Excelente proyecto para reclutamiento universitario, de otoño, de primavera y pasantías! Te guía para implementar desde cero una biblioteca de inferencia de aprendizaje profundo de alto rendimiento, compatible con la inferencia de modelos grandes como llama2, Unet, Yolov5, Resnet, etc.

    3497+1Variación de estrellas de los últimos 7 días
  • grule-rule-engine@hyperjumptech

    Implementación de motor de reglas en Golang

    2522+0Variación de estrellas de los últimos 7 días
  • onediff@siliconflow

    OneDiff: Una biblioteca de aceleración lista para usar para modelos de difusión.

    1964+1Variación de estrellas de los últimos 7 días
  • sonar@dphnAI

    Motor de inferencia para LLM a gran escala

    1844+2Variación de estrellas de los últimos 7 días
  • MTPLX@youssofal

    Velocidades 3 veces más rápidas en MLX | Qwen 3.8 27B | Decodificación especulativa MTP nativa en Apple Silicon sin necesidad de un borrador externo.

    1805+235Variación de estrellas de los últimos 7 días
  • xllm@xLLM-AI

    Un motor de inferencia de alto rendimiento para modelos LLM, VLM, DiT y REC, optimizado para diversos aceleradores de IA. Está alojado en la OpenAtom Foundation.

    1541+12Variación de estrellas de los últimos 7 días
  • ai-hub-models@qualcomm

    Qualcomm® AI Hub Models es nuestra colección de modelos de aprendizaje automático de última generación optimizados para el rendimiento (latencia, memoria, etc.) y listos para implementar en dispositivos Qualcomm®.

    1194+3Variación de estrellas de los últimos 7 días
  • kvcached@ovg-project

    Caché KV elástica virtualizada para el uso compartido dinámico de GPU y más.

    1145+5Variación de estrellas de los últimos 7 días
  • Paddle.js@PaddlePaddle

    Paddle.js es un proyecto web para Baidu PaddlePaddle, un framework de aprendizaje profundo de código abierto que se ejecuta en el navegador. Paddle.js puede cargar modelos preentrenados o transformar modelos desde paddle-hub mediante herramientas de conversión. Funciona en cualquier navegador con soporte para WebGL, WebGPU o WebAssembly, además de ser compatible con Baidu Smartprogram y WX miniprogram.

    1103+0Variación de estrellas de los últimos 7 días
  • nobodywho@nobodywho-ooo

    NobodyWho es un motor de inferencia que permite ejecutar LLMs local y eficientemente en cualquier dispositivo.

    1081+11Variación de estrellas de los últimos 7 días
  • mlxstudio@jjang-ai

    MLX Studio - Hogar de JANG_Q - Generación/Edición de imágenes + Chat/Código todo en uno - + OpenClaw (API de Anthropic)

    960+11Variación de estrellas de los últimos 7 días
  • ZhiLight@zhihu

    Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.

    908+0Variación de estrellas de los últimos 7 días
  • Savant@insight-platform

    Framework de visión artificial y análisis de video en Python con todo incluido.

    849+1Variación de estrellas de los últimos 7 días
  • pegainfer@pegainfer-project

    Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2

    660+4Variación de estrellas de los últimos 7 días
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    624+98Variación de estrellas de los últimos 7 días
  • yalm@andrewkchan

    Yet Another Language Model: inferencia de LLM en C++/CUDA, sin bibliotecas excepto para E/S

    597+1Variación de estrellas de los últimos 7 días
  • astroid@pylint-dev

    Una representación base común del código fuente de Python para pylint y otros proyectos

    582+1Variación de estrellas de los últimos 7 días
  • KuiperLLama@zjhellofss

    Proyecto ideal para contrataciones universitarias, de otoño, primavera y pasantías, que te guía en la implementación desde cero de un marco de inferencia de grandes modelos compatible con Llama2/3 y Qwen2.5.

    572+9Variación de estrellas de los últimos 7 días
  • tessera@zengxiao-he

    De profesor a tiles: un motor de destilación y servicio de LLM creado desde cero: kernels personalizados de Triton/CUDA, destilación FSDP, procesamiento por lotes continuo paged-KV, decodificación especulativa, una puerta de enlace en Rust, un oráculo JAX y herramientas de interpretabilidad.

    552+35Variación de estrellas de los últimos 7 días
  • krasis@brontoguana

    Krasis es un entorno de ejecución de LLM híbrido que se centra en la ejecución eficiente de modelos grandes en hardware de consumo con VRAM limitada.

    516+3Variación de estrellas de los últimos 7 días
  • OpenArc@SearchSavior

    Motor de inferencia para dispositivos Intel. Sirve modelos LLM, VLM, Whisper, Kokoro-TTS, Embedding y Rerank a través de endpoints de OpenAI.

    513+4Variación de estrellas de los últimos 7 días
← Volver a temas