Saltar al contenido principal
buildradar
Sign in
Tema · llm-inference

llm-inference

Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.

Repositorios
83
Estrellas totales
408.416
Estrellas de media
4921
Proporción
0,02%

Temas que aparecen con frecuencia junto a llm-inference en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con llm-inference.

  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    7187
  • turbo-fieldfare@drumih

    Inferencia de Gemma 4 26B-A4B en ~2 GB de RAM en cualquier MacBook con chip de la serie M

    6664
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1200
  • Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.

    881
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    640
  • gpt4all@nomic-ai

    GPT4All: ejecute LLMs locales en cualquier dispositivo. De código abierto y disponible para uso comercial.

    77.387-9Variación de estrellas de los últimos 7 días
  • ray@ray-project

    Ray es un motor de cómputo para IA. Consta de un entorno de ejecución distribuido central y un conjunto de librerías de IA para acelerar las cargas de trabajo de ML.

    43.688+41Variación de estrellas de los últimos 7 días
  • gitleaks@gitleaks

    Encuentra secretos con Gitleaks 🔑

    29.078+70Variación de estrellas de los últimos 7 días
  • llm-action@liguodongiot

    Este proyecto tiene como objetivo compartir principios tecnológicos y experiencias prácticas relacionados con modelos grandes (ingeniería de LLM, implementación de aplicaciones de LLM).

    24.995+21Variación de estrellas de los últimos 7 días
  • litgpt@Lightning-AI

    Más de 20 LLMs de alto rendimiento con recetas para preentrenar, ajustar y desplegar a escala.

    13.645+9Variación de estrellas de los últimos 7 días
  • OpenLLM@bentoml

    Ejecuta cualquier LLM de código abierto, como DeepSeek y Llama, como un endpoint de API compatible con OpenAI en la nube.

    12.524+1Variación de estrellas de los últimos 7 días
  • openvino@openvinotoolkit

    OpenVINO™ es un kit de herramientas de código abierto para optimizar y desplegar inferencia de IA

    10.793+30Variación de estrellas de los últimos 7 días
  • PowerInfer@Tiiny-AI

    Servicio de modelos de lenguaje grandes de alta velocidad para implementación local

    9765+7Variación de estrellas de los últimos 7 días
  • BentoML@bentoml

    La forma más sencilla de servir aplicaciones y modelos de IA: ¡crea APIs de inferencia de modelos, colas de trabajos, aplicaciones LLM, pipelines de múltiples modelos y más!

    8817+4Variación de estrellas de los últimos 7 días
  • lmdeploy@InternLM

    LMDeploy es un conjunto de herramientas para comprimir, desplegar y servir LLMs.

    8041+8Variación de estrellas de los últimos 7 días
  • dynamo@ai-dynamo

    Un framework de servicio de inferencia distribuida a escala de centro de datos

    7952+44Variación de estrellas de los últimos 7 días
  • openevolve@algorithmicsuperintelligence

    Implementación de código abierto de AlphaEvolve

    7307+22Variación de estrellas de los últimos 7 días
  • kimi-k3-in-c@FareedKhan-dev

    Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.

    7187+468Variación de estrellas de los últimos 7 días
  • plano@katanemo

    Plano es un servidor proxy nativo de IA y plano de datos para aplicaciones agénticas. Enrutamiento inteligente de LLM, observabilidad, orquestación de agentes y barreras de seguridad para que te concentres en la lógica central de tus agentes.

    7033+11Variación de estrellas de los últimos 7 días
  • turbo-fieldfare@drumih

    Inferencia de Gemma 4 26B-A4B en ~2 GB de RAM en cualquier MacBook con chip de la serie M

    6664+178Variación de estrellas de los últimos 7 días
  • flashinfer@flashinfer-ai

    FlashInfer: Biblioteca de kernels para servir LLM

    6321+38Variación de estrellas de los últimos 7 días
  • cactus@cactus-compute

    Cuantización, núcleos, entorno de ejecución y motor de inferencia para dispositivos móviles, wearables, hogares inteligentes y robots.

    5975+20Variación de estrellas de los últimos 7 días
  • kserve@kserve

    Plataforma de inferencia de IA generativa y predictiva distribuida estandarizada para despliegue escalable y multi-framework en Kubernetes

    5853+13Variación de estrellas de los últimos 7 días
  • shimmy@Michael-A-Kuykendall

    ⚡ Motor de inferencia WebGPU en Rust puro: compatible con la API de OpenAI, nativo de GGUF, se ejecuta en cualquier GPU. Sin Python. Sin llama.cpp. Binario único.

    5816+6Variación de estrellas de los últimos 7 días
  • gpustack@gpustack

    Un administrador de clústeres de GPU para el servicio de modelos de IA de alto rendimiento (vLLM, SGLang) e instancias de GPU accesibles por SSH bajo demanda.

    5593+21Variación de estrellas de los últimos 7 días
  • lemonade@lemonade-sdk

    Lemonade ayuda a los usuarios a descubrir y ejecutar aplicaciones de IA locales sirviendo LLMs optimizados directamente desde sus propias GPU y NPU. Únete a nuestro discord: https://discord.gg/5xXzkMu8Zk

    5585+55Variación de estrellas de los últimos 7 días
  • Awesome-LLM-Inference@xlite-dev

    📚 Una lista seleccionada de los mejores artículos de inferencia LLM/VLM con código: Flash-Attention, Paged-Attention, WINT8/4, paralelismo, etc. 🎉

    5482+3Variación de estrellas de los últimos 7 días
  • superduper@superduper-io

    Superduper: marco de trabajo integral para construir aplicaciones y agentes de IA personalizados.

    5318+1Variación de estrellas de los últimos 7 días
  • eko@FellouAI

    Eko (Eko Keeps Operating) - Crea flujos de trabajo de agentes listos para producción con lenguaje natural - eko.fellou.ai

    4954+2Variación de estrellas de los últimos 7 días
  • RuVector@ruvnet

    RuVector es una base de datos de memoria Vector GNN, IA de autoaprendizaje en tiempo real y de alto rendimiento, construida en Rust.

    4473+6Variación de estrellas de los últimos 7 días
  • optillm@algorithmicsuperintelligence

    Optimización del proxy de inferencia para LLMs

    4260+3Variación de estrellas de los últimos 7 días
  • GenerativeAIExamples@NVIDIA

    Flujos de trabajo de referencia de IA generativa optimizados para infraestructura acelerada y arquitectura de microservicios.

    4169+4Variación de estrellas de los últimos 7 días
  • lorax@predibase

    Servidor de inferencia multi-LoRA que se escala a miles de LLM ajustados

    3827+1Variación de estrellas de los últimos 7 días
  • AI-Engineer-Headquarters@hemansnation

    Una colección de métodos científicos, procesos, algoritmos y sistemas para construir historias y modelos.

    3676+2Variación de estrellas de los últimos 7 días
  • spiceai@spiceai

    Agrega un nodo de análisis en tiempo real a tu base de datos operacional. Spice es un motor portátil y acelerado de consultas SQL, búsquedas y inferencia de LLM en Rust para aplicaciones y agentes de IA basados en datos.

    3075+1Variación de estrellas de los últimos 7 días
← Volver a temas