Saltar al contenido principal
buildradar
Sign in
Tema · llm-inference

llm-inference

Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.

83 repositorios
  • llama3.java@mukel

    Inferencia de Llama 3+ en Java puro.

    816+0Variación de estrellas de los últimos 7 días
  • lws@kubernetes-sigs

    LeaderWorkerSet: Una API para desplegar un grupo de pods como una unidad de replicación.

    807+7Variación de estrellas de los últimos 7 días
  • LLM-PowerHouse: Libere el potencial de los LLM a través de tutoriales seleccionados, mejores prácticas y código listo para usar para entrenamiento e inferencia personalizados.

    731+0Variación de estrellas de los últimos 7 días
  • llmflows@stoyan-stoyanov

    LLMFlows: aplicaciones LLM simples, explícitas y transparentes.

    707+0Variación de estrellas de los últimos 7 días
  • long-context-attention@feifeibear

    USP: Atención paralela de secuencia unificada (híbrida, 2D) para entrenamiento e inferencia de modelos Transformers de contexto largo

    691+3Variación de estrellas de los últimos 7 días
  • atlas@Avarok-Cybersecurity

    Motor de inferencia en Rust puro

    677+5Variación de estrellas de los últimos 7 días
  • pegainfer@pegainfer-project

    Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2

    673+13Variación de estrellas de los últimos 7 días
  • mlx-dspark@ARahim3

    Decodificación de LLM hasta 4 veces más rápida en Apple Silicon, sin pérdida. Puerto nativo en MLX de DSpark de DeepSeek y DFlash de z-lab para decodificación especulativa: Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, Ornith-1.0, ternary Bonsai-27B.

    637+20Variación de estrellas de los últimos 7 días
  • hipfire@warpfront

    Motor de inferencia LLM nativo de RDNA en Rust.

    605+35Variación de estrellas de los últimos 7 días
  • rkllama@NotPunchnox

    Alternativa a Ollama para Rockchip NPU: Una solución eficiente para ejecutar modelos de IA y aprendizaje profundo en dispositivos Rockchip con soporte optimizado para NPU (rkllm)

    598+3Variación de estrellas de los últimos 7 días
  • yalm@andrewkchan

    Yet Another Language Model: inferencia de LLM en C++/CUDA, sin bibliotecas excepto para E/S

    596+0Variación de estrellas de los últimos 7 días
  • qvac@tetherto

    SDK de IA local de código abierto: ejecute IA en el dispositivo sin nube ni claves API. Soporta GGUF, RAG, generación de imágenes, música y video, voz a texto, inferencia P2P y más. Multiplataforma: Linux, macOS, Windows, Android, iOS.

    588+28Variación de estrellas de los últimos 7 días
  • MiniSearch@felladrin

    Plataforma de búsqueda web minimalista con un asistente de IA que se ejecuta directamente desde el navegador. Demo: https://felladrin-minisearch.hf.space

    585+3Variación de estrellas de los últimos 7 días
  • uzi@devflowinc

    CLI para ejecutar un gran número de agentes de codificación en paralelo utilizando git worktrees.

    582+0Variación de estrellas de los últimos 7 días
  • LLM-FineTuning-Large-Language-Models@rohan-paul

    Ajuste fino de LLM (Modelos de Lenguaje Grande)

    579+0Variación de estrellas de los últimos 7 días
  • LLM-Hub@timmyy123

    Asistente de IA local

    577+12Variación de estrellas de los últimos 7 días
  • KuiperLLama@zjhellofss

    Proyecto ideal para contrataciones universitarias, de otoño, primavera y pasantías, que te guía en la implementación desde cero de un marco de inferencia de grandes modelos compatible con Llama2/3 y Qwen2.5.

    573+2Variación de estrellas de los últimos 7 días
  • qwen600@yassa9

    Motor de inferencia estático, minimalista y solo para CUDA de qwen3-0.6B.

    559+0Variación de estrellas de los últimos 7 días
  • sarathi-serve@microsoft

    Un motor de servicio de baja latencia y alto rendimiento para LLMs.

    520+0Variación de estrellas de los últimos 7 días
  • krasis@brontoguana

    Krasis es un entorno de ejecución de LLM híbrido que se centra en la ejecución eficiente de modelos grandes en hardware de consumo con VRAM limitada.

    518-1Variación de estrellas de los últimos 7 días
  • taOS@jaylfc

    Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).

    514Variación de estrellas de los últimos 7 días
  • ome@ome-projects

    Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton

    506Variación de estrellas de los últimos 7 días
  • vllm-cli@Chen-zexi

    Una herramienta de interfaz de línea de comandos para servir LLMs usando vLLM.

    506+0Variación de estrellas de los últimos 7 días
← Volver a temas