Saltar al contenido principal
buildradar
Sign in
Tema · llm-inference

llm-inference

Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.

84 repositorios
  • Inferencia de LLM distribuida. Conecte dispositivos domésticos en un clúster potente para acelerar la inferencia de LLM. Más dispositivos significan una inferencia más rápida.

    3050+4Variación de estrellas de los últimos 7 días
  • Medusa@FasterDecoding

    Medusa: Un framework simple para acelerar la generación de LLM con múltiples cabezales de decodificación

    2771+0Variación de estrellas de los últimos 7 días
  • EAGLE@SafeAILab

    Implementación oficial de EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) y EAGLE-3 (NeurIPS'25).

    2521+7Variación de estrellas de los últimos 7 días
  • nanocoder@Nano-Collective

    Un agente de codificación abierto para tu terminal, construido por un colectivo de la comunidad en lugar de una empresa. Trae tu propio modelo, mantén tu código en tu máquina y no le debes nada a nadie.

    2439+41Variación de estrellas de los últimos 7 días
  • neuron-ai@neuron-core

    El framework agéntico del ecosistema PHP para construir aplicaciones impulsadas por IA listas para producción. Conecta componentes (LLMs, herramientas, bases de datos vectoriales, memoria) a agentes que interactúan con tus datos y UI.

    2086+21Variación de estrellas de los últimos 7 días
  • aici@microsoft

    AICI: Prompts como programas (Wasm)

    2076+0Variación de estrellas de los últimos 7 días
  • llama2-webui@liltom-eth

    Ejecute cualquier Llama 2 localmente con interfaz de usuario gradio en GPU o CPU desde cualquier lugar (Linux/Windows/Mac). Use `llama2-wrapper` como su backend local de llama2 para Generative Agents/Apps.

    1936-1Variación de estrellas de los últimos 7 días
  • beta9@beam-cloud

    Inferencia de GPU serverless ultrarrápida, sandboxes y trabajos en segundo plano

    1764+4Variación de estrellas de los últimos 7 días
  • react-native-executorch@software-mansion

    Forma declarativa de ejecutar modelos de IA en React Native en el dispositivo, impulsada por ExecuTorch.

    1707+5Variación de estrellas de los últimos 7 días
  • InferenceX@SemiAnalysisAI

    Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3

    1613+33Variación de estrellas de los últimos 7 días
  • xllm@xLLM-AI

    Un motor de inferencia de alto rendimiento para modelos LLM, VLM, DiT y REC, optimizado para diversos aceleradores de IA. Está alojado en la OpenAtom Foundation.

    1552+11Variación de estrellas de los últimos 7 días
  • aigrantsindia@aigrantsindia

    Organización sin fines de lucro que fomenta la IA en India mediante créditos, subvenciones y recursos

    1461+56Variación de estrellas de los últimos 7 días
  • BrowserAI@sauravpanda

    Ejecuta LLMs locales como llama, deepseek-distill, kokoro y otros directamente en tu navegador.

    1449+1Variación de estrellas de los últimos 7 días
  • Lista de software que permite realizar búsquedas en la web con asistencia de IA: https://hf.co/spaces/felladrin/awesome-ai-web-search

    1426+3Variación de estrellas de los últimos 7 días
  • Atomic-Chat@AtomicBot-ai

    Aplicación de IA local y motor de inferencia para agentes. Ejecuta LLMs de pesos abiertos localmente: privado, 100% sin conexión en tu computadora. Únete a nuestro Discord: https://discord.com/invite/8wGSsvmg4V

    1413+20Variación de estrellas de los últimos 7 días
  • scaling-book@jax-ml

    Repositorio de "How To Scale Your Model", un libro de texto breve estilo blog sobre el escalado de LLMs en TPUs

    1396+12Variación de estrellas de los últimos 7 días
  • Una colección curada de herramientas de pruebas de penetración y utilidades de productividad de primer nivel en múltiples dominios. ¡Únete para explorar, contribuir y mejorar tu kit de herramientas de hacking!

    1383+1Variación de estrellas de los últimos 7 días
  • LeanCopilot@lean-dojo

    LLMs como copilotos para la demostración de teoremas en Lean

    1318+1Variación de estrellas de los últimos 7 días
  • kvcached@ovg-project

    Caché KV elástica virtualizada para el uso compartido dinámico de GPU y más.

    1275+130Variación de estrellas de los últimos 7 días
  • Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

    1214+316Variación de estrellas de los últimos 7 días
  • prompt-poet@character-ai

    Optimiza y simplifica el diseño de prompts tanto para desarrolladores como para usuarios no técnicos mediante un enfoque de bajo código.

    1154+0Variación de estrellas de los últimos 7 días
  • tiny-vllm@jmaczan

    Construye tu propio motor de inferencia LLM de alto rendimiento en C++ y CUDA: una versión más pequeña de vLLM.

    1094+15Variación de estrellas de los últimos 7 días
  • OpenAlpha_Evolve@shyamsaktawat

    OpenAlpha_Evolve es un framework de Python de código abierto inspirado en la investigación innovadora sobre agentes de codificación autónomos como AlphaEvolve de DeepMind.

    1050+0Variación de estrellas de los últimos 7 días
  • AI-Compass@tingaicompass

    AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.

    935+10Variación de estrellas de los últimos 7 días
  • Lista de servicios de hosting ordenados por el precio del plan mínimo

    926+3Variación de estrellas de los últimos 7 días
  • Implementación pura en C++ de varios modelos para chat en tiempo real en su computadora (CPU y GPU).

    925+3Variación de estrellas de los últimos 7 días
  • ZhiLight@zhihu

    Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.

    908+0Variación de estrellas de los últimos 7 días
  • llm_note@harleyszhang

    Notas sobre LLM, incluyendo inferencia de modelos, estructura de modelos transformer y análisis de código de frameworks de LLM.

    890+1Variación de estrellas de los últimos 7 días
  • Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.

    882+77Variación de estrellas de los últimos 7 días
  • LLM.swift@eastriverlee

    LLM.swift es una biblioteca simple y legible que permite interactuar fácilmente con modelos de lenguaje grandes de forma local en macOS, iOS, watchOS, tvOS y visionOS.

    874+3Variación de estrellas de los últimos 7 días
← Volver a temas