llm-inference
Repositorios de código abierto monitorizados etiquetados con llm-inference, ordenados por estrellas.
- #31
Inferencia de LLM distribuida. Conecte dispositivos domésticos en un clúster potente para acelerar la inferencia de LLM. Más dispositivos significan una inferencia más rápida.
★ 3050+4Variación de estrellas de los últimos 7 días - #32
Medusa: Un framework simple para acelerar la generación de LLM con múltiples cabezales de decodificación
★ 2771+0Variación de estrellas de los últimos 7 días - #33
Implementación oficial de EAGLE-1 (ICML'24), EAGLE-2 (EMNLP'24) y EAGLE-3 (NeurIPS'25).
★ 2521+7Variación de estrellas de los últimos 7 días - #34
Un agente de codificación abierto para tu terminal, construido por un colectivo de la comunidad en lugar de una empresa. Trae tu propio modelo, mantén tu código en tu máquina y no le debes nada a nadie.
★ 2439+41Variación de estrellas de los últimos 7 días - #35
El framework agéntico del ecosistema PHP para construir aplicaciones impulsadas por IA listas para producción. Conecta componentes (LLMs, herramientas, bases de datos vectoriales, memoria) a agentes que interactúan con tus datos y UI.
★ 2086+21Variación de estrellas de los últimos 7 días - #36★ 2076+0Variación de estrellas de los últimos 7 días
- #37
Ejecute cualquier Llama 2 localmente con interfaz de usuario gradio en GPU o CPU desde cualquier lugar (Linux/Windows/Mac). Use `llama2-wrapper` como su backend local de llama2 para Generative Agents/Apps.
★ 1936-1Variación de estrellas de los últimos 7 días - #38★ 1764+4Variación de estrellas de los últimos 7 días
- #39
Forma declarativa de ejecutar modelos de IA en React Native en el dispositivo, impulsada por ExecuTorch.
★ 1707+5Variación de estrellas de los últimos 7 días - #40
Plataforma de investigación de benchmarks de inferencia continua de código abierto — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 y próximamente™ TPUv6e/v7/Trainium2/3
★ 1613+33Variación de estrellas de los últimos 7 días - #41
Un motor de inferencia de alto rendimiento para modelos LLM, VLM, DiT y REC, optimizado para diversos aceleradores de IA. Está alojado en la OpenAtom Foundation.
★ 1552+11Variación de estrellas de los últimos 7 días - #42
Organización sin fines de lucro que fomenta la IA en India mediante créditos, subvenciones y recursos
★ 1461+56Variación de estrellas de los últimos 7 días - #43
Ejecuta LLMs locales como llama, deepseek-distill, kokoro y otros directamente en tu navegador.
★ 1449+1Variación de estrellas de los últimos 7 días - #44
Lista de software que permite realizar búsquedas en la web con asistencia de IA: https://hf.co/spaces/felladrin/awesome-ai-web-search
★ 1426+3Variación de estrellas de los últimos 7 días - #45
Aplicación de IA local y motor de inferencia para agentes. Ejecuta LLMs de pesos abiertos localmente: privado, 100% sin conexión en tu computadora. Únete a nuestro Discord: https://discord.com/invite/8wGSsvmg4V
★ 1413+20Variación de estrellas de los últimos 7 días - #46
Repositorio de "How To Scale Your Model", un libro de texto breve estilo blog sobre el escalado de LLMs en TPUs
★ 1396+12Variación de estrellas de los últimos 7 días - #47
Una colección curada de herramientas de pruebas de penetración y utilidades de productividad de primer nivel en múltiples dominios. ¡Únete para explorar, contribuir y mejorar tu kit de herramientas de hacking!
★ 1383+1Variación de estrellas de los últimos 7 días - #48
LLMs como copilotos para la demostración de teoremas en Lean
★ 1318+1Variación de estrellas de los últimos 7 días - #49★ 1275+130Variación de estrellas de los últimos 7 días
- #50
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
★ 1214+316Variación de estrellas de los últimos 7 días - #51
Optimiza y simplifica el diseño de prompts tanto para desarrolladores como para usuarios no técnicos mediante un enfoque de bajo código.
★ 1154+0Variación de estrellas de los últimos 7 días - #52
Construye tu propio motor de inferencia LLM de alto rendimiento en C++ y CUDA: una versión más pequeña de vLLM.
★ 1094+15Variación de estrellas de los últimos 7 días - #53
OpenAlpha_Evolve es un framework de Python de código abierto inspirado en la investigación innovadora sobre agentes de codificación autónomos como AlphaEvolve de DeepMind.
★ 1050+0Variación de estrellas de los últimos 7 días - #54
AI-Compass guía a la comunidad a través del océano de la tecnología de IA, ofreciendo rutas para principiantes y desarrolladores avanzados. Su objetivo es ayudar a los desarrolladores a comprender sistemáticamente los conceptos centrales, las tecnologías principales y las tendencias de vanguardia de la IA, dominando el proceso desde la teoría hasta la implementación práctica.
★ 935+10Variación de estrellas de los últimos 7 días - #55
Lista de servicios de hosting ordenados por el precio del plan mínimo
★ 926+3Variación de estrellas de los últimos 7 días - #56
Implementación pura en C++ de varios modelos para chat en tiempo real en su computadora (CPU y GPU).
★ 925+3Variación de estrellas de los últimos 7 días - #57
Un motor de aceleración de inferencia LLM altamente optimizado para Llama y sus variantes.
★ 908+0Variación de estrellas de los últimos 7 días - #58
Notas sobre LLM, incluyendo inferencia de modelos, estructura de modelos transformer y análisis de código de frameworks de LLM.
★ 890+1Variación de estrellas de los últimos 7 días - #59
Una hoja de ruta de 10 semanas, 30 minutos al día, para la inferencia y optimización de LLM. Incluye vLLM, SGLang, cuantización, decodificación especulativa y benchmarking.
★ 882+77Variación de estrellas de los últimos 7 días - #60
LLM.swift es una biblioteca simple y legible que permite interactuar fácilmente con modelos de lenguaje grandes de forma local en macOS, iOS, watchOS, tvOS y visionOS.
★ 874+3Variación de estrellas de los últimos 7 días