moe
Repositorios de código abierto monitorizados etiquetados con moe, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a moe en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con moe.
- #1
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.884 - #2
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 7161 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543
- #1
Un motor de inferencia y servicio de alto rendimiento y eficiente en memoria para LLMs
★ 90.817+402Variación de estrellas de los últimos 7 días - #2
Ajuste fino eficiente y unificado de más de 100 LLMs y VLMs (ACL 2024)
★ 74.532+89Variación de estrellas de los últimos 7 días - #3
SGLang es un marco de servicio de alto rendimiento para modelos de lenguaje grande y modelos multimodales.
★ 33.538+791Variación de estrellas de los últimos 7 días - #4
Usa PEFT o parámetros completos para CPT/SFT/DPO/GRPO en más de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) y más de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Variación de estrellas de los últimos 7 días - #5
TensorRT LLM ofrece a los usuarios una API de Python fácil de usar para definir Modelos de Lenguaje Grande (LLMs) y admite optimizaciones de vanguardia para realizar inferencias de manera eficiente en GPUs NVIDIA. TensorRT LLM también contiene componentes para crear entornos de ejecución en Python y C++ que organizan la ejecución de inferencias de alto rendimiento.
★ 14.536+38Variación de estrellas de los últimos 7 días - #6
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 11.884+2287Variación de estrellas de los últimos 7 días - #7
Un Kimi K3 de 2,78 billones de parámetros ejecutando inferencia en una sola CPU con 8,24 GB de RAM. C99 portátil: sin BLAS, sin framework, sin GPU.
★ 7161+442Variación de estrellas de los últimos 7 días - #8
FlashInfer: Biblioteca de kernels para servir LLM
★ 6321+38Variación de estrellas de los últimos 7 días - #9
Una aplicación cliente no oficial con interfaz enfocada para https://bgm.tv en Android e iOS, construida con React Native.
★ 5900+6Variación de estrellas de los últimos 7 días - #10★ 4422+1Variación de estrellas de los últimos 7 días
- #11★ 2322+0Variación de estrellas de los últimos 7 días
- #12★ 2174+1Variación de estrellas de los últimos 7 días
- #13
UCCL es una biblioteca de comunicación eficiente para GPUs, que cubre colectivos, P2P (por ejemplo, transferencia de caché KV, transferencia de pesos RL) y EP (por ejemplo, impulsado por GPU).
★ 1502+3Variación de estrellas de los últimos 7 días - #14
Reimplementación en PyTorch de "The Sparsely-Gated Mixture-of-Experts Layer" de Noam Shazeer et al. https://arxiv.org/abs/1701.06538
★ 1253+0Variación de estrellas de los últimos 7 días - #15
Tutel MoE: Biblioteca optimizada de Mixture-of-Experts, compatible con GptOss/DeepSeek/Kimi-K2/Qwen3 usando FP8/NVFP4/MXFP4
★ 1017+3Variación de estrellas de los últimos 7 días - #16
⛷️ LLaMA-MoE: Construcción de Mixture-of-Experts a partir de LLaMA con preentrenamiento continuo (EMNLP 2024)
★ 1003+2Variación de estrellas de los últimos 7 días - #17
cuDNN Frontend es el punto de entrada moderno y de código abierto de NVIDIA a la biblioteca cuDNN y a una creciente colección de kernels de alto rendimiento.
★ 929+11Variación de estrellas de los últimos 7 días - #18
Adan: Algoritmo de momento de Nesterov adaptativo para una optimización más rápida de modelos profundos.
★ 822+0Variación de estrellas de los últimos 7 días - #19
Solución de código abierto para el ajuste fino de parámetros completos de DeepSeek-V3/R1 671B, que incluye código y scripts completos desde el entrenamiento hasta la inferencia, así como experiencias prácticas y conclusiones.
★ 812+0Variación de estrellas de los últimos 7 días - #20
Servidor de inferencia LLM nativo en MLX Swift para Apple Silicon. API compatible con OpenAI, streaming SSD para modelos MoE de más de 100B, compresión de caché KV TurboQuant, aplicación para MACOS + iOS iPhone.
★ 758+6Variación de estrellas de los últimos 7 días - #21
[CVPR2026] Código oficial para el artículo "YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection." (YOLO = You Only Look Once)
★ 707+12Variación de estrellas de los últimos 7 días - #22
Motor de inferencia LLM en Rust puro + CUDA; sin PyTorch, compatible con OpenAI, sirve desde Qwen3 hasta Kimi-K2
★ 673+14Variación de estrellas de los últimos 7 días - #23
Modelos de lenguaje grandes (LLM) Mixtral MoE en chino.
★ 612+0Variación de estrellas de los últimos 7 días - #24
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 543—Variación de estrellas de los últimos 7 días