moe
Dépôts open source suivis étiquetés moe, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de moe sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés moe.
- #1
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 12 336 - #2
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 7 435 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 550
- #1
Un moteur d'inférence et de service à haut débit et économe en mémoire pour les LLM
★ 90 817+0Évolution des étoiles sur les 7 derniers jours - #2
Fine-tuning efficace et unifié de plus de 100 LLM et VLM (ACL 2024).
★ 74 532+0Évolution des étoiles sur les 7 derniers jours - #3
SGLang est un framework de service haute performance pour les grands modèles de langage et les modèles multimodaux.
★ 33 538+0Évolution des étoiles sur les 7 derniers jours - #4
Utilisez PEFT ou le paramétrage complet pour CPT/SFT/DPO/GRPO sur plus de 600 LLM et 300 MLLM (AAAI 2025).
★ 15 488+0Évolution des étoiles sur les 7 derniers jours - #5
TensorRT LLM fournit aux utilisateurs une API Python facile à utiliser pour définir des modèles de langage étendus (LLM) et prend en charge des optimisations de pointe pour effectuer des inférences efficacement sur les GPU NVIDIA. TensorRT LLM contient également des composants pour créer des runtimes Python et C++ qui orchestrent l'exécution de l'inférence de manière performante.
★ 14 536+0Évolution des étoiles sur les 7 derniers jours - #6
FreeToken brings datacenter-scale model serving to your desktop. Run massive models locally, fast and efficiently.
★ 12 336+983Évolution des étoiles sur les 7 derniers jours - #7
Kimi K3 avec 2,78 billions de paramètres exécutant l'inférence sur un seul CPU avec 8,24 Go de RAM. C99 portable : sans BLAS, sans framework, sans GPU.
★ 7 435+300Évolution des étoiles sur les 7 derniers jours - #8
FlashInfer : bibliothèque de noyaux pour le service de LLM
★ 6 321+0Évolution des étoiles sur les 7 derniers jours - #9
Client non officiel pour bgm.tv sur Android et iOS, développé avec React Native. Une application sans publicité, axée sur les loisirs et non lucrative pour le suivi d'animés, conçue pour le mobile avec des fonctionnalités avancées et des options de personnalisation
★ 5 900+0Évolution des étoiles sur les 7 derniers jours - #10★ 4 422+0Évolution des étoiles sur les 7 derniers jours
- #11
TMM 2025 : Mélange d'experts (Mixture-of-Experts) pour les grands modèles vision-langage.
★ 2 322+0Évolution des étoiles sur les 7 derniers jours - #12★ 2 174+0Évolution des étoiles sur les 7 derniers jours
- #13
UCCL est une bibliothèque de communication efficace pour GPU, couvrant les collectifs, le P2P (ex: transfert de cache KV, transfert de poids RL) et l'EP (ex: piloté par GPU).
★ 1 502+0Évolution des étoiles sur les 7 derniers jours - #14
Réimplémentation PyTorch de « The Sparsely-Gated Mixture-of-Experts Layer » par Noam Shazeer et al. https://arxiv.org/abs/1701.06538
★ 1 253+0Évolution des étoiles sur les 7 derniers jours - #15
Tutel MoE : bibliothèque optimisée de Mixture-of-Experts, prenant en charge GptOss/DeepSeek/Kimi-K2/Qwen3 avec FP8/NVFP4/MXFP4.
★ 1 018+2Évolution des étoiles sur les 7 derniers jours - #16
⛷️ LLaMA-MoE : Construction de Mixture-of-Experts à partir de LLaMA avec un pré-entraînement continu (EMNLP 2024).
★ 1 002+1Évolution des étoiles sur les 7 derniers jours - #17
cuDNN Frontend est le point d'entrée moderne et open-source de NVIDIA vers la bibliothèque cuDNN et une collection croissante de noyaux open-source haute performance.
★ 932+9Évolution des étoiles sur les 7 derniers jours - #18
Adan : Algorithme de momentum de Nesterov adaptatif pour une optimisation plus rapide des modèles profonds.
★ 822+0Évolution des étoiles sur les 7 derniers jours - #19
Une solution open source pour le réglage fin (fine-tuning) complet des paramètres de DeepSeek-V3/R1 671B, incluant le code et les scripts complets de l'entraînement à l'inférence, ainsi que des retours d'expérience et conclusions pratiques.
★ 812+0Évolution des étoiles sur les 7 derniers jours - #20
⚡ Serveur d'inférence LLM natif en Swift avec MLX pour Apple Silicon. API compatible OpenAI, streaming SSD pour les modèles MoE de plus de 100 milliards de paramètres, compression de cache KV TurboQuant, application mobile pour iOS et macOS.
★ 760+6Évolution des étoiles sur les 7 derniers jours - #21
[CVPR2026]🚀🚀🚀 Code officiel de l'article "YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection." *(YOLO = You Only Look Once)* 🔥🔥🔥
★ 710+10Évolution des étoiles sur les 7 derniers jours - #22
Moteur d'inférence LLM en Rust pur et CUDA — sans PyTorch, compatible avec OpenAI, servant Qwen3 vers Kimi-K2.
★ 678+9Évolution des étoiles sur les 7 derniers jours - #23
Grands modèles de mélange d'experts Mixtral en chinois (Chinese Mixtral MoE LLMs)
★ 612+0Évolution des étoiles sur les 7 derniers jours - #24
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 550+18Évolution des étoiles sur les 7 derniers jours