mixture-of-experts
mixture-of-experts टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर mixture-of-experts के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और mixture-of-experts टैग वाली रिपॉजिटरी।
- #1
8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।
★ 7,567 - #2
Swiftlet एक Swift और Metal रनटाइम है जो स्टोरेज से एक्सपर्ट वेट्स को स्ट्रीम करके Apple डिवाइस पर बड़े Qwen Mixture-of-Experts मॉडल को स्थानीय रूप से चलाता है, जिससे iPhone सहित कम RAM पर भी 35B और 80B मॉडल चलाना संभव होता है।
★ 634 - #3
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 552 - #4
Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of that RAM by streaming experts from SSD. MLX + Swift, Ollama-compatible API.
★ 287
- #1
DeepSpeed एक डीप लर्निंग ऑप्टिमाइज़ेशन लाइब्रेरी है जो डिस्ट्रिब्यूटेड ट्रेनिंग और इन्फेरेंस को आसान, कुशल और प्रभावी बनाती है।
★ 43,058+0पिछले 7 दिनों में स्टार का बदलाव - #2
8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।
★ 7,567+490पिछले 7 दिनों में स्टार का बदलाव - #3★ 4,260+0पिछले 7 दिनों में स्टार का बदलाव
- #4
PyTorch में विकेंद्रीकृत (decentralized) डीप लर्निंग। दुनिया भर के हज़ारों स्वयंसेवकों पर मॉडल प्रशिक्षित करने के लिए निर्मित।
★ 2,521+0पिछले 7 दिनों में स्टार का बदलाव - #5
Colab या उपभोक्ता डेस्कटॉप पर Mixtral-8x7B मॉडल चलाएं
★ 2,334+0पिछले 7 दिनों में स्टार का बदलाव - #6★ 2,323+0पिछले 7 दिनों में स्टार का बदलाव
- #7
Noam Shazeer आदि द्वारा "The Sparsely-Gated Mixture-of-Experts Layer" का PyTorch पुनः-कार्यान्वयन। https://arxiv.org/abs/1701.06538
★ 1,253+0पिछले 7 दिनों में स्टार का बदलाव - #8★ 1,088+1पिछले 7 दिनों में स्टार का बदलाव
- #9
Tutel MoE: ऑप्टिमाइज़्ड मिक्सचर-ऑफ-एक्सपर्ट्स लाइब्रेरी, जो FP8/NVFP4/MXFP4 का उपयोग करके GptOss/DeepSeek/Kimi-K2/Qwen3 को सपोर्ट करती है।
★ 1,018+2पिछले 7 दिनों में स्टार का बदलाव - #10
LLaMA-MoE: निरंतर प्री-ट्रेनिंग के साथ LLaMA से Mixture-of-Experts का निर्माण (EMNLP 2024)
★ 1,002+1पिछले 7 दिनों में स्टार का बदलाव - #11
cuDNN Frontend, cuDNN लाइब्रेरी के लिए NVIDIA का आधुनिक, ओपन-सोर्स एंट्री पॉइंट है और उच्च-प्रदर्शन वाले ओपन-सोर्स कर्नेल का एक बढ़ता हुआ संग्रह है।
★ 932+9पिछले 7 दिनों में स्टार का बदलाव - #12★ 912+0पिछले 7 दिनों में स्टार का बदलाव
- #13
Andrej Karpathy के makemore से प्रेरित होकर स्पार्स मिक्सचर ऑफ़ एक्सपर्ट्स भाषा मॉडल का स्क्रैच से कार्यान्वयन :)
★ 815+0पिछले 7 दिनों में स्टार का बदलाव - #14
Swiftlet एक Swift और Metal रनटाइम है जो स्टोरेज से एक्सपर्ट वेट्स को स्ट्रीम करके Apple डिवाइस पर बड़े Qwen Mixture-of-Experts मॉडल को स्थानीय रूप से चलाता है, जिससे iPhone सहित कम RAM पर भी 35B और 80B मॉडल चलाना संभव होता है।
★ 634+51पिछले 7 दिनों में स्टार का बदलाव - #15
चीनी Mixtral मिक्स-ऑफ-एक्सपर्ट्स (MoE) LLM
★ 612+0पिछले 7 दिनों में स्टार का बदलाव - #16
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
★ 552+19पिछले 7 दिनों में स्टार का बदलाव - #17
Krasis एक हाइब्रिड LLM रनटाइम है जो सीमित VRAM वाले उपभोक्ता-ग्रेड हार्डवेयर पर बड़े मॉडलों को कुशलतापूर्वक चलाने पर केंद्रित है
★ 519+3पिछले 7 दिनों में स्टार का बदलाव - #18
मल्टीपल LLM एक्सपर्ट्स को आसानी से मर्ज करने और मर्ज किए गए LLM को कुशलतापूर्वक ट्रेन करने के लिए एक लाइब्रेरी।
★ 516+0पिछले 7 दिनों में स्टार का बदलाव