llm-inference
llm-inference टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर llm-inference के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और llm-inference टैग वाली रिपॉजिटरी।
- #1
8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।
★ 7,216 - #2
किसी भी M-सीरीज़ MacBook पर ~2 GB RAM में Gemma 4 26B-A4B अनुमान
★ 6,673 - #3
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,215 - #4
LLM इन्फरेंस सर्विंग और ऑप्टिमाइज़ेशन के लिए 10-सप्ताह, 30-मिनट-प्रति-दिन का रोडमैप। vLLM, SGLang, क्वांटाइज़ेशन, स्पेक्युलेटिव डिकोडिंग, बेंचमार्किंग।
★ 882 - #5
Apple Silicon पर 4 गुना तेज़ LLM डिकोडिंग, बिना किसी नुकसान के। DeepSeek के DSpark और z-lab के DFlash स्पेक्युलेटिव डिकोडिंग का नेटिव MLX पोर्ट — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, टर्नरी Bonsai-27B।
★ 645
- #1
GPT4All: किसी भी डिवाइस पर Local LLMs चलाएं। ओपन-सोर्स और व्यावसायिक उपयोग के लिए उपलब्ध।
★ 77,387-9पिछले 7 दिनों में स्टार का बदलाव - #2
Ray एक AI कंप्यूट इंजन है। Ray में ML वर्कलोड को तेज करने के लिए एक कोर डिस्ट्रिब्यूटेड रनटाइम और AI लाइब्रेरी का एक सेट शामिल है।
★ 43,688+41पिछले 7 दिनों में स्टार का बदलाव - #3★ 29,078+70पिछले 7 दिनों में स्टार का बदलाव
- #4
यह प्रोजेक्ट बड़े मॉडल से संबंधित तकनीकी सिद्धांतों और व्यावहारिक अनुभवों (बड़े मॉडल इंजीनियरिंग, बड़े मॉडल एप्लिकेशन लैंडिंग) को साझा करने के लिए है।
★ 24,995+21पिछले 7 दिनों में स्टार का बदलाव - #5
20 से अधिक उच्च-प्रदर्शन वाले LLMs, जिन्हें बड़े पैमाने पर प्रीट्रेन, फाइनट्यून और डिप्लॉय करने के लिए रेसिपी के साथ पेश किया गया है।
★ 13,645+9पिछले 7 दिनों में स्टार का बदलाव - #6
क्लाउड में किसी भी ओपन-सोर्स LLM, जैसे DeepSeek और Llama, को OpenAI-संगत API एंडपॉइंट के रूप में चलाएं।
★ 12,524+1पिछले 7 दिनों में स्टार का बदलाव - #7
OpenVINO™ AI इन्फरेंस को ऑप्टिमाइज़ और डिप्लॉय करने के लिए एक ओपन सोर्स टूलकिट है।
★ 10,793+30पिछले 7 दिनों में स्टार का बदलाव - #8
लोकल डिप्लॉयमेंट के लिए हाई-स्पीड लार्ज लैंग्वेज मॉडल सर्विंग।
★ 9,765+7पिछले 7 दिनों में स्टार का बदलाव - #9
AI ऐप्स और मॉडल सर्व करने का सबसे आसान तरीका - मॉडल इन्फेरेंस API, जॉब कतारें, LLM ऐप्स, मल्टी-मॉडल पाइपलाइन और बहुत कुछ बनाएँ!
★ 8,817+4पिछले 7 दिनों में स्टार का बदलाव - #10★ 8,041+8पिछले 7 दिनों में स्टार का बदलाव
- #11★ 7,952+44पिछले 7 दिनों में स्टार का बदलाव
- #12
AlphaEvolve का ओपन-सोर्स कार्यान्वयन
★ 7,307+22पिछले 7 दिनों में स्टार का बदलाव - #13
8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।
★ 7,216+498पिछले 7 दिनों में स्टार का बदलाव - #14
Plano एजेंटिक ऐप्स के लिए एक AI-नेटिव प्रॉक्सी सर्वर और डेटा प्लेन है। स्मार्ट LLM रूटिंग, ऑब्ज़र्वेबिलिटी, एजेंट ऑर्केस्ट्रेशन और गार्डरेल्स ताकि आप अपने एजेंट के मुख्य लॉजिक पर ध्यान केंद्रित रख सकें।
★ 7,033+11पिछले 7 दिनों में स्टार का बदलाव - #15
किसी भी M-सीरीज़ MacBook पर ~2 GB RAM में Gemma 4 26B-A4B अनुमान
★ 6,673+187पिछले 7 दिनों में स्टार का बदलाव - #16
FlashInfer: LLM सर्विंग के लिए कर्नेल लाइब्रेरी
★ 6,321+38पिछले 7 दिनों में स्टार का बदलाव - #17
मोबाइल, पहनने योग्य उपकरणों, स्मार्ट होम और रोबोट के लिए क्वांटाइजेशन, कर्नेल, रनटाइम और अनुमान इंजन।
★ 5,975+20पिछले 7 दिनों में स्टार का बदलाव - #18
Kubernetes पर स्केलेबल, मल्टी-फ़्रेमवर्क तैनाती के लिए मानकीकृत वितरित जनरेटिव और प्रेडिक्टिव AI इन्फेरेंस प्लेटफ़ॉर्म
★ 5,853+13पिछले 7 दिनों में स्टार का बदलाव - #19
⚡ प्योर-Rust WebGPU इन्फेरेंस इंजन — OpenAI-API संगत, GGUF नेटिव, किसी भी GPU पर चलता है। कोई Python नहीं। कोई llama.cpp नहीं। सिंगल बाइनरी।
★ 5,816+6पिछले 7 दिनों में स्टार का बदलाव - #20
हाई-परफॉरमेंस AI मॉडल सर्विंग (vLLM, SGLang) और ऑन-डिमांड SSH-एक्सेसिबल GPU इंस्टेंस के लिए एक GPU क्लस्टर मैनेजर।
★ 5,593+21पिछले 7 दिनों में स्टार का बदलाव - #21
Lemonade उपयोगकर्ताओं को सीधे उनके अपने GPU और NPU से अनुकूलित LLM सर्व करके स्थानीय AI ऐप्स खोजने और चलाने में मदद करता है।
★ 5,585+55पिछले 7 दिनों में स्टार का बदलाव - #22
📚 कोड के साथ बेहतरीन LLM/VLM इन्फेरेंस पेपर्स की क्यूरेटेड सूची: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, आदि।🎉
★ 5,482+3पिछले 7 दिनों में स्टार का बदलाव - #23
Superduper: कस्टम AI एप्लिकेशन और एजेंटों के निर्माण के लिए एंड-टू-एंड फ्रेमवर्क।
★ 5,318+1पिछले 7 दिनों में स्टार का बदलाव - #24
Eko (Eko Keeps Operating) - प्राकृतिक भाषा के साथ प्रोडक्शन-रेडी एजेंटिक वर्कफ़्लो बनाएं - eko.fellou.ai
★ 4,954+2पिछले 7 दिनों में स्टार का बदलाव - #25
RuVector एक उच्च-प्रदर्शन, रीयल-टाइम, सेल्फ-लर्निंग AI, वेक्टर GNN, मेमोरी DB है जिसे Rust में बनाया गया है।
★ 4,473+6पिछले 7 दिनों में स्टार का बदलाव - #26★ 4,260+3पिछले 7 दिनों में स्टार का बदलाव
- #27
त्वरित बुनियादी ढाचे और माइक्रोservice आर्किटेक्चर के लिए अनुकूलित जेनेरेटिव AI संदर्भ वर्कफ़्लो।
★ 4,169+4पिछले 7 दिनों में स्टार का बदलाव - #28★ 3,827+1पिछले 7 दिनों में स्टार का बदलाव
- #29
कहानियाँ और मॉडल बनाने के लिए वैज्ञानिक तरीकों, प्रक्रियाओं, एल्गोरिदम और प्रणालियों का एक संग्रह।
★ 3,676+2पिछले 7 दिनों में स्टार का बदलाव - #30
अपने ऑपरेशनल डेटाबेस में रियल-टाइम एनालिटिक्स नोड जोड़ें। Spice डेटा-ग्राउंडेड AI ऐप्स और एजेंटों के लिए Rust में एक पोर्टेबल, त्वरित SQL क्वेरी, सर्च और LLM-इन्फफेरेंस इंजन है।
★ 3,075+1पिछले 7 दिनों में स्टार का बदलाव