मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · llm-inference

llm-inference

llm-inference टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
84
कुल स्टार
4,08,416
औसत स्टार
4,862
हिस्सा
0.02%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर llm-inference के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और llm-inference टैग वाली रिपॉजिटरी।

  • kimi-k3-in-c@FareedKhan-dev

    8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।

    7,216
  • turbo-fieldfare@drumih

    किसी भी M-सीरीज़ MacBook पर ~2 GB RAM में Gemma 4 26B-A4B अनुमान

    6,673
  • vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क

    1,215
  • LLM इन्फरेंस सर्विंग और ऑप्टिमाइज़ेशन के लिए 10-सप्ताह, 30-मिनट-प्रति-दिन का रोडमैप। vLLM, SGLang, क्वांटाइज़ेशन, स्पेक्युलेटिव डिकोडिंग, बेंचमार्किंग।

    882
  • mlx-dspark@ARahim3

    Apple Silicon पर 4 गुना तेज़ LLM डिकोडिंग, बिना किसी नुकसान के। DeepSeek के DSpark और z-lab के DFlash स्पेक्युलेटिव डिकोडिंग का नेटिव MLX पोर्ट — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, टर्नरी Bonsai-27B।

    645
  • gpt4all@nomic-ai

    GPT4All: किसी भी डिवाइस पर Local LLMs चलाएं। ओपन-सोर्स और व्यावसायिक उपयोग के लिए उपलब्ध।

    77,387-9पिछले 7 दिनों में स्टार का बदलाव
  • ray@ray-project

    Ray एक AI कंप्यूट इंजन है। Ray में ML वर्कलोड को तेज करने के लिए एक कोर डिस्ट्रिब्यूटेड रनटाइम और AI लाइब्रेरी का एक सेट शामिल है।

    43,688+41पिछले 7 दिनों में स्टार का बदलाव
  • gitleaks@gitleaks

    Gitleaks के साथ सीक्रेट्स खोजें 🔑

    29,078+70पिछले 7 दिनों में स्टार का बदलाव
  • llm-action@liguodongiot

    यह प्रोजेक्ट बड़े मॉडल से संबंधित तकनीकी सिद्धांतों और व्यावहारिक अनुभवों (बड़े मॉडल इंजीनियरिंग, बड़े मॉडल एप्लिकेशन लैंडिंग) को साझा करने के लिए है।

    24,995+21पिछले 7 दिनों में स्टार का बदलाव
  • litgpt@Lightning-AI

    20 से अधिक उच्च-प्रदर्शन वाले LLMs, जिन्हें बड़े पैमाने पर प्रीट्रेन, फाइनट्यून और डिप्लॉय करने के लिए रेसिपी के साथ पेश किया गया है।

    13,645+9पिछले 7 दिनों में स्टार का बदलाव
  • OpenLLM@bentoml

    क्लाउड में किसी भी ओपन-सोर्स LLM, जैसे DeepSeek और Llama, को OpenAI-संगत API एंडपॉइंट के रूप में चलाएं।

    12,524+1पिछले 7 दिनों में स्टार का बदलाव
  • openvino@openvinotoolkit

    OpenVINO™ AI इन्फरेंस को ऑप्टिमाइज़ और डिप्लॉय करने के लिए एक ओपन सोर्स टूलकिट है।

    10,793+30पिछले 7 दिनों में स्टार का बदलाव
  • PowerInfer@Tiiny-AI

    लोकल डिप्लॉयमेंट के लिए हाई-स्पीड लार्ज लैंग्वेज मॉडल सर्विंग।

    9,765+7पिछले 7 दिनों में स्टार का बदलाव
  • BentoML@bentoml

    AI ऐप्स और मॉडल सर्व करने का सबसे आसान तरीका - मॉडल इन्फेरेंस API, जॉब कतारें, LLM ऐप्स, मल्टी-मॉडल पाइपलाइन और बहुत कुछ बनाएँ!

    8,817+4पिछले 7 दिनों में स्टार का बदलाव
  • lmdeploy@InternLM

    LMDeploy LLMs को संपीड़ित करने, तैनात करने और सेवा देने के लिए एक टूलकिट है।

    8,041+8पिछले 7 दिनों में स्टार का बदलाव
  • dynamo@ai-dynamo

    एक डेटासेंटर स्केल डिस्ट्रिब्यूटेड इन्फेरेंस सर्विंग फ़्रेमवर्क

    7,952+44पिछले 7 दिनों में स्टार का बदलाव
  • openevolve@algorithmicsuperintelligence

    AlphaEvolve का ओपन-सोर्स कार्यान्वयन

    7,307+22पिछले 7 दिनों में स्टार का बदलाव
  • kimi-k3-in-c@FareedKhan-dev

    8.24 GB रैम में एक सिंगल CPU पर इन्फेरेंस चलाने वाला 2.78-खरब-पैरामीटर Kimi K3। पोर्टेबल C99: कोई BLAS नहीं, कोई फ्रेमवर्क नहीं, कोई GPU नहीं।

    7,216+498पिछले 7 दिनों में स्टार का बदलाव
  • plano@katanemo

    Plano एजेंटिक ऐप्स के लिए एक AI-नेटिव प्रॉक्सी सर्वर और डेटा प्लेन है। स्मार्ट LLM रूटिंग, ऑब्ज़र्वेबिलिटी, एजेंट ऑर्केस्ट्रेशन और गार्डरेल्स ताकि आप अपने एजेंट के मुख्य लॉजिक पर ध्यान केंद्रित रख सकें।

    7,033+11पिछले 7 दिनों में स्टार का बदलाव
  • turbo-fieldfare@drumih

    किसी भी M-सीरीज़ MacBook पर ~2 GB RAM में Gemma 4 26B-A4B अनुमान

    6,673+187पिछले 7 दिनों में स्टार का बदलाव
  • flashinfer@flashinfer-ai

    FlashInfer: LLM सर्विंग के लिए कर्नेल लाइब्रेरी

    6,321+38पिछले 7 दिनों में स्टार का बदलाव
  • cactus@cactus-compute

    मोबाइल, पहनने योग्य उपकरणों, स्मार्ट होम और रोबोट के लिए क्वांटाइजेशन, कर्नेल, रनटाइम और अनुमान इंजन।

    5,975+20पिछले 7 दिनों में स्टार का बदलाव
  • kserve@kserve

    Kubernetes पर स्केलेबल, मल्टी-फ़्रेमवर्क तैनाती के लिए मानकीकृत वितरित जनरेटिव और प्रेडिक्टिव AI इन्फेरेंस प्लेटफ़ॉर्म

    5,853+13पिछले 7 दिनों में स्टार का बदलाव
  • shimmy@Michael-A-Kuykendall

    ⚡ प्योर-Rust WebGPU इन्फेरेंस इंजन — OpenAI-API संगत, GGUF नेटिव, किसी भी GPU पर चलता है। कोई Python नहीं। कोई llama.cpp नहीं। सिंगल बाइनरी।

    5,816+6पिछले 7 दिनों में स्टार का बदलाव
  • gpustack@gpustack

    हाई-परफॉरमेंस AI मॉडल सर्विंग (vLLM, SGLang) और ऑन-डिमांड SSH-एक्सेसिबल GPU इंस्टेंस के लिए एक GPU क्लस्टर मैनेजर।

    5,593+21पिछले 7 दिनों में स्टार का बदलाव
  • lemonade@lemonade-sdk

    Lemonade उपयोगकर्ताओं को सीधे उनके अपने GPU और NPU से अनुकूलित LLM सर्व करके स्थानीय AI ऐप्स खोजने और चलाने में मदद करता है।

    5,585+55पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-LLM-Inference@xlite-dev

    📚 कोड के साथ बेहतरीन LLM/VLM इन्फेरेंस पेपर्स की क्यूरेटेड सूची: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, आदि।🎉

    5,482+3पिछले 7 दिनों में स्टार का बदलाव
  • superduper@superduper-io

    Superduper: कस्टम AI एप्लिकेशन और एजेंटों के निर्माण के लिए एंड-टू-एंड फ्रेमवर्क।

    5,318+1पिछले 7 दिनों में स्टार का बदलाव
  • eko@FellouAI

    Eko (Eko Keeps Operating) - प्राकृतिक भाषा के साथ प्रोडक्शन-रेडी एजेंटिक वर्कफ़्लो बनाएं - eko.fellou.ai

    4,954+2पिछले 7 दिनों में स्टार का बदलाव
  • RuVector@ruvnet

    RuVector एक उच्च-प्रदर्शन, रीयल-टाइम, सेल्फ-लर्निंग AI, वेक्टर GNN, मेमोरी DB है जिसे Rust में बनाया गया है।

    4,473+6पिछले 7 दिनों में स्टार का बदलाव
  • optillm@algorithmicsuperintelligence

    LLM के लिए अनुमान प्रॉक्सी का अनुकूलन

    4,260+3पिछले 7 दिनों में स्टार का बदलाव
  • GenerativeAIExamples@NVIDIA

    त्वरित बुनियादी ढाचे और माइक्रोservice आर्किटेक्चर के लिए अनुकूलित जेनेरेटिव AI संदर्भ वर्कफ़्लो।

    4,169+4पिछले 7 दिनों में स्टार का बदलाव
  • lorax@predibase

    मल्टी-LoRA इन्फेरेंस सर्वर जो हजारों फाइन-ट्यून्ड LLM तक स्केल करता है।

    3,827+1पिछले 7 दिनों में स्टार का बदलाव
  • AI-Engineer-Headquarters@hemansnation

    कहानियाँ और मॉडल बनाने के लिए वैज्ञानिक तरीकों, प्रक्रियाओं, एल्गोरिदम और प्रणालियों का एक संग्रह।

    3,676+2पिछले 7 दिनों में स्टार का बदलाव
  • spiceai@spiceai

    अपने ऑपरेशनल डेटाबेस में रियल-टाइम एनालिटिक्स नोड जोड़ें। Spice डेटा-ग्राउंडेड AI ऐप्स और एजेंटों के लिए Rust में एक पोर्टेबल, त्वरित SQL क्वेरी, सर्च और LLM-इन्फफेरेंस इंजन है।

    3,075+1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस