vllm
vllm टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर vllm के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और vllm टैग वाली रिपॉजिटरी।
- #1
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,197 - #2
LLM इन्फरेंस सर्विंग और ऑप्टिमाइज़ेशन के लिए 10-सप्ताह, 30-मिनट-प्रति-दिन का रोडमैप। vLLM, SGLang, क्वांटाइज़ेशन, स्पेक्युलेटिव डिकोडिंग, बेंचमार्किंग।
★ 881 - #3
Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.
★ 146
- #1
ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।
★ 20,136+64पिछले 7 दिनों में स्टार का बदलाव - #2
Llama Cookbook में आपका स्वागत है! Llama के साथ निर्माण करने के लिए यह आपकी पसंदीदा मार्गदर्शिका है: इन्फेरेंस, फाइन-ट्यूनिंग, RAG के साथ शुरुआत करना। हम यह भी दिखाते हैं कि Llama मॉडल परिवार का उपयोग करके एंड-टू-एंड समस्याओं को कैसे हल किया जाए और विभिन्न प्रदाता सेवाओं पर उनका उपयोग कैसे किया जाए
★ 18,556-3पिछले 7 दिनों में स्टार का बदलाव - #3
✍🏻 सोर्स कोड डीप डाइव, सिस्टम डिज़ाइन और इंजीनियरिंग ब्लॉग्स | Halfrost-Field: सोर्स कोड विश्लेषण, सिस्टम डिज़ाइन और इंजीनियरिंग अभ्यास नोट्स
★ 13,226+6पिछले 7 दिनों में स्टार का बदलाव - #4
किसी भी AI मॉडल के लिए AI अनुसंधान और इंजीनियरिंग कौशल की व्यापक ओपन-सोर्स लाइब्रेरी। कौशल को पैकेज करें और आपका claude code/codex/gemini एजेंट पूर्ण क्षमता के साथ एक AI अनुसंधान एजेंट बन जाएगा। Orchestra Research द्वारा अनुरक्षित।
★ 12,256+104पिछले 7 दिनों में स्टार का बदलाव - #5★ 11,622+60पिछले 7 दिनों में स्टार का बदलाव
- #6
Ray पर आधारित एक उपयोग में आसान, स्केलेबल और उच्च-प्रदर्शन वाला एजेंटिक RL फ्रेमवर्क (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray और Async RL)
★ 9,969+9पिछले 7 दिनों में स्टार का बदलाव - #7
कोड की एक ही लाइन बदलकर किसी भी LLM के लिए GPT को स्वैप करें। Xinference आपको क्लाउड, ऑन-प्रिमाइस या अपने लैपटॉप पर ओपन-सोर्स, स्पीच और मल्टीमॉडल मॉडल चलाने की अनुमति देता है — यह सब एक एकीकृत, प्रोडक्शन-रेडी इन्फेरेंस API के माध्यम से।
★ 9,537+9पिछले 7 दिनों में स्टार का बदलाव - #8★ 7,952+44पिछले 7 दिनों में स्टार का बदलाव
- #9
Mooncake, Kimi के लिए सर्विंग प्लेटफ़ॉर्म है, जो Moonshot AI द्वारा प्रदान की जाने वाली एक अग्रणी LLM सेवा है।
★ 6,470+40पिछले 7 दिनों में स्टार का बदलाव - #10
Kubernetes पर स्केलेबल, मल्टी-फ़्रेमवर्क तैनाती के लिए मानकीकृत वितरित जनरेटिव और प्रेडिक्टिव AI इन्फेरेंस प्लेटफ़ॉर्म
★ 5,853+13पिछले 7 दिनों में स्टार का बदलाव - #11★ 5,678+4पिछले 7 दिनों में स्टार का बदलाव
- #12
हाई-परफॉरमेंस AI मॉडल सर्विंग (vLLM, SGLang) और ऑन-डिमांड SSH-एक्सेसिबल GPU इंस्टेंस के लिए एक GPU क्लस्टर मैनेजर।
★ 5,593+21पिछले 7 दिनों में स्टार का बदलाव - #13
किसी भी स्थानीय OpenAI/Anthropic संगत सर्वर - llama.cpp, vllm, आदि के लिए विश्वसनीय मॉडल स्वैपिंग
★ 5,562+49पिछले 7 दिनों में स्टार का बदलाव - #14
विविध LLM अनुमान के लिए एक प्रोग्रामेबल मिक्सचर-ऑफ-मॉडल्स राउटर
★ 5,506+101पिछले 7 दिनों में स्टार का बदलाव - #15
📚 कोड के साथ बेहतरीन LLM/VLM इन्फेरेंस पेपर्स की क्यूरेटेड सूची: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, आदि।🎉
★ 5,482+3पिछले 7 दिनों में स्टार का बदलाव - #16
ML, LLM और Vision LLM के साथ संरचित डेटा निष्कर्षण, निर्देश कॉलिंग और एजेंटिक वर्कफ़्लो
★ 5,214+7पिछले 7 दिनों में स्टार का बदलाव - #17
सिस्टम इंजीनियरों के लिए Apple Silicon पर LLM इनफॉरेंस सिस्टम सीखें: एक छोटा vLLM + Qwen बनाएं।
★ 4,537+8पिछले 7 दिनों में स्टार का बदलाव - #18
AI एजेंटों के लिए कैस्केडिंग रनटाइम। एजेंट लूप के भीतर लागत, विलंबता, गुणवत्ता और नीति निर्णयों को अनुकूलित करें।
★ 3,970-9पिछले 7 दिनों में स्टार का बदलाव - #19
PaddlePaddle पर आधारित LLM और VLM के लिए उच्च-प्रदर्शन अनुमान और तैनाती टूलकिट
★ 3,714+3पिछले 7 दिनों में स्टार का बदलाव - #20
RamaLama एक ओपन-सोर्स डेवलपर टूल है जो किसी भी स्रोत से AI मॉडल की स्थानीय सर्विसिंग को सरल बनाता है और कंटेनरों की परिचित भाषा के माध्यम से उत्पादन में अनुमान के लिए उनके उपयोग को सुविधाजनक बनाता है।
★ 3,031+6पिछले 7 दिनों में स्टार का बदलाव - #21
Ascend पर vLLM के लिए सामुदायिक-रखरखाव वाला हार्डवेयर प्लगइन
★ 2,749+19पिछले 7 दिनों में स्टार का बदलाव - #22
VLLM, Sglang, llama.cpp, exllamav3 के लिए कंट्रोल पैनल
★ 1,749+7पिछले 7 दिनों में स्टार का बदलाव - #23
ओपन सोर्स निरंतर अनुमान बेंचमार्क अनुसंधान प्लेटफ़ॉर्म — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 और जल्द ही™ TPUv6e/v7/Trainium2/3
★ 1,613+33पिछले 7 दिनों में स्टार का बदलाव - #24
उच्च-सटीकता वाले लो-बिट LLM अनुमान के लिए एक SOTA परिमाणीकरण एल्गोरिदम, जिसे CPU/XPU/CUDA के लिए सहज रूप से अनुकूलित किया गया है, मल्टी-डेटाटाइप समर्थन और vLLM, SGLang, और Transformers के साथ पूर्ण संगतता के साथ।
★ 1,599+8पिछले 7 दिनों में स्टार का बदलाव - #25
Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।
★ 1,557+6पिछले 7 दिनों में स्टार का बदलाव - #26★ 1,275+130पिछले 7 दिनों में स्टार का बदलाव
- #27
Kubernetes के लिए AI Inference Operator। प्रोडक्शन में ML मॉडल को सर्व करने का सबसे आसान तरीका। VLM, LLM, एम्बेडिंग और स्पीच-टू-टेक्स्ट का समर्थन करता है।
★ 1,256+2पिछले 7 दिनों में स्टार का बदलाव - #28
Nvidia, AMD, Intel GPU और Intel/AMD/Apple CPU के लिए HF, vLLM और SGLang के माध्यम से HW एक्सीलरेशन समर्थन के साथ LLM मॉडल क्वांटाइजेशन (कंप्रेशन) टूलकिट।
★ 1,248+0पिछले 7 दिनों में स्टार का बदलाव - #29
🔒 एंटरप्राइज-ग्रेड API गेटवे जो आपको प्रति API कुंजी लागत या दर सीमा की निगरानी और लागू करने में मदद करता है। प्रति उपयोगकर्ता, एप्लिकेशन या वातावरण में बारीक पहुंच नियंत्रण और निगरानी प्राप्त करें। OpenAI, Azure OpenAI, Anthropic, vLLM, और ओपन-सोर्स LLM का समर्थन करता है।
★ 1,228-1पिछले 7 दिनों में स्टार का बदलाव - #30
vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क
★ 1,197+316पिछले 7 दिनों में स्टार का बदलाव