मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · vllm

vllm

vllm टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
52
कुल स्टार
1,95,358
औसत स्टार
3,757
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर vllm के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और vllm टैग वाली रिपॉजिटरी।

  • vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क

    1,197
  • LLM इन्फरेंस सर्विंग और ऑप्टिमाइज़ेशन के लिए 10-सप्ताह, 30-मिनट-प्रति-दिन का रोडमैप। vLLM, SGLang, क्वांटाइज़ेशन, स्पेक्युलेटिव डिकोडिंग, बेंचमार्किंग।

    881
  • kaggle-tpu-lab@ARahim3

    Qwen3.8-27B (bf16) on a free Kaggle TPU: OpenAI-compatible endpoint, 262k context, ~130 tok/s, works with Claude Code, Codex, Opencode and Pi.

    146
  • FunASR@modelscope

    ट्रेनिंग, इन्फरेंस, स्ट्रीमिंग ASR, VAD, पंक्चुएशन, स्पीकर डायराइजेशन पाइपलाइन्स और OpenAI-संगत/MCP सर्विंग के लिए ओपन-सोर्स स्पीच रिकग्निशन टूलकिट।

    20,136+64पिछले 7 दिनों में स्टार का बदलाव
  • llama-cookbook@meta-llama

    Llama Cookbook में आपका स्वागत है! Llama के साथ निर्माण करने के लिए यह आपकी पसंदीदा मार्गदर्शिका है: इन्फेरेंस, फाइन-ट्यूनिंग, RAG के साथ शुरुआत करना। हम यह भी दिखाते हैं कि Llama मॉडल परिवार का उपयोग करके एंड-टू-एंड समस्याओं को कैसे हल किया जाए और विभिन्न प्रदाता सेवाओं पर उनका उपयोग कैसे किया जाए

    18,556-3पिछले 7 दिनों में स्टार का बदलाव
  • ✍🏻 सोर्स कोड डीप डाइव, सिस्टम डिज़ाइन और इंजीनियरिंग ब्लॉग्स | Halfrost-Field: सोर्स कोड विश्लेषण, सिस्टम डिज़ाइन और इंजीनियरिंग अभ्यास नोट्स

    13,226+6पिछले 7 दिनों में स्टार का बदलाव
  • AI-Research-SKILLs@Orchestra-Research

    किसी भी AI मॉडल के लिए AI अनुसंधान और इंजीनियरिंग कौशल की व्यापक ओपन-सोर्स लाइब्रेरी। कौशल को पैकेज करें और आपका claude code/codex/gemini एजेंट पूर्ण क्षमता के साथ एक AI अनुसंधान एजेंट बन जाएगा। Orchestra Research द्वारा अनुरक्षित।

    12,256+104पिछले 7 दिनों में स्टार का बदलाव
  • LMCache@LMCache

    LMCache: सबसे तेज़ KV कैशे लेयर के साथ अपने LLM को सुपरचार्ज करें

    11,622+60पिछले 7 दिनों में स्टार का बदलाव
  • OpenRLHF@OpenRLHF

    Ray पर आधारित एक उपयोग में आसान, स्केलेबल और उच्च-प्रदर्शन वाला एजेंटिक RL फ्रेमवर्क (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray और Async RL)

    9,969+9पिछले 7 दिनों में स्टार का बदलाव
  • inference@xorbitsai

    कोड की एक ही लाइन बदलकर किसी भी LLM के लिए GPT को स्वैप करें। Xinference आपको क्लाउड, ऑन-प्रिमाइस या अपने लैपटॉप पर ओपन-सोर्स, स्पीच और मल्टीमॉडल मॉडल चलाने की अनुमति देता है — यह सब एक एकीकृत, प्रोडक्शन-रेडी इन्फेरेंस API के माध्यम से।

    9,537+9पिछले 7 दिनों में स्टार का बदलाव
  • dynamo@ai-dynamo

    एक डेटासेंटर स्केल डिस्ट्रिब्यूटेड इन्फेरेंस सर्विंग फ़्रेमवर्क

    7,952+44पिछले 7 दिनों में स्टार का बदलाव
  • Mooncake@kvcache-ai

    Mooncake, Kimi के लिए सर्विंग प्लेटफ़ॉर्म है, जो Moonshot AI द्वारा प्रदान की जाने वाली एक अग्रणी LLM सेवा है।

    6,470+40पिछले 7 दिनों में स्टार का बदलाव
  • kserve@kserve

    Kubernetes पर स्केलेबल, मल्टी-फ़्रेमवर्क तैनाती के लिए मानकीकृत वितरित जनरेटिव और प्रेडिक्टिव AI इन्फेरेंस प्लेटफ़ॉर्म

    5,853+13पिछले 7 दिनों में स्टार का बदलाव
  • UltraRAG@OpenBMB

    जटिल और अभिनव RAG पाइपलाइनों के निर्माण के लिए एक लो-कोड MCP फ्रेमवर्क

    5,678+4पिछले 7 दिनों में स्टार का बदलाव
  • gpustack@gpustack

    हाई-परफॉरमेंस AI मॉडल सर्विंग (vLLM, SGLang) और ऑन-डिमांड SSH-एक्सेसिबल GPU इंस्टेंस के लिए एक GPU क्लस्टर मैनेजर।

    5,593+21पिछले 7 दिनों में स्टार का बदलाव
  • llama-swap@mostlygeek

    किसी भी स्थानीय OpenAI/Anthropic संगत सर्वर - llama.cpp, vllm, आदि के लिए विश्वसनीय मॉडल स्वैपिंग

    5,562+49पिछले 7 दिनों में स्टार का बदलाव
  • semantic-router@vllm-project

    विविध LLM अनुमान के लिए एक प्रोग्रामेबल मिक्सचर-ऑफ-मॉडल्स राउटर

    5,506+101पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-LLM-Inference@xlite-dev

    📚 कोड के साथ बेहतरीन LLM/VLM इन्फेरेंस पेपर्स की क्यूरेटेड सूची: Flash-Attention, Paged-Attention, WINT8/4, Parallelism, आदि।🎉

    5,482+3पिछले 7 दिनों में स्टार का बदलाव
  • sparrow@katanaml

    ML, LLM और Vision LLM के साथ संरचित डेटा निष्कर्षण, निर्देश कॉलिंग और एजेंटिक वर्कफ़्लो

    5,214+7पिछले 7 दिनों में स्टार का बदलाव
  • tiny-llm@skyzh

    सिस्टम इंजीनियरों के लिए Apple Silicon पर LLM इनफॉरेंस सिस्टम सीखें: एक छोटा vLLM + Qwen बनाएं।

    4,537+8पिछले 7 दिनों में स्टार का बदलाव
  • cascadeflow@lemony-ai

    AI एजेंटों के लिए कैस्केडिंग रनटाइम। एजेंट लूप के भीतर लागत, विलंबता, गुणवत्ता और नीति निर्णयों को अनुकूलित करें।

    3,970-9पिछले 7 दिनों में स्टार का बदलाव
  • FastDeploy@PaddlePaddle

    PaddlePaddle पर आधारित LLM और VLM के लिए उच्च-प्रदर्शन अनुमान और तैनाती टूलकिट

    3,714+3पिछले 7 दिनों में स्टार का बदलाव
  • ramalama@containers

    RamaLama एक ओपन-सोर्स डेवलपर टूल है जो किसी भी स्रोत से AI मॉडल की स्थानीय सर्विसिंग को सरल बनाता है और कंटेनरों की परिचित भाषा के माध्यम से उत्पादन में अनुमान के लिए उनके उपयोग को सुविधाजनक बनाता है।

    3,031+6पिछले 7 दिनों में स्टार का बदलाव
  • vllm-ascend@vllm-project

    Ascend पर vLLM के लिए सामुदायिक-रखरखाव वाला हार्डवेयर प्लगइन

    2,749+19पिछले 7 दिनों में स्टार का बदलाव
  • local-studio@sybil-solutions

    VLLM, Sglang, llama.cpp, exllamav3 के लिए कंट्रोल पैनल

    1,749+7पिछले 7 दिनों में स्टार का बदलाव
  • InferenceX@SemiAnalysisAI

    ओपन सोर्स निरंतर अनुमान बेंचमार्क अनुसंधान प्लेटफ़ॉर्म — Kimi K3 2.8T, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 और जल्द ही™ TPUv6e/v7/Trainium2/3

    1,613+33पिछले 7 दिनों में स्टार का बदलाव
  • auto-round@intel

    उच्च-सटीकता वाले लो-बिट LLM अनुमान के लिए एक SOTA परिमाणीकरण एल्गोरिदम, जिसे CPU/XPU/CUDA के लिए सहज रूप से अनुकूलित किया गया है, मल्टी-डेटाटाइप समर्थन और vLLM, SGLang, और Transformers के साथ पूर्ण संगतता के साथ।

    1,599+8पिछले 7 दिनों में स्टार का बदलाव
  • vllm-mlx@waybarrios

    Apple Silicon के लिए हाई-परफॉरमेंस OpenAI और Anthropic संगत LLM इन्फेरेंस सर्वर। नेटिव MLX, निरंतर बैचिंग, मल्टीमॉडल मॉडल, MCP टूल कॉलिंग, और Claude Code समर्थन।

    1,557+6पिछले 7 दिनों में स्टार का बदलाव
  • kvcached@ovg-project

    डायनेमिक GPU शेयरिंग और उससे आगे के लिए वर्चुअलाइज्ड इलास्टिक KV कैश

    1,275+130पिछले 7 दिनों में स्टार का बदलाव
  • kubeai@kubeai-project

    Kubernetes के लिए AI Inference Operator। प्रोडक्शन में ML मॉडल को सर्व करने का सबसे आसान तरीका। VLM, LLM, एम्बेडिंग और स्पीच-टू-टेक्स्ट का समर्थन करता है।

    1,256+2पिछले 7 दिनों में स्टार का बदलाव
  • GPTQModel@ModelCloud

    Nvidia, AMD, Intel GPU और Intel/AMD/Apple CPU के लिए HF, vLLM और SGLang के माध्यम से HW एक्सीलरेशन समर्थन के साथ LLM मॉडल क्वांटाइजेशन (कंप्रेशन) टूलकिट।

    1,248+0पिछले 7 दिनों में स्टार का बदलाव
  • BricksLLM@bricks-cloud

    🔒 एंटरप्राइज-ग्रेड API गेटवे जो आपको प्रति API कुंजी लागत या दर सीमा की निगरानी और लागू करने में मदद करता है। प्रति उपयोगकर्ता, एप्लिकेशन या वातावरण में बारीक पहुंच नियंत्रण और निगरानी प्राप्त करें। OpenAI, Azure OpenAI, Anthropic, vLLM, और ओपन-सोर्स LLM का समर्थन करता है।

    1,228-1पिछले 7 दिनों में स्टार का बदलाव
  • vLLM के साथ सिंगल RTX 3090 पर Qwen3.8-27B: 64 समवर्ती पर ~1,000 tok/s (int8 tensor-core GEMMs, fp16 DeltaNet state), डिफ़ॉल्ट सैंपलिंग पर ~114 tok/s सिंगल-यूज़र / ~124 ग्रीडी (MTP ड्राफ्ट, own-output draft vocab, कैलिब्रेटेड int4 lm_head, split-KV verify attention), 150k-262k संदर्भ; पैच, रीक्वांट स्क्रिप्ट, बेंचमार्क

    1,197+316पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस