llm-inference
llm-inference टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #61
शुद्ध Java में Llama 3+ इन्फरेंस
★ 816+0पिछले 7 दिनों में स्टार का बदलाव - #62
LeaderWorkerSet: पॉड्स के समूह को रेप्लिकेशन की एक इकाई के रूप में तैनात करने के लिए एक API
★ 810+5पिछले 7 दिनों में स्टार का बदलाव - #63LLM-PowerHouse-A-Curated-Guide-for-Large-Language-Models-with-Custom-Training-and-Inferencing↗@ghimiresunil
LLM-PowerHouse: क्यूरेटेड ट्यूटोरियल, सर्वोत्तम प्रथाओं और कस्टम प्रशिक्षण व अनुमान के लिए कोड के माध्यम से LLMs की क्षमता को अनलॉक करें।
★ 731+0पिछले 7 दिनों में स्टार का बदलाव - #64★ 707+0पिछले 7 दिनों में स्टार का बदलाव
- #65
USP: लॉन्ग कॉंटेक्स्ट ट्रांसफॉर्मर मॉडल ट्रेनिंग और इन्फेडरेंस के लिए यूनिफाइड (यानि हाइब्रिड, 2D) सीक्वेंस पैरेलल अटेंशन
★ 692+2पिछले 7 दिनों में स्टार का बदलाव - #66
Pure Rust + CUDA LLM इन्फरेंस इंजन — कोई PyTorch नहीं, OpenAI-compatible, Qwen3 से Kimi-K2 तक सर्व करता है
★ 678+9पिछले 7 दिनों में स्टार का बदलाव - #67★ 677+2पिछले 7 दिनों में स्टार का बदलाव
- #68
Apple Silicon पर 4 गुना तेज़ LLM डिकोडिंग, बिना किसी नुकसान के। DeepSeek के DSpark और z-lab के DFlash स्पेक्युलेटिव डिकोडिंग का नेटिव MLX पोर्ट — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, टर्नरी Bonsai-27B।
★ 645+15पिछले 7 दिनों में स्टार का बदलाव - #69
Official SGLang × Datawhale course on LLM inference (中英双语): understand inference, build a mini-sglang from scratch, then read the real SGLang source and land your first PR. 《从零手搓SGLang》:读懂推理,手搓 mini-sglang,吃透 SGLang 源码。
★ 633—पिछले 7 दिनों में स्टार का बदलाव - #70★ 613+20पिछले 7 दिनों में स्टार का बदलाव
- #71
Rockchip NPU के लिए Ollama का विकल्प: अनुकूलित NPU सपोर्ट (rkllm) के साथ Rockchip डिवाइस पर AI और डीप लर्निंग मॉडल चलाने के लिए एक कुशल समाधान
★ 602+6पिछले 7 दिनों में स्टार का बदलाव - #72
Yet Another Language Model: C++/CUDA में LLM अनुमान, I/O को छोड़कर कोई लाइब्रेरी नहीं
★ 596+0पिछले 7 दिनों में स्टार का बदलाव - #73
ओपन-सोर्स स्थानीय AI SDK - बिना क्लाउड, बिना API कुंजियों के डिवाइस पर AI चलाएं। GGUF, RAG, इमेज, म्यूजिक और वीडियो जनरेशन, स्पीच-टू-टेक्स्ट, P2P इन्फर्न्स और बहुत कुछ समर्थित है। क्रॉस-प्लेटफ़ॉर्म: Linux, macOS, Windows, Android, iOS।
★ 596+15पिछले 7 दिनों में स्टार का बदलाव - #74
AI असिस्टेंट के साथ न्यूनतम वेब-सर्चिंग प्लेटफ़ॉर्म जो सीधे आपके ब्राउज़र से चलता है।
★ 585-1पिछले 7 दिनों में स्टार का बदलाव - #75★ 582+0पिछले 7 दिनों में स्टार का बदलाव
- #76★ 581+5पिछले 7 दिनों में स्टार का बदलाव
- #77
LLM (लार्ज लैंग्वेज मॉडल) फाइन-ट्यूनिंग
★ 578+1पिछले 7 दिनों में स्टार का बदलाव - #78
कैंपस प्लेसमेंट, इंटर्नशिप के लिए एक बेहतरीन प्रोजेक्ट, जो आपको शून्य से LLama2/3 और Qwen2.5 का समर्थन करने वाला लार्ज मॉडल इन्फरेंस फ्रेमवर्क बनाना सिखाता है।
★ 573+0पिछले 7 दिनों में स्टार का बदलाव - #79★ 560+0पिछले 7 दिनों में स्टार का बदलाव
- #80
Self-hosted AI agent OS. Your memory, chat, agents, and files stay on hardware you own, offline by default, cloud by choice. Offline AI memory (taOSmd), self-hosted multi-framework group chat, a full web desktop + app store, and auto-clustering across the consumer hardware you already have (Orange/Raspberry Pi, Mac mini, gaming PC).
★ 522+13पिछले 7 दिनों में स्टार का बदलाव - #81
LLMs के लिए एक लो-लेटेंसी और हाई-थ्रूपुट सर्विंग इंजन
★ 521+1पिछले 7 दिनों में स्टार का बदलाव - #82
Krasis एक हाइब्रिड LLM रनटाइम है जो सीमित VRAM वाले उपभोक्ता-ग्रेड हार्डवेयर पर बड़े मॉडलों को कुशलतापूर्वक चलाने पर केंद्रित है
★ 519+3पिछले 7 दिनों में स्टार का बदलाव - #83
Open Model Engine (OME) — Kubernetes operator for LLM serving, GPU scheduling, and model lifecycle management. Works with SGLang, vLLM, TensorRT-LLM, and Triton
★ 508+3पिछले 7 दिनों में स्टार का बदलाव - #84★ 505-1पिछले 7 दिनों में स्टार का बदलाव