rl
rl टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर rl के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और rl टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
Llama चीनी समुदाय, नवीनतम Llama अध्ययन सामग्री का वास्तविक समय में संकलन, सर्वश्रेष्ठ चीनी Llama बड़े मॉडल ओपन-सोर्स इकोसिस्टम का निर्माण, पूरी तरह से ओपन-सोर्स और व्यावसायिक उपयोग के लिए उपलब्ध
★ 14,743+3पिछले 7 दिनों में स्टार का बदलाव - #2★ 10,955+10पिछले 7 दिनों में स्टार का बदलाव
- #3
Dopamine रीइन्फोर्समेंट लर्निंग एल्गोरिदम की तेज़ प्रोटोटाइपिंग के लिए एक रिसर्च फ्रेमवर्क है
★ 10,909+8पिछले 7 दिनों में स्टार का बदलाव - #4
Agent Reinforcement Trainer: GRPO का उपयोग करके वास्तविक दुनिया के कार्यों के लिए मल्टी-स्टेप एजेंटों को प्रशिक्षित करें। अपने एजेंटों को ऑन-द-जॉब ट्रेनिंग दें। Qwen3.6, GPT-OSS, Llama और अन्य के लिए रीइन्फोर्समेंट लर्निंग।
★ 10,689+10पिछले 7 दिनों में स्टार का बदलाव - #5★ 5,712+9पिछले 7 दिनों में स्टार का बदलाव
- #6★ 5,141+5पिछले 7 दिनों में स्टार का बदलाव
- #7
🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।
★ 4,199+54पिछले 7 दिनों में स्टार का बदलाव - #8
agent-sandbox अलग-थलग, स्टेटफुल, सिंगलटन वर्कलोड के आसान प्रबंधन को सक्षम बनाता है, जो AI एजेंट रनटाइम और सुदृढीकरण सीखने (RL) जैसे उपयोग के मामलों के लिए आदर्श है।
★ 3,719+41पिछले 7 दिनों में स्टार का बदलाव - #9
गोमोकू (जिसे गोबांग या फाइव इन ए रो भी कहा जाता है) के लिए AlphaZero एल्गोरिदम का एक कार्यान्वयन।
★ 3,627+2पिछले 7 दिनों में स्टार का बदलाव - #10
रिइंफोर्समेंट लर्निंग के लिए एक मॉड्यूलर, प्रिमिटिव-फर्स्ट, पाइथन-फर्स्ट PyTorch लाइब्रेरी।
★ 3,545+5पिछले 7 दिनों में स्टार का बदलाव - #11
हाइपरपैरामीटर ऑप्टिमाइज़ेशन और प्री-ट्रेन किए गए एजेंटों के साथ Stable Baselines3 रीइंफोर्समेंट लर्निंग एजेंटों के लिए एक ट्रेनिंग फ्रेमवर्क।
★ 2,873+1पिछले 7 दिनों में स्टार का बदलाव - #12
100 लाइनों के कोड में पेपर का कार्यान्वयन।
★ 2,870+3पिछले 7 दिनों में स्टार का बदलाव - #13
MuZero
★ 2,865+2पिछले 7 दिनों में स्टार का बदलाव - #14
लार्ज रीजनिंग मॉडल के लिए सुदृढीकरण शिक्षण (Reinforcement Learning) का एक सर्वेक्षण
★ 2,483+1पिछले 7 दिनों में स्टार का बदलाव - #15
सरल तरीके से सभी RL एल्गोरिदम का कार्यान्वयन
★ 1,929+7पिछले 7 दिनों में स्टार का बदलाव - #16★ 1,871-1पिछले 7 दिनों में स्टार का बदलाव
- #17
[ICLR 2026] SimpleVLA-RL: सुदृढीकरण शिक्षण (Reinforcement Learning) के माध्यम से VLA प्रशिक्षण को मापना
★ 1,844+6पिछले 7 दिनों में स्टार का बदलाव - #18
System-2 रीज़निंग पर नवीनतम प्रगति
★ 1,353+0पिछले 7 दिनों में स्टार का बदलाव - #19
🎓 व्यवस्थित बड़े भाषा मॉडल निर्माण पाठ्यक्रम|🛠️ प्री-ट्रेनिंग डेटा इंजीनियरिंग, Tokenizer, Transformer, MoE, GPU प्रोग्रामिंग (CUDA/Triton), वितरित प्रशिक्षण, स्केलिंग नियम, अनुमान अनुकूलन और संरेखण (SFT/RLHF/GRPO) को कवर करता है|🚀 6 प्रगतिशील असाइनमेंट + कोड-संचालित, LLM फुल-स्टैक कॉग्निशन सिस्टम स्थापित करता है
★ 1,276+19पिछले 7 दिनों में स्टार का बदलाव - #20
R1-Zero-Like ट्रेनिंग को समझना: एक आलोचनात्मक दृष्टिकोण
★ 1,274+0पिछले 7 दिनों में स्टार का बदलाव - #21★ 1,122+2पिछले 7 दिनों में स्टार का बदलाव
- #22★ 1,116+5पिछले 7 दिनों में स्टार का बदलाव
- #23★ 1,092+13पिछले 7 दिनों में स्टार का बदलाव
- #24
एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।
★ 1,060+2पिछले 7 दिनों में स्टार का बदलाव - #25
Tensorlake सैंडबॉक्स और बैकग्राउंड एजेंटिक एप्लिकेशन को डिप्लॉय करने के लिए एक सर्वरलेस रनटाइम है
★ 995+2पिछले 7 दिनों में स्टार का बदलाव - #26
AI-नेटिव रिस्क इंटेलिजेंस सिस्टम, OpenDeRisk—आपका एप्लिकेशन सिस्टम रिस्क इंटेलिजेंट मैनेजर जो 7*24 घंटे व्यापक और गहन सुरक्षा प्रदान करता है।
★ 971+3पिछले 7 दिनों में स्टार का बदलाव - #27
रीइंफोर्समेंट लर्निंग के लिए Python लाइब्रेरी।
★ 944+0पिछले 7 दिनों में स्टार का बदलाव - #28
“AI-Compass” समुदाय को AI तकनीक के महासागर में नेविगेट करने के लिए मार्गदर्शन प्रदान करेगा, चाहे आप शुरुआती हों या उन्नत डेवलपर, आप यहाँ AI के सभी क्षेत्रों के लिए मार्ग पा सकते हैं। इसका उद्देश्य डेवलपर्स को AI की मुख्य अवधारणाओं, मुख्यधारा की तकनीकों और अत्याधुनिक रुझानों को व्यवस्थित रूप से समझने में मदद करना है, और अभ्यास के माध्यम से सिद्धांत से कार्यान्वयन तक की प्रक्रिया में महारत हासिल करना है।
★ 935+10पिछले 7 दिनों में स्टार का बदलाव - #29
सिम-टू-रियल और RL के लिए 3D-प्रिंटेड ओपन-सोर्स ह्यूमेनॉइड रोबोट प्लेटफॉर्म
★ 822+3पिछले 7 दिनों में स्टार का बदलाव - #30
लार्ज लैंग्वेज मॉडल्स के ऑन-पॉलिसी डिस्टिलेशन (OPD) के लिए पेपर्स, तकनीकी रिपोर्ट्स, फ्रेमवर्क्स और टूल्स का एक क्यूरेटेड संग्रह
★ 794+31पिछले 7 दिनों में स्टार का बदलाव