reinforcement-learning
reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #91
🤖 मशीन लर्निंग समर स्कूल गाइड
★ 3,033+3पिछले 7 दिनों में स्टार का बदलाव - #92
TF-Agents: Contextual Bandits और Reinforcement Learning के लिए एक विश्वसनीय, स्केलेबल और उपयोग में आसान TensorFlow लाइब्रेरी।
★ 3,026+0पिछले 7 दिनों में स्टार का बदलाव - #93
डीप लर्निंग और डीप रीइंफोर्समेंट लर्निंग शोध पत्र और कुछ कोड
★ 3,026+2पिछले 7 दिनों में स्टार का बदलाव - #94★ 2,960+82पिछले 7 दिनों में स्टार का बदलाव
- #95
भौतिक AI शोध और संपर्क-समृद्ध वातावरण में तैनाती के लिए पूरी तरह से ओपन-सोर्स ह्यूमनॉइड आर्म।
★ 2,919+23पिछले 7 दिनों में स्टार का बदलाव - #96
हाइपरपैरामीटर ऑप्टिमाइज़ेशन और प्री-ट्रेन किए गए एजेंटों के साथ Stable Baselines3 रीइंफोर्समेंट लर्निंग एजेंटों के लिए एक ट्रेनिंग फ्रेमवर्क।
★ 2,873+1पिछले 7 दिनों में स्टार का बदलाव - #97
100 लाइनों के कोड में पेपर का कार्यान्वयन।
★ 2,870+3पिछले 7 दिनों में स्टार का बदलाव - #98
MuZero
★ 2,865+2पिछले 7 दिनों में स्टार का बदलाव - #99
TensorFlow में सरल और व्यापक ट्यूटोरियल
★ 2,841+0पिछले 7 दिनों में स्टार का बदलाव - #100
आर्टिफिशियल इंटेलिजेंस को लोकलाइज करने और अधिक मूल्यांकित Y Combinator स्टार्टअप्स के लिए मुफ्त, ओपन-सोर्स विकल्प प्रदान करने के लिए डिज़ाइन किए गए एंटरप्राइज़-ग्रेड AI एजेंटों की एक लाइब्रेरी।
★ 2,806+7पिछले 7 दिनों में स्टार का बदलाव - #101
LLM एजेंटों के लिए एजेंट RL फ्रेमवर्क: StarPO और रीजनिंग-कोलैप्स डायग्नोस्टिक्स के साथ मल्टी-टर्न सुदृढीकरण शिक्षण (reinforcement learning)
★ 2,786+6पिछले 7 दिनों में स्टार का बदलाव - #102★ 2,657+3पिछले 7 दिनों में स्टार का बदलाव
- #103
PPO x Family DRL ट्यूटोरियल कोर्स (निर्णय इंटेलिजेंस शुरुआती स्तर का सार्वजनिक कोर्स: एल्गोरिदम सिद्धांत को समझने, कोड लॉजिक को व्यवस्थित करने और निर्णय AI अनुप्रयोगों का अभ्यास करने में आपकी मदद करने के लिए 8 कक्षाएं)
★ 2,616+2पिछले 7 दिनों में स्टार का बदलाव - #104
औद्योगिक सर्च, रिकमेंडेशन और एडवरटाइजमेंट के लिए ऑसम डीप लर्निंग पेपर्स। ये एम्बेडिंग, मैचिंग, प्री-रैंकिंग, रैंकिंग, पोस्ट रैंकिंग, प्रासंगिकता, LLM और RL पर ध्यान केंद्रित करते हैं।
★ 2,589+0पिछले 7 दिनों में स्टार का बदलाव - #105
robosuite: रोबोट लर्निंग के लिए एक मॉड्यूलर सिमुलेशन फ्रेमवर्क और बेंचमार्क
★ 2,586+4पिछले 7 दिनों में स्टार का बदलाव - #106
शानदार रीज़निंग LLM ट्यूटोरियल/सर्वेक्षण/गाइड
★ 2,533+6पिछले 7 दिनों में स्टार का बदलाव - #107
Reinforcement Learning, An Introduction के समाधान
★ 2,433+3पिछले 7 दिनों में स्टार का बदलाव - #108★ 2,395+1पिछले 7 दिनों में स्टार का बदलाव
- #109
सबसे सरल, लचीला और व्यापक OpenAI Gym ट्रेडिंग वातावरण (OpenAI Gym द्वारा स्वीकृत)
★ 2,387+0पिछले 7 दिनों में स्टार का बदलाव - #110
PyTorch में क्लिप्ड ऑब्जेक्टिव Proximal Policy Optimization (PPO) का न्यूनतम कार्यान्वयन
★ 2,381+6पिछले 7 दिनों में स्टार का बदलाव - #111
ProtoMotions भौतिक रूप से सिमुलेटेड डिजिटल इंसानों और ह्यूमैनॉइड रोबोटों को प्रशिक्षित करने के लिए एक GPU-त्वरित सिमुलेशन और लर्निंग फ्रेमवर्क है।
★ 2,359+10पिछले 7 दिनों में स्टार का बदलाव - #112
ICCV2019 - मॉडल-आधारित डीप रिइंफोर्समेंट लर्निंग के साथ पेंट करना सीखना
★ 2,308+2पिछले 7 दिनों में स्टार का बदलाव - #113★ 2,293+0पिछले 7 दिनों में स्टार का बदलाव
- #114★ 2,280+15पिछले 7 दिनों में स्टार का बदलाव
- #115
verl-agent, veRL का एक विस्तार है, जिसे RL के माध्यम से LLM/VLM एजेंट्स को प्रशिक्षित करने के लिए डिज़ाइन किया गया है।
★ 2,274+17पिछले 7 दिनों में स्टार का बदलाव - #116
सिफ़ारिश (Recommendation), विज्ञापन (Advertising) और खोज (Search) के क्षेत्र में उद्योग के क्लासिक और अत्याधुनिक शोध पत्रों का संग्रह।
★ 2,188-1पिछले 7 दिनों में स्टार का बदलाव - #117
क्वाडकोप्टर नियंत्रण के सिंगल और मल्टी-एजेंट रीइंफोर्समेंट लर्निंग के लिए PyBullet Gymnasium वातावरण
★ 2,119-2पिछले 7 दिनों में स्टार का बदलाव - #118
[RSS 2025] "ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills"
★ 2,107+3पिछले 7 दिनों में स्टार का बदलाव - #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) एक रीइन्फोर्समेंट लर्निंग एजेंट है जिसे डिफ्यूजन वर्ल्ड मॉडल में प्रशिक्षित किया गया है। NeurIPS 2024 Spotlight।
★ 2,100+1पिछले 7 दिनों में स्टार का बदलाव - #120★ 2,065+0पिछले 7 दिनों में स्टार का बदलाव