rl
rl टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
MobileGym: मोबाइल GUI एजेंट अनुसंधान के लिए एक सत्यापन योग्य और अत्यधिक समानांतर सिमुलेशन प्लेटफॉर्म · ब्राउज़र-होस्टेड Android सिम्युलेटर · सत्यापन योग्य मूल्यांकन · स्केलेबल ऑनलाइन RL प्रशिक्षण
★ 786+10पिछले 7 दिनों में स्टार का बदलाव - #32
Stable-Baselines3 के लिए कॉन्ट्रिब पैकेज - प्रयोगात्मक रीइन्फोर्समेंट लर्निंग (RL) कोड
★ 736+5पिछले 7 दिनों में स्टार का बदलाव - #33
इम्प्लीमेंटेशन के साथ मोंटे कार्लो ट्री सर्च पेपर्स की एक क्यूरेटेड सूची
★ 715+1पिछले 7 दिनों में स्टार का बदलाव - #34
वास्तविक पैनोरमिक छवियों से सुदृढीकरण सीखने (Reinforcement Learning) के लिए AI रिसर्च प्लेटफ़ॉर्म।
★ 713+1पिछले 7 दिनों में स्टार का बदलाव - #35
DR Tulu के लिए आधिकारिक रिपॉजिटरी: डीप रिसर्च के लिए इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग
★ 704+4पिछले 7 दिनों में स्टार का बदलाव - #36
Python/Tensorflow में Inverse Reinforcement Learning (IRL) एल्गोरिदम का कार्यान्वयन। Deep MaxEnt, MaxEnt, LPIRL
★ 681+2पिछले 7 दिनों में स्टार का बदलाव - #37
C++ और कुछ रिइंफोर्समेंट लर्निंग का उपयोग करके बनाया गया Hearthstone सिम्युलेटर
★ 680+1पिछले 7 दिनों में स्टार का बदलाव - #38
BenchMARL मल्टी-एजेंट रीइंफोर्समेंट लर्निंग (MARL) की बेंचमार्किंग के लिए एक लाइब्रेरी है। BenchMARL इसकी दो मुख्य अवधारणाओं: पुनरुत्पादकता और मानकीकरण पर व्यवस्थित रूप से आधारित रहते हुए विभिन्न MARL एल्गोरिदम, कार्यों और मॉडलों की तुरंत तुलना करने की अनुमति देता है।
★ 656+2पिछले 7 दिनों में स्टार का बदलाव - #39
Long Chain-of-Thought रीजनिंग पर नवीनतम प्रगति।
★ 647-1पिछले 7 दिनों में स्टार का बदलाव - #40
[NeurIPS 2022] 🛒WebShop: ग्राउंडेड लैंग्वेज एजेंटों के साथ स्केलेबल वास्तविक दुनिया वेब इंटरैक्शन की दिशा में
★ 590+3पिछले 7 दिनों में स्टार का बदलाव - #41
Quadruped रोबोट के लिए ROS2-Control कार्यान्वयन, जिसमें sim2real शामिल है।
★ 567+4पिछले 7 दिनों में स्टार का बदलाव - #42
Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।
★ 551+4पिछले 7 दिनों में स्टार का बदलाव - #43
मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम का कार्यान्वयन।
★ 533+1पिछले 7 दिनों में स्टार का बदलाव - #44
DeepThinkVLA: विजन-लैंग्वेज-एक्शन मॉडल की तर्क क्षमता को बढ़ाना
★ 528+0पिछले 7 दिनों में स्टार का बदलाव - #45★ 506+1पिछले 7 दिनों में स्टार का बदलाव
- #46
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 502—पिछले 7 दिनों में स्टार का बदलाव