मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · rl

rl

rl टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

46 रिपॉजिटरी
  • mobilegym@Purewhiter

    MobileGym: मोबाइल GUI एजेंट अनुसंधान के लिए एक सत्यापन योग्य और अत्यधिक समानांतर सिमुलेशन प्लेटफॉर्म · ब्राउज़र-होस्टेड Android सिम्युलेटर · सत्यापन योग्य मूल्यांकन · स्केलेबल ऑनलाइन RL प्रशिक्षण

    786+10पिछले 7 दिनों में स्टार का बदलाव
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 के लिए कॉन्ट्रिब पैकेज - प्रयोगात्मक रीइन्फोर्समेंट लर्निंग (RL) कोड

    736+5पिछले 7 दिनों में स्टार का बदलाव
  • इम्प्लीमेंटेशन के साथ मोंटे कार्लो ट्री सर्च पेपर्स की एक क्यूरेटेड सूची

    715+1पिछले 7 दिनों में स्टार का बदलाव
  • Matterport3DSimulator@peteanderson80

    वास्तविक पैनोरमिक छवियों से सुदृढीकरण सीखने (Reinforcement Learning) के लिए AI रिसर्च प्लेटफ़ॉर्म।

    713+1पिछले 7 दिनों में स्टार का बदलाव
  • dr-tulu@rlresearch

    DR Tulu के लिए आधिकारिक रिपॉजिटरी: डीप रिसर्च के लिए इवॉल्विंग रूब्रिक्स के साथ रीइन्फोर्समेंट लर्निंग

    704+4पिछले 7 दिनों में स्टार का बदलाव
  • irl-imitation@yrlu

    Python/Tensorflow में Inverse Reinforcement Learning (IRL) एल्गोरिदम का कार्यान्वयन। Deep MaxEnt, MaxEnt, LPIRL

    681+2पिछले 7 दिनों में स्टार का बदलाव
  • RosettaStone@utilForever

    C++ और कुछ रिइंफोर्समेंट लर्निंग का उपयोग करके बनाया गया Hearthstone सिम्युलेटर

    680+1पिछले 7 दिनों में स्टार का बदलाव
  • BenchMARL@facebookresearch

    BenchMARL मल्टी-एजेंट रीइंफोर्समेंट लर्निंग (MARL) की बेंचमार्किंग के लिए एक लाइब्रेरी है। BenchMARL इसकी दो मुख्य अवधारणाओं: पुनरुत्पादकता और मानकीकरण पर व्यवस्थित रूप से आधारित रहते हुए विभिन्न MARL एल्गोरिदम, कार्यों और मॉडलों की तुरंत तुलना करने की अनुमति देता है।

    656+2पिछले 7 दिनों में स्टार का बदलाव
  • Long Chain-of-Thought रीजनिंग पर नवीनतम प्रगति।

    647-1पिछले 7 दिनों में स्टार का बदलाव
  • WebShop@princeton-nlp

    [NeurIPS 2022] 🛒WebShop: ग्राउंडेड लैंग्वेज एजेंटों के साथ स्केलेबल वास्तविक दुनिया वेब इंटरैक्शन की दिशा में

    590+3पिछले 7 दिनों में स्टार का बदलाव
  • Quadruped रोबोट के लिए ROS2-Control कार्यान्वयन, जिसमें sim2real शामिल है।

    567+4पिछले 7 दिनों में स्टार का बदलाव
  • Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।

    551+4पिछले 7 दिनों में स्टार का बदलाव
  • morl-baselines@LucasAlegre

    मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम का कार्यान्वयन।

    533+1पिछले 7 दिनों में स्टार का बदलाव
  • DeepThinkVLA@OpenBMB

    DeepThinkVLA: विजन-लैंग्वेज-एक्शन मॉडल की तर्क क्षमता को बढ़ाना

    528+0पिछले 7 दिनों में स्टार का बदलाव
  • gem@axon-rl

    Agentic LLMs के लिए एक Gym

    506+1पिछले 7 दिनों में स्टार का बदलाव
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    502पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस