मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · reinforcement-learning

reinforcement-learning

reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

304 रिपॉजिटरी
  • ReCall@Agent-RL

    ReSearch: सुदृढीकरण शिक्षण के माध्यम से LLM के लिए खोज के साथ तर्क करना सीखना और ReCall: सुदृढीकरण शिक्षण के माध्यम से LLM के लिए टूल कॉल के साथ तर्क करना सीखना

    1,432+1पिछले 7 दिनों में स्टार का बदलाव
  • Julia में लिखे गए संक्षिप्त और सुंदर एल्गोरिदम

    1,426+0पिछले 7 दिनों में स्टार का बदलाव
  • अद्भुत मॉडल आधारित RL संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)

    1,393+0पिछले 7 दिनों में स्टार का बदलाव
  • rl_games@Denys88

    RL कार्यान्वयन

    1,385+2पिछले 7 दिनों में स्टार का बदलाव
  • OpenCat-Old@PetoiCamp

    STEM शिक्षा और AI-संवर्धित सेवाओं के लिए एक प्रोग्रामेबल और अत्यधिक पैंतरेबाज़ी करने वाली रोबोटिक बिल्ली।

    1,372+0पिछले 7 दिनों में स्टार का बदलाव
  • smac@oxwhirl

    SMAC: द स्टारक्राफ्ट मल्टी-एजेंट चैलेंज

    1,367+1पिछले 7 दिनों में स्टार का बदलाव
  • DRL-robot-navigation@reiniscimurs

    ROS Gazebo सिम्युलेटर में मोबाइल रोबोट नेविगेशन के लिए डीप रीइंफोर्समेंट लर्निंग। Twin Delayed Deep Deterministic Policy Gradient (TD3) न्यूरल नेटवर्क का उपयोग करके, एक रोबोट बाधाओं से बचते हुए simulated वातावरण में एक यादृच्छिक लक्ष्य बिंदु पर नेविगेट करना सीखता है।

    1,362+6पिछले 7 दिनों में स्टार का बदलाव
  • SLM-Lab@kengz

    PyTorch में मॉड्यूलर डीप रिइंफोर्समेंट लर्निंग फ्रेमवर्क। पुस्तक "फाउंडेशन ऑफ डीप रिइंफोर्समेंट लर्निंग" की सह-पुस्तकालय (कंपैनियन लाइब्रेरी)।

    1,362+0पिछले 7 दिनों में स्टार का बदलाव
  • Popular-RL-Algorithms@quantumiracle

    Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet का PyTorch कार्यान्वयन

    1,359+1पिछले 7 दिनों में स्टार का बदलाव
  • agent-apprenticeship@ray-r-ren

    एक जीवंत पारिस्थितिकी तंत्र जहाँ AI एजेंट वर्कफ़्लो लूप के माध्यम से कार्य पूरे करते हैं, पुनरावृत्ति निष्पादन के माध्यम से सुधार करते हैं, मेंटर एजेंटों या लूप में मनुष्यों द्वारा मूल्यांकित किए जाते हैं, और भविष्य के एजेंटों को बेहतर बनाने के लिए पूर्ण किए गए कार्य को पुन: प्रयोज्य कार्य अनुभव और डेटा में बदलते हैं।

    1,334+0पिछले 7 दिनों में स्टार का बदलाव
  • Keras में न्यूनतम Deep Q Learning (DQN और DDQN) कार्यान्वयन

    1,329+1पिछले 7 दिनों में स्टार का बदलाव
  • Minari@Farama-Foundation

    लोकप्रिय संदर्भ डेटासेट और संबंधित यूटिलिटीज के साथ ऑफ़लाइन सुदृढीकरण शिक्षण डेटासेट के लिए एक मानक प्रारूप

    1,294+3पिछले 7 दिनों में स्टार का बदलाव
  • Learning-Deep-Learning@patrick-llgc

    डीप लर्निंग और मशीन लर्निंग पर पेपर रीडिंग नोट्स।

    1,270+0पिछले 7 दिनों में स्टार का बदलाव
  • PPO-for-Beginners@ericyangyu

    एक सरल और अच्छी तरह से स्टाइल किया गया PPO कार्यान्वयन। मेरी Medium श्रृंखला पर आधारित: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,269+1पिछले 7 दिनों में स्टार का बदलाव
  • android_env@google-deepmind

    Android उपकरणों पर RL अनुसंधान।

    1,240+0पिछले 7 दिनों में स्टार का बदलाव
  • alphagen@ICT-FinD-Lab

    सुदृढीकरण सीखने (reinforcement learning) के माध्यम से फॉर्मूला अल्पा (पूर्वानुमानित) स्टॉक कारकों के सेट उत्पन्न करना।

    1,213+9पिछले 7 दिनों में स्टार का बदलाव
  • LearningHumanoidWalking@rohanpsingh

    रीइंफोर्समेंट लर्निंग का उपयोग करके लोकोमोशन के लिए ह्यूमनॉइड रोबोट को प्रशिक्षित करना

    1,210+3पिछले 7 दिनों में स्टार का बदलाव
  • पाडेरबर्न विश्वविद्यालय द्वारा आयोजित सुदृढीकरण शिक्षण पाठ्यक्रम के लिए समाधान और ऑनलाइन वीडियो सहित व्याख्यान नोट्स, ट्यूटोरियल कार्य।

    1,192+1पिछले 7 दिनों में स्टार का बदलाव
  • flow@flow-project

    ट्रैफिक कंट्रोल में रीइंफोर्समेंट लर्निंग के लिए कम्प्यूटेशनल फ्रेमवर्क

    1,188+0पिछले 7 दिनों में स्टार का बदलाव
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: मिक्स्ड ODE-SDE के साथ फ्लो-आधारित GRPO दक्षता को अनलॉक करना

    1,177+0पिछले 7 दिनों में स्टार का बदलाव
  • Gym@NVIDIA-NeMo

    एनवायरनमेंट का उपयोग करके मॉडल और एजेंटों का मूल्यांकन और सुधार करें

    1,155+13पिछले 7 दिनों में स्टार का बदलाव
  • SimplerEnv@simpler-env

    सामान्य सेटअप (जैसे, Google Robot, WidowX+Bridge) के तहत सिमुलेशन में वास्तविक दुनिया की रोबोट हेरफेर नीतियों (जैसे, RT-1, RT-1-X, Octo) का मूल्यांकन और पुनरुत्पादन (CoRL 2024)

    1,153+6पिछले 7 दिनों में स्टार का बदलाव
  • omnisafe@PKU-Alignment

    JMLR: OmniSafe, SafeRL अनुसंधान को गति देने के लिए एक इंफ्रास्ट्रक्चरल फ्रेमवर्क है।

    1,150+1पिछले 7 दिनों में स्टार का बदलाव
  • evotorch@nnaisense

    NNAISENSE में निर्मित, सीधे PyTorch के ऊपर बनाई गई एडवांस्ड इवोल्यूशनरी कंप्यूटेशन लाइब्रेरी।

    1,144+2पिछले 7 दिनों में स्टार का बदलाव
  • SMARTS@huawei-noah

    स्वायत्त ड्राइविंग के लिए स्केलेबल मल्टी-एजेंट RL ट्रेनिंग स्कूल

    1,134+0पिछले 7 दिनों में स्टार का बदलाव
  • मशीनों को सीखना सिखाएं ताकि आपको उन्हें प्रोग्राम करने के लिए संघर्ष न करना पड़े; अंतिम सूची

    1,128+0पिछले 7 दिनों में स्टार का बदलाव
  • ir-sim@hanruihua

    नेविगेशन, कंट्रोल और लर्निंग के लिए डिज़ाइन किया गया एक Python-आधारित हल्का रोबोट सिम्युलेटर।

    1,125+1पिछले 7 दिनों में स्टार का बदलाव
  • ASE@nv-tlabs

    भौतिक रूप से सिम्युलेटेड पात्रों के लिए पुन: प्रयोज्य नियंत्रकों को प्रशिक्षित करने के लिए एडवरसैरियल स्किल एम्बेडिंग।

    1,119+2पिछले 7 दिनों में स्टार का बदलाव
  • ARPO@RUC-NLPIR

    [ICLR 2026] एजेंटिक रीइन्फोर्स्ड पॉलिसी ऑप्टिमाइज़ेशन (ARPO)

    1,114+4पिछले 7 दिनों में स्टार का बदलाव
  • SoundMind@xid32

    हम Audio Logical Reasoning (ALR) डेटासेट पेश करते हैं, जिसमें जटिल तर्क कार्यों के लिए विशेष रूप से डिज़ाइन किए गए 6,446 टेक्स्ट-ऑडियो एनोटेटेड नमूने शामिल हैं। इस संसाधन के आधार पर, हम SoundMind का प्रस्ताव करते हैं, जो ऑडियो लैंग्वेज मॉडल (ALMs) को गहरी द्विमोडल तर्क क्षमताओं से लैस करने के लिए तैयार किया गया एक नियम-आधारित सुदृढीकरण शिक्षण (RL) एल्गोरिदम है।

    1,113+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस