reinforcement-learning
reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #151
ReSearch: सुदृढीकरण शिक्षण के माध्यम से LLM के लिए खोज के साथ तर्क करना सीखना और ReCall: सुदृढीकरण शिक्षण के माध्यम से LLM के लिए टूल कॉल के साथ तर्क करना सीखना
★ 1,432+1पिछले 7 दिनों में स्टार का बदलाव - #152
Julia में लिखे गए संक्षिप्त और सुंदर एल्गोरिदम
★ 1,426+0पिछले 7 दिनों में स्टार का बदलाव - #153
अद्भुत मॉडल आधारित RL संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)
★ 1,393+0पिछले 7 दिनों में स्टार का बदलाव - #154★ 1,385+2पिछले 7 दिनों में स्टार का बदलाव
- #155
STEM शिक्षा और AI-संवर्धित सेवाओं के लिए एक प्रोग्रामेबल और अत्यधिक पैंतरेबाज़ी करने वाली रोबोटिक बिल्ली।
★ 1,372+0पिछले 7 दिनों में स्टार का बदलाव - #156★ 1,367+1पिछले 7 दिनों में स्टार का बदलाव
- #157
ROS Gazebo सिम्युलेटर में मोबाइल रोबोट नेविगेशन के लिए डीप रीइंफोर्समेंट लर्निंग। Twin Delayed Deep Deterministic Policy Gradient (TD3) न्यूरल नेटवर्क का उपयोग करके, एक रोबोट बाधाओं से बचते हुए simulated वातावरण में एक यादृच्छिक लक्ष्य बिंदु पर नेविगेट करना सीखता है।
★ 1,362+6पिछले 7 दिनों में स्टार का बदलाव - #158
PyTorch में मॉड्यूलर डीप रिइंफोर्समेंट लर्निंग फ्रेमवर्क। पुस्तक "फाउंडेशन ऑफ डीप रिइंफोर्समेंट लर्निंग" की सह-पुस्तकालय (कंपैनियन लाइब्रेरी)।
★ 1,362+0पिछले 7 दिनों में स्टार का बदलाव - #159
Soft Actor-Critic (SAC), Twin Delayed DDPG (TD3), Actor-Critic (AC/A2C), Proximal Policy Optimization (PPO), QT-Opt, PointNet का PyTorch कार्यान्वयन
★ 1,359+1पिछले 7 दिनों में स्टार का बदलाव - #160
एक जीवंत पारिस्थितिकी तंत्र जहाँ AI एजेंट वर्कफ़्लो लूप के माध्यम से कार्य पूरे करते हैं, पुनरावृत्ति निष्पादन के माध्यम से सुधार करते हैं, मेंटर एजेंटों या लूप में मनुष्यों द्वारा मूल्यांकित किए जाते हैं, और भविष्य के एजेंटों को बेहतर बनाने के लिए पूर्ण किए गए कार्य को पुन: प्रयोज्य कार्य अनुभव और डेटा में बदलते हैं।
★ 1,334+0पिछले 7 दिनों में स्टार का बदलाव - #161
Keras में न्यूनतम Deep Q Learning (DQN और DDQN) कार्यान्वयन
★ 1,329+1पिछले 7 दिनों में स्टार का बदलाव - #162
लोकप्रिय संदर्भ डेटासेट और संबंधित यूटिलिटीज के साथ ऑफ़लाइन सुदृढीकरण शिक्षण डेटासेट के लिए एक मानक प्रारूप
★ 1,294+3पिछले 7 दिनों में स्टार का बदलाव - #163
डीप लर्निंग और मशीन लर्निंग पर पेपर रीडिंग नोट्स।
★ 1,270+0पिछले 7 दिनों में स्टार का बदलाव - #164
एक सरल और अच्छी तरह से स्टाइल किया गया PPO कार्यान्वयन। मेरी Medium श्रृंखला पर आधारित: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8
★ 1,269+1पिछले 7 दिनों में स्टार का बदलाव - #165
Android उपकरणों पर RL अनुसंधान।
★ 1,240+0पिछले 7 दिनों में स्टार का बदलाव - #166
सुदृढीकरण सीखने (reinforcement learning) के माध्यम से फॉर्मूला अल्पा (पूर्वानुमानित) स्टॉक कारकों के सेट उत्पन्न करना।
★ 1,213+9पिछले 7 दिनों में स्टार का बदलाव - #167
रीइंफोर्समेंट लर्निंग का उपयोग करके लोकोमोशन के लिए ह्यूमनॉइड रोबोट को प्रशिक्षित करना
★ 1,210+3पिछले 7 दिनों में स्टार का बदलाव - #168
पाडेरबर्न विश्वविद्यालय द्वारा आयोजित सुदृढीकरण शिक्षण पाठ्यक्रम के लिए समाधान और ऑनलाइन वीडियो सहित व्याख्यान नोट्स, ट्यूटोरियल कार्य।
★ 1,192+1पिछले 7 दिनों में स्टार का बदलाव - #169★ 1,188+0पिछले 7 दिनों में स्टार का बदलाव
- #170
[ECCV 2026] MixGRPO: मिक्स्ड ODE-SDE के साथ फ्लो-आधारित GRPO दक्षता को अनलॉक करना
★ 1,177+0पिछले 7 दिनों में स्टार का बदलाव - #171★ 1,155+13पिछले 7 दिनों में स्टार का बदलाव
- #172
सामान्य सेटअप (जैसे, Google Robot, WidowX+Bridge) के तहत सिमुलेशन में वास्तविक दुनिया की रोबोट हेरफेर नीतियों (जैसे, RT-1, RT-1-X, Octo) का मूल्यांकन और पुनरुत्पादन (CoRL 2024)
★ 1,153+6पिछले 7 दिनों में स्टार का बदलाव - #173
JMLR: OmniSafe, SafeRL अनुसंधान को गति देने के लिए एक इंफ्रास्ट्रक्चरल फ्रेमवर्क है।
★ 1,150+1पिछले 7 दिनों में स्टार का बदलाव - #174
NNAISENSE में निर्मित, सीधे PyTorch के ऊपर बनाई गई एडवांस्ड इवोल्यूशनरी कंप्यूटेशन लाइब्रेरी।
★ 1,144+2पिछले 7 दिनों में स्टार का बदलाव - #175★ 1,134+0पिछले 7 दिनों में स्टार का बदलाव
- #176
मशीनों को सीखना सिखाएं ताकि आपको उन्हें प्रोग्राम करने के लिए संघर्ष न करना पड़े; अंतिम सूची
★ 1,128+0पिछले 7 दिनों में स्टार का बदलाव - #177
नेविगेशन, कंट्रोल और लर्निंग के लिए डिज़ाइन किया गया एक Python-आधारित हल्का रोबोट सिम्युलेटर।
★ 1,125+1पिछले 7 दिनों में स्टार का बदलाव - #178
भौतिक रूप से सिम्युलेटेड पात्रों के लिए पुन: प्रयोज्य नियंत्रकों को प्रशिक्षित करने के लिए एडवरसैरियल स्किल एम्बेडिंग।
★ 1,119+2पिछले 7 दिनों में स्टार का बदलाव - #179★ 1,114+4पिछले 7 दिनों में स्टार का बदलाव
- #180
हम Audio Logical Reasoning (ALR) डेटासेट पेश करते हैं, जिसमें जटिल तर्क कार्यों के लिए विशेष रूप से डिज़ाइन किए गए 6,446 टेक्स्ट-ऑडियो एनोटेटेड नमूने शामिल हैं। इस संसाधन के आधार पर, हम SoundMind का प्रस्ताव करते हैं, जो ऑडियो लैंग्वेज मॉडल (ALMs) को गहरी द्विमोडल तर्क क्षमताओं से लैस करने के लिए तैयार किया गया एक नियम-आधारित सुदृढीकरण शिक्षण (RL) एल्गोरिदम है।
★ 1,113+0पिछले 7 दिनों में स्टार का बदलाव