reinforcement-learning
reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #241
स्वायत्त एजेंट बनाने पर हालिया शोध पत्रों का संग्रह। इसमें दो विषय शामिल हैं: RL-आधारित और LLM-आधारित एजेंट।
★ 760+2पिछले 7 दिनों में स्टार का बदलाव - #242
रीइन्फोर्समेंट लर्निंग के लिए मल्टी-ऑब्जेक्टिव Gymnasium एनवायरनमेंट।
★ 760+0पिछले 7 दिनों में स्टार का बदलाव - #243★ 737+1पिछले 7 दिनों में स्टार का बदलाव
- #244
Stable-Baselines3 के लिए कॉन्ट्रिब पैकेज - प्रयोगात्मक रीइन्फोर्समेंट लर्निंग (RL) कोड
★ 736+1पिछले 7 दिनों में स्टार का बदलाव - #245
यह UAV के लिए डीप रीइन्फोर्समेंट लर्निंग ऑटोनॉमस ऑब्सटैकल अवॉइडेंस एल्गोरिदम के बारे में एक प्रोजेक्ट है।
★ 730+0पिछले 7 दिनों में स्टार का बदलाव - #246★ 730+1पिछले 7 दिनों में स्टार का बदलाव
- #247
Nature प्रकाशन "Discovering State-of-the-art Reinforcement Algorithms" के लिए सहायक कोड
★ 729+2पिछले 7 दिनों में स्टार का बदलाव - #248★ 726-1पिछले 7 दिनों में स्टार का बदलाव
- #249
Python में पोकर AI विकास के लिए पोकर इंजन।
★ 723+2पिछले 7 दिनों में स्टार का बदलाव - #250
बेहतरीन एक्सप्लोरेशन RL संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)
★ 723+0पिछले 7 दिनों में स्टार का बदलाव - #251
पेपर के लिए कोड "Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach"
★ 722+1पिछले 7 दिनों में स्टार का बदलाव - #252
keras-rl पर आधारित रीइन्फोर्समेंट लर्निंग के साथ टेक्सास होल्डम OpenAI जिम पोकर एनवायरनमेंट। इसमें वर्चुअल रेंडरिंग और इक्विटी गणना के लिए मोंटे कार्लो शामिल है।
★ 722+0पिछले 7 दिनों में स्टार का बदलाव - #253
[COLM’25] DeepRetrieval — RLVR के माध्यम से सर्च एजेंट को प्रशिक्षित करना, रिट्रीवल परिणाम के साथ
★ 719+2पिछले 7 दिनों में स्टार का बदलाव - #254
इम्प्लीमेंटेशन के साथ मोंटे कार्लो ट्री सर्च पेपर्स की एक क्यूरेटेड सूची
★ 715+0पिछले 7 दिनों में स्टार का बदलाव - #255
वास्तविक पैनोरमिक छवियों से सुदृढीकरण सीखने (Reinforcement Learning) के लिए AI रिसर्च प्लेटफ़ॉर्म।
★ 713-1पिछले 7 दिनों में स्टार का बदलाव - #256
मॉडल प्रेडिक्टिव कंट्रोल के साथ रीइन्फोर्समेंट लर्निंग
★ 710+1पिछले 7 दिनों में स्टार का बदलाव - #257★ 708-1पिछले 7 दिनों में स्टार का बदलाव
- #258
विज़न-लैंग्वेज मॉडल पेपर और मॉडल्स का एक प्रमुख फ़्रंटएंड कलेक्शन और सर्वे GitHub रिपॉजिटरी। निरंतर अपडेट।
★ 708+3पिछले 7 दिनों में स्टार का बदलाव - #259★ 694+2पिछले 7 दिनों में स्टार का बदलाव
- #260
Flow-Matching मॉडल्स में आसान रीइन्फोर्समेंट लर्निंग के लिए एक एकीकृत फ्रेमवर्क
★ 692+5पिछले 7 दिनों में स्टार का बदलाव - #261
Python/Tensorflow में Inverse Reinforcement Learning (IRL) एल्गोरिदम का कार्यान्वयन। Deep MaxEnt, MaxEnt, LPIRL
★ 681+0पिछले 7 दिनों में स्टार का बदलाव - #262
C++ और कुछ रिइंफोर्समेंट लर्निंग का उपयोग करके बनाया गया Hearthstone सिम्युलेटर
★ 680+0पिछले 7 दिनों में स्टार का बदलाव - #263
Python बाइंडिंग के साथ MDPs और POMDPs के लिए एक C++ फ्रेमवर्क।
★ 671+0पिछले 7 दिनों में स्टार का बदलाव - #264
BenchMARL मल्टी-एजेंट रीइंफोर्समेंट लर्निंग (MARL) की बेंचमार्किंग के लिए एक लाइब्रेरी है। BenchMARL इसकी दो मुख्य अवधारणाओं: पुनरुत्पादकता और मानकीकरण पर व्यवस्थित रूप से आधारित रहते हुए विभिन्न MARL एल्गोरिदम, कार्यों और मॉडलों की तुरंत तुलना करने की अनुमति देता है।
★ 659+5पिछले 7 दिनों में स्टार का बदलाव - #265
डीप रीइन्फोर्समेंट लर्निंग एजेंट्स बनाने के लिए एक PyTorch लाइब्रेरी।
★ 657+0पिछले 7 दिनों में स्टार का बदलाव - #266
डेटा साइंस प्रोजेक्ट का संपूर्ण जीवन चक्र
★ 653+0पिछले 7 दिनों में स्टार का बदलाव - #267
Julia के लिए एक रीइन्फोर्समेंट लर्निंग पैकेज।
★ 652-1पिछले 7 दिनों में स्टार का बदलाव - #268
Long Chain-of-Thought रीजनिंग पर नवीनतम प्रगति।
★ 647-1पिछले 7 दिनों में स्टार का बदलाव - #269★ 644+2पिछले 7 दिनों में स्टार का बदलाव
- #270
"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement" के लिए प्रोजेक्ट पेज।
★ 640+1पिछले 7 दिनों में स्टार का बदलाव