reinforcement-learning
reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #271★ 638+0पिछले 7 दिनों में स्टार का बदलाव
- #272
यह रिपॉजिटरी मशीन लर्निंग के क्षेत्र में आमतौर पर उपयोग किए जाने वाले एल्गोरिदम को समाहित करने वाले कोड का संग्रह है। इनमें से अधिकांश Numpy, Pandas या Torch पर आधारित हैं। आप इस रिपॉजिटरी का संदर्भ लेकर संबंधित मॉडल और एल्गोरिदम की अपनी समझ को गहरा कर सकते हैं या इसे संशोधित करके अपना स्वयं का कस्टमाइज्ड कोड प्राप्त कर सकते हैं।
★ 635+0पिछले 7 दिनों में स्टार का बदलाव - #273
RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।
★ 634+4पिछले 7 दिनों में स्टार का बदलाव - #274★ 633+0पिछले 7 दिनों में स्टार का बदलाव
- #275
VirtualHome चलाने के लिए API, एक मल्टी-एजेंट हाउसहोल्ड सिम्युलेटर
★ 632+2पिछले 7 दिनों में स्टार का बदलाव - #276★ 631+0पिछले 7 दिनों में स्टार का बदलाव
- #277
2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं
★ 623+0पिछले 7 दिनों में स्टार का बदलाव - #278
Unitree Go2 पर walk-these-ways प्रोजेक्ट को डिप्लॉय करें
★ 623+1पिछले 7 दिनों में स्टार का बदलाव - #279
Nature Machine Intelligence पर प्रकाशित! डिफरेंशियल फिजिक्स ट्रेनिंग पर आधारित पहला वास्तविक रोबोट (क्वाडरोटर)
★ 615+6पिछले 7 दिनों में स्टार का बदलाव - #280
नेशनल ताइवान यूनिवर्सिटी (NTU) के प्रोफेसर ली होंग-यी द्वारा 'मशीन लर्निंग (Machine Learning) 2021 स्प्रिंग' पाठ्यक्रम के नोट्स।
★ 603+2पिछले 7 दिनों में स्टार का बदलाव - #281
[ICLR 2026] ReCogDrive: एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक रीइन्फोर्स्ड कॉग्निटिव फ्रेमवर्क।
★ 601+3पिछले 7 दिनों में स्टार का बदलाव - #282
बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।
★ 597+12पिछले 7 दिनों में स्टार का बदलाव - #283
सुदृढीकरण सीखने (reinforcement learning) के लिए संबंधित पेपर, जिसमें क्लासिक पेपर और शीर्ष सम्मेलनों के नवीनतम पेपर शामिल हैं
★ 595+0पिछले 7 दिनों में स्टार का बदलाव - #284
वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची
★ 593+2पिछले 7 दिनों में स्टार का बदलाव - #285
AAAI 2024 पेपर्स: प्रमुख आर्टिफिशियल इंटेलिजेंस सम्मेलनों में प्रस्तुत शोध पत्रों का संग्रह। बेहतर समझ के लिए कोड इम्प्लीमेंटेशन शामिल हैं।
★ 591-1पिछले 7 दिनों में स्टार का बदलाव - #286
[ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" के आधिकारिक संसाधन।
★ 591+0पिछले 7 दिनों में स्टार का बदलाव - #287★ 587+2पिछले 7 दिनों में स्टार का बदलाव
- #288
NeurIPS 2023: Safety-Gymnasium: एक एकीकृत सेफ रीइन्फोर्समेंट लर्निंग बेंचमार्क।
★ 581+1पिछले 7 दिनों में स्टार का बदलाव - #289★ 578+4पिछले 7 दिनों में स्टार का बदलाव
- #290
huggingface के ट्रांसफॉर्मर (blommz-176B/bloom/gpt/bart/T5/MetaICL) में किसी भी जनरेशन मॉडल पर ChatGPT RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन
★ 564+0पिछले 7 दिनों में स्टार का बदलाव - #291
ऑटोनॉमस ड्राइविंग (Carla) में डीप रीइन्फोर्समेंट लर्निंग (PPO) [शून्य से]
★ 563-1पिछले 7 दिनों में स्टार का बदलाव - #292
Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।
★ 551+1पिछले 7 दिनों में स्टार का बदलाव - #293
आर्टिफिशियल इंटेलिजेंस संसाधनों की एक क्यूरेटेड सूची (कोर्स, टूल्स, ऐप, ओपन सोर्स प्रोजेक्ट)
★ 549+1पिछले 7 दिनों में स्टार का बदलाव - #294
[NeurIPS 2025 स्पॉटलाइट] LLM पोस्ट-ट्रेनिंग सूट — जिसमें ReasonFlux, ReasonFlux-PRM, और ReasonFlux-Coder शामिल हैं।
★ 542+0पिछले 7 दिनों में स्टार का बदलाव - #295★ 541+4पिछले 7 दिनों में स्टार का बदलाव
- #296
UMI on Legs: मैनिपुलेशन-सेंट्रिक होल-बॉडी कंट्रोलर्स के साथ मैनिपुलेशन पॉलिसी को मोबाइल बनाना
★ 539+3पिछले 7 दिनों में स्टार का बदलाव - #297
CalTech, Columbia, Berkeley, MIT और Stanford से सार्वजनिक रूप से उपलब्ध मशीन लर्निंग इंजीनियरिंग पाठ्यक्रमों की क्यूरेटेड सूची।
★ 535+0पिछले 7 दिनों में स्टार का बदलाव - #298
मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम का कार्यान्वयन।
★ 533+0पिछले 7 दिनों में स्टार का बदलाव - #299
[CVPR 2025 हाइलाइट] InterMimic: भौतिकी-आधारित मानव-वस्तु इंटरैक्शन के लिए यूनिवर्सल होल-बॉडी कंट्रोल की ओर
★ 528+0पिछले 7 दिनों में स्टार का बदलाव - #300
MetaTrader 5 ट्रेडिंग प्लेटफॉर्म के लिए एक सामान्य-उद्देश्य, लचीला और उपयोग में आसान सिम्युलेटर और OpenAI Gym ट्रेडिंग एनवायरनमेंट (OpenAI Gym द्वारा अनुमोदित)
★ 524+0पिछले 7 दिनों में स्टार का बदलाव