मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · reinforcement-learning

reinforcement-learning

reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

305 रिपॉजिटरी
  • DI-drive@opendilab

    ऑटोनॉमस ड्राइविंग सिमुलेशन के लिए डिसीजन इंटेलिजेंस प्लेटफॉर्म।

    638+0पिछले 7 दिनों में स्टार का बदलाव
  • mlimpl@vincen-github

    यह रिपॉजिटरी मशीन लर्निंग के क्षेत्र में आमतौर पर उपयोग किए जाने वाले एल्गोरिदम को समाहित करने वाले कोड का संग्रह है। इनमें से अधिकांश Numpy, Pandas या Torch पर आधारित हैं। आप इस रिपॉजिटरी का संदर्भ लेकर संबंधित मॉडल और एल्गोरिदम की अपनी समझ को गहरा कर सकते हैं या इसे संशोधित करके अपना स्वयं का कस्टमाइज्ड कोड प्राप्त कर सकते हैं।

    635+0पिछले 7 दिनों में स्टार का बदलाव
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।

    634+4पिछले 7 दिनों में स्टार का बदलाव
  • ma-gym@koulanurag

    OpenAI gym पर आधारित मल्टी-एजेंट वातावरण का एक संग्रह।

    633+0पिछले 7 दिनों में स्टार का बदलाव
  • virtualhome@xavierpuigf

    VirtualHome चलाने के लिए API, एक मल्टी-एजेंट हाउसहोल्ड सिम्युलेटर

    632+2पिछले 7 दिनों में स्टार का बदलाव
  • robohive@vikashplus

    रोबोट लर्निंग के लिए एक एकीकृत फ्रेमवर्क

    631+0पिछले 7 दिनों में स्टार का बदलाव
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं

    623+0पिछले 7 दिनों में स्टार का बदलाव
  • Unitree Go2 पर walk-these-ways प्रोजेक्ट को डिप्लॉय करें

    623+1पिछले 7 दिनों में स्टार का बदलाव
  • DiffPhysDrone@HenryHuYu

    Nature Machine Intelligence पर प्रकाशित! डिफरेंशियल फिजिक्स ट्रेनिंग पर आधारित पहला वास्तविक रोबोट (क्वाडरोटर)

    615+6पिछले 7 दिनों में स्टार का बदलाव
  • ML-2021-notes@chsiang426

    नेशनल ताइवान यूनिवर्सिटी (NTU) के प्रोफेसर ली होंग-यी द्वारा 'मशीन लर्निंग (Machine Learning) 2021 स्प्रिंग' पाठ्यक्रम के नोट्स।

    603+2पिछले 7 दिनों में स्टार का बदलाव
  • recogdrive@xiaomi-research

    [ICLR 2026] ReCogDrive: एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक रीइन्फोर्स्ड कॉग्निटिव फ्रेमवर्क।

    601+3पिछले 7 दिनों में स्टार का बदलाव
  • Relax@redai-studio

    बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।

    597+12पिछले 7 दिनों में स्टार का बदलाव
  • सुदृढीकरण सीखने (reinforcement learning) के लिए संबंधित पेपर, जिसमें क्लासिक पेपर और शीर्ष सम्मेलनों के नवीनतम पेपर शामिल हैं

    595+0पिछले 7 दिनों में स्टार का बदलाव
  • वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची

    593+2पिछले 7 दिनों में स्टार का बदलाव
  • AAAI-2024-Papers@DmitryRyumin

    AAAI 2024 पेपर्स: प्रमुख आर्टिफिशियल इंटेलिजेंस सम्मेलनों में प्रस्तुत शोध पत्रों का संग्रह। बेहतर समझ के लिए कोड इम्प्लीमेंटेशन शामिल हैं।

    591-1पिछले 7 दिनों में स्टार का बदलाव
  • Graph-R1@LHRLAB

    [ICML 2026] "Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning" के आधिकारिक संसाधन।

    591+0पिछले 7 दिनों में स्टार का बदलाव
  • crafter@danijar

    एजेंट क्षमताओं के स्पेक्ट्रम की बेंचमार्किंग।

    587+2पिछले 7 दिनों में स्टार का बदलाव
  • safety-gymnasium@PKU-Alignment

    NeurIPS 2023: Safety-Gymnasium: एक एकीकृत सेफ रीइन्फोर्समेंट लर्निंग बेंचमार्क।

    581+1पिछले 7 दिनों में स्टार का बदलाव
  • OmniDrones@btx0424
    578+4पिछले 7 दिनों में स्टार का बदलाव
  • TextRL@voidful

    huggingface के ट्रांसफॉर्मर (blommz-176B/bloom/gpt/bart/T5/MetaICL) में किसी भी जनरेशन मॉडल पर ChatGPT RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन

    564+0पिछले 7 दिनों में स्टार का बदलाव
  • ऑटोनॉमस ड्राइविंग (Carla) में डीप रीइन्फोर्समेंट लर्निंग (PPO) [शून्य से]

    563-1पिछले 7 दिनों में स्टार का बदलाव
  • Meta Agents Research Environments एक व्यापक प्लेटफॉर्म है जिसे गतिशील और यथार्थवादी परिदृश्यों में AI एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। स्थिर बेंचमार्क के विपरीत, यह प्लेटफॉर्म ऐसे विकसित वातावरण पेश करता है जहाँ एजेंटों को नई जानकारी उपलब्ध होने पर अपनी रणनीतियों को अनुकूलित करना पड़ता है, जो वास्तविक दुनिया की चुनौतियों को दर्शाता है।

    551+1पिछले 7 दिनों में स्टार का बदलाव
  • awesome-ai@hades217

    आर्टिफिशियल इंटेलिजेंस संसाधनों की एक क्यूरेटेड सूची (कोर्स, टूल्स, ऐप, ओपन सोर्स प्रोजेक्ट)

    549+1पिछले 7 दिनों में स्टार का बदलाव
  • ReasonFlux@Gen-Verse

    [NeurIPS 2025 स्पॉटलाइट] LLM पोस्ट-ट्रेनिंग सूट — जिसमें ReasonFlux, ReasonFlux-PRM, और ReasonFlux-Coder शामिल हैं।

    542+0पिछले 7 दिनों में स्टार का बदलाव
  • flybody@TuragaLab

    MuJoCo फ्रूट फ्लाई बॉडी मॉडल और लोकोमोशन RL टास्क।

    541+4पिछले 7 दिनों में स्टार का बदलाव
  • umi-on-legs@real-stanford

    UMI on Legs: मैनिपुलेशन-सेंट्रिक होल-बॉडी कंट्रोलर्स के साथ मैनिपुलेशन पॉलिसी को मोबाइल बनाना

    539+3पिछले 7 दिनों में स्टार का बदलाव
  • CalTech, Columbia, Berkeley, MIT और Stanford से सार्वजनिक रूप से उपलब्ध मशीन लर्निंग इंजीनियरिंग पाठ्यक्रमों की क्यूरेटेड सूची।

    535+0पिछले 7 दिनों में स्टार का बदलाव
  • morl-baselines@LucasAlegre

    मल्टी-ऑब्जेक्टिव रीइन्फोर्समेंट लर्निंग एल्गोरिदम का कार्यान्वयन।

    533+0पिछले 7 दिनों में स्टार का बदलाव
  • InterMimic@Sirui-Xu

    [CVPR 2025 हाइलाइट] InterMimic: भौतिकी-आधारित मानव-वस्तु इंटरैक्शन के लिए यूनिवर्सल होल-बॉडी कंट्रोल की ओर

    528+0पिछले 7 दिनों में स्टार का बदलाव
  • gym-mtsim@AminHP

    MetaTrader 5 ट्रेडिंग प्लेटफॉर्म के लिए एक सामान्य-उद्देश्य, लचीला और उपयोग में आसान सिम्युलेटर और OpenAI Gym ट्रेडिंग एनवायरनमेंट (OpenAI Gym द्वारा अनुमोदित)

    524+0पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस