मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · rl

rl

rl टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
46
कुल स्टार
1,13,768
औसत स्टार
2,473
हिस्सा
0.01%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर rl के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और rl टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • Llama-Chinese@LlamaChinese

    Llama चीनी समुदाय, नवीनतम Llama अध्ययन सामग्री का वास्तविक समय में संकलन, सर्वश्रेष्ठ चीनी Llama बड़े मॉडल ओपन-सोर्स इकोसिस्टम का निर्माण, पूरी तरह से ओपन-सोर्स और व्यावसायिक उपयोग के लिए उपलब्ध

    14,743+3पिछले 7 दिनों में स्टार का बदलाव
  • tianshou@thu-ml

    एक सुंदर PyTorch डीप रीइंफोर्समेंट लर्निंग लाइब्रेरी।

    10,955+10पिछले 7 दिनों में स्टार का बदलाव
  • dopamine@google

    Dopamine रीइन्फोर्समेंट लर्निंग एल्गोरिदम की तेज़ प्रोटोटाइपिंग के लिए एक रिसर्च फ्रेमवर्क है

    10,909+8पिछले 7 दिनों में स्टार का बदलाव
  • ART@OpenPipe

    Agent Reinforcement Trainer: GRPO का उपयोग करके वास्तविक दुनिया के कार्यों के लिए मल्टी-स्टेप एजेंटों को प्रशिक्षित करें। अपने एजेंटों को ऑन-द-जॉब ट्रेनिंग दें। Qwen3.6, GPT-OSS, Llama और अन्य के लिए रीइन्फोर्समेंट लर्निंग।

    10,689+10पिछले 7 दिनों में स्टार का बदलाव
  • AReaL@areal-project

    LLM-आधारित एजेंट एप्लिकेशन के लिए RL ब्रिज। सरल और लचीला बनाया गया।

    5,712+9पिछले 7 दिनों में स्टार का बदलाव
  • EasyR1@hiyouga

    EasyR1: veRL पर आधारित एक कुशल, स्केलेबल, मल्टी-मोडालिटी RL ट्रेनिंग फ्रेमवर्क

    5,141+5पिछले 7 दिनों में स्टार का बदलाव
  • hands-on-modern-rl@walkinglabs

    🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।

    4,199+54पिछले 7 दिनों में स्टार का बदलाव
  • agent-sandbox@kubernetes-sigs

    agent-sandbox अलग-थलग, स्टेटफुल, सिंगलटन वर्कलोड के आसान प्रबंधन को सक्षम बनाता है, जो AI एजेंट रनटाइम और सुदृढीकरण सीखने (RL) जैसे उपयोग के मामलों के लिए आदर्श है।

    3,719+41पिछले 7 दिनों में स्टार का बदलाव
  • AlphaZero_Gomoku@junxiaosong

    गोमोकू (जिसे गोबांग या फाइव इन ए रो भी कहा जाता है) के लिए AlphaZero एल्गोरिदम का एक कार्यान्वयन।

    3,627+2पिछले 7 दिनों में स्टार का बदलाव
  • rl@pytorch

    रिइंफोर्समेंट लर्निंग के लिए एक मॉड्यूलर, प्रिमिटिव-फर्स्ट, पाइथन-फर्स्ट PyTorch लाइब्रेरी।

    3,545+5पिछले 7 दिनों में स्टार का बदलाव
  • हाइपरपैरामीटर ऑप्टिमाइज़ेशन और प्री-ट्रेन किए गए एजेंटों के साथ Stable Baselines3 रीइंफोर्समेंट लर्निंग एजेंटों के लिए एक ट्रेनिंग फ्रेमवर्क।

    2,873+1पिछले 7 दिनों में स्टार का बदलाव
  • Papers-in-100-Lines-of-Code@MaximeVandegar

    100 लाइनों के कोड में पेपर का कार्यान्वयन।

    2,870+3पिछले 7 दिनों में स्टार का बदलाव
  • muzero-general@werner-duvaud

    MuZero

    2,865+2पिछले 7 दिनों में स्टार का बदलाव
  • Awesome-RL-for-LRMs@TsinghuaC3I

    लार्ज रीजनिंग मॉडल के लिए सुदृढीकरण शिक्षण (Reinforcement Learning) का एक सर्वेक्षण

    2,483+1पिछले 7 दिनों में स्टार का बदलाव
  • all-rl-algorithms@FareedKhan-dev

    सरल तरीके से सभी RL एल्गोरिदम का कार्यान्वयन

    1,929+7पिछले 7 दिनों में स्टार का बदलाव
  • PRIME@PRIME-RL

    लैङ्ग्वेज मॉडल्स की उन्नत रीज़निंग के लिए स्केलेबल् RL समाधान

    1,871-1पिछले 7 दिनों में स्टार का बदलाव
  • SimpleVLA-RL@PRIME-RL

    [ICLR 2026] SimpleVLA-RL: सुदृढीकरण शिक्षण (Reinforcement Learning) के माध्यम से VLA प्रशिक्षण को मापना

    1,844+6पिछले 7 दिनों में स्टार का बदलाव
  • System-2 रीज़निंग पर नवीनतम प्रगति

    1,353+0पिछले 7 दिनों में स्टार का बदलाव
  • diy-llm@datawhalechina

    🎓 व्यवस्थित बड़े भाषा मॉडल निर्माण पाठ्यक्रम|🛠️ प्री-ट्रेनिंग डेटा इंजीनियरिंग, Tokenizer, Transformer, MoE, GPU प्रोग्रामिंग (CUDA/Triton), वितरित प्रशिक्षण, स्केलिंग नियम, अनुमान अनुकूलन और संरेखण (SFT/RLHF/GRPO) को कवर करता है|🚀 6 प्रगतिशील असाइनमेंट + कोड-संचालित, LLM फुल-स्टैक कॉग्निशन सिस्टम स्थापित करता है

    1,276+19पिछले 7 दिनों में स्टार का बदलाव
  • understand-r1-zero@sail-sg

    R1-Zero-Like ट्रेनिंग को समझना: एक आलोचनात्मक दृष्टिकोण

    1,274+0पिछले 7 दिनों में स्टार का बदलाव
  • TTRL@PRIME-RL

    [NeurIPS 2025] TTRL: टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग।

    1,122+2पिछले 7 दिनों में स्टार का बदलाव
  • ARPO@RUC-NLPIR

    [ICLR 2026] एजेंटिक रीइन्फोर्स्ड पॉलिसी ऑप्टिमाइज़ेशन (ARPO)

    1,116+5पिछले 7 दिनों में स्टार का बदलाव
  • SDPO@lasgroup

    सेल्फ-डिस्टिलेशन (SDPO) के माध्यम से रीइन्फोर्समेंट लर्निंग

    1,092+13पिछले 7 दिनों में स्टार का बदलाव
  • judgeval@JudgmentLabs

    एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।

    1,060+2पिछले 7 दिनों में स्टार का बदलाव
  • tensorlake@tensorlakeai

    Tensorlake सैंडबॉक्स और बैकग्राउंड एजेंटिक एप्लिकेशन को डिप्लॉय करने के लिए एक सर्वरलेस रनटाइम है

    995+2पिछले 7 दिनों में स्टार का बदलाव
  • OpenDerisk@derisk-ai

    AI-नेटिव रिस्क इंटेलिजेंस सिस्टम, OpenDeRisk—आपका एप्लिकेशन सिस्टम रिस्क इंटेलिजेंट मैनेजर जो 7*24 घंटे व्यापक और गहन सुरक्षा प्रदान करता है।

    971+3पिछले 7 दिनों में स्टार का बदलाव
  • mushroom-rl@MushroomRL

    रीइंफोर्समेंट लर्निंग के लिए Python लाइब्रेरी।

    944+0पिछले 7 दिनों में स्टार का बदलाव
  • AI-Compass@tingaicompass

    “AI-Compass” समुदाय को AI तकनीक के महासागर में नेविगेट करने के लिए मार्गदर्शन प्रदान करेगा, चाहे आप शुरुआती हों या उन्नत डेवलपर, आप यहाँ AI के सभी क्षेत्रों के लिए मार्ग पा सकते हैं। इसका उद्देश्य डेवलपर्स को AI की मुख्य अवधारणाओं, मुख्यधारा की तकनीकों और अत्याधुनिक रुझानों को व्यवस्थित रूप से समझने में मदद करना है, और अभ्यास के माध्यम से सिद्धांत से कार्यान्वयन तक की प्रक्रिया में महारत हासिल करना है।

    935+10पिछले 7 दिनों में स्टार का बदलाव
  • zeroth-bot@zeroth-robotics

    सिम-टू-रियल और RL के लिए 3D-प्रिंटेड ओपन-सोर्स ह्यूमेनॉइड रोबोट प्लेटफॉर्म

    822+3पिछले 7 दिनों में स्टार का बदलाव
  • लार्ज लैंग्वेज मॉडल्स के ऑन-पॉलिसी डिस्टिलेशन (OPD) के लिए पेपर्स, तकनीकी रिपोर्ट्स, फ्रेमवर्क्स और टूल्स का एक क्यूरेटेड संग्रह

    794+31पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस