मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · reinforcement-learning

reinforcement-learning

reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

305 रिपॉजिटरी
  • vowpal_wabbit@VowpalWabbit

    Vowpal Wabbit एक मशीन लर्निंग सिस्टम है जो ऑनलाइन, हैशिंग, allreduce, रिडक्शन, learning2search, एक्टिव और इंटरैक्टिव लर्निंग जैसी तकनीकों के साथ मशीन लर्निंग की सीमाओं को आगे बढ़ाता है।

    8,708+2पिछले 7 दिनों में स्टार का बदलाव
  • pysc2@google-deepmind

    StarCraft II लर्निंग एनवायरनमेंट

    8,309+2पिछले 7 दिनों में स्टार का बदलाव
  • PaLM-rlhf-pytorch@lucidrains

    PaLM आर्किटेक्चर के ऊपर RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन। मूल रूप से PaLM के साथ ChatGPT जैसा।

    7,866-1पिछले 7 दिनों में स्टार का बदलाव
  • maths-cs-ai-compendium@HenryNdubuaku

    गणित, कंप्यूटिंग और ML को अंतर्ज्ञान के साथ कवर करने वाली इस अपरंपरागत पाठ्यपुस्तक के साथ एक बेहतरीन AI/ML शोधकर्ता/इंजीनियर बनें।

    7,400+21पिछले 7 दिनों में स्टार का बदलाव
  • मल्टीमॉडल machine learning में अनुसंधान विषयों के लिए रीडिंग लिस्ट

    6,926+1पिछले 7 दिनों में स्टार का बदलाव
  • OpenAI o1 🍓 और रीज़निंग तकनीकों पर ध्यान केंद्रित करते हुए LLM पेपर्स, ब्लॉग्स और प्रोजेक्ट्स का एक संग्रह।

    6,902+3पिछले 7 दिनों में स्टार का बदलाव
  • Practical_RL@yandexdataschool

    वास्तविक दुनिया में रीइंफोर्समेंट लर्निंग पर एक कोर्स

    6,566+0पिछले 7 दिनों में स्टार का बदलाव
  • 🔬 वित्तीय बाजार में शानदार LLMs और डीप लर्निंग रणनीतियों और उपकरणों की एक क्यूरेटेड सूची।

    6,475+23पिछले 7 दिनों में स्टार का बदलाव
  • Mooncake@kvcache-ai

    Mooncake, Kimi के लिए सर्विंग प्लेटफ़ॉर्म है, जो Moonshot AI द्वारा प्रदान की जाने वाली एक अग्रणी LLM सेवा है।

    6,470+40पिछले 7 दिनों में स्टार का बदलाव
  • शानदार सेल्फ-सुपरवाइज्ड तरीकों की एक क्यूरेटेड सूची

    6,414+1पिछले 7 दिनों में स्टार का बदलाव
  • PufferLib@PufferAI

    रीइंफोर्समेंट लर्निंग को बेहतर बनाना

    6,321+8पिछले 7 दिनों में स्टार का बदलाव
  • VLM-R1@om-ai-lab

    Reinforced VLM के साथ विजुअल अंडरस्टैंडिंग को हल करें

    6,018+4पिछले 7 दिनों में स्टार का बदलाव
  • rllm@rllm-org

    LLM के लिए रीइंफोर्समेंट लर्निंग का लोकतांत्रिकीकरण

    5,813+5पिछले 7 दिनों में स्टार का बदलाव
  • AReaL@areal-project

    LLM-आधारित एजेंट एप्लिकेशन के लिए RL ब्रिज। सरल और लचीला बनाया गया।

    5,712+9पिछले 7 दिनों में स्टार का बदलाव
  • open_spiel@google-deepmind

    OpenSpiel सामान्य सुदृढीकरण सीखने (reinforcement learning) और खेलों में खोज/योजना (search/planning) पर शोध के लिए वातावरण और एल्गोरिदम का एक संग्रह है।

    5,452+8पिछले 7 दिनों में स्टार का बदलाव
  • STEM, कोडिंग और रोबोटिक्स शिक्षा, IoT रोबोटिक्स एप्लिकेशन, AI-संवर्धित रोबोटिक्स एप्लिकेशन सेवाओं, अनुसंधान और DIY रोबोटिक्स किट विकास के लिए एकदम सही Boston Dynamics-शैली के चार पैरों वाले रोबोट विकसित करने के लिए एक ओपन सोर्स चौपाया रोबोट पेट फ्रेमवर्क।

    5,246+15पिछले 7 दिनों में स्टार का बदलाव
  • xtuner@InternLM

    अльтра-लार्ज MoE मॉडल के लिए निर्मित एक अगली पीढ़ी का ट्रेनिंग इंजन

    5,188+3पिछले 7 दिनों में स्टार का बदलाव
  • deep-reinforcement-learning@udacity

    डीप रेनफोर्समेंट लर्निंग नैनोडग्री प्रोग्राम के लिए रिपॉजिटरी

    5,176+0पिछले 7 दिनों में स्टार का बदलाव
  • EasyR1@hiyouga

    EasyR1: veRL पर आधारित एक कुशल, स्केलेबल, मल्टी-मोडालिटी RL ट्रेनिंग फ्रेमवर्क

    5,141+5पिछले 7 दिनों में स्टार का बदलाव
  • reasoning-from-scratch@rasbt

    PyTorch में शुरुआत से, चरण-दर-चरण एक रीज़निंग LLM लागू करें।

    5,138+49पिछले 7 दिनों में स्टार का बदलाव
  • deep-rl-class@huggingface

    इस रिपॉजिटरी में Hugging Face डीप रीइन्फोर्समेंट लर्निंग कोर्स शामिल है।

    5,006+10पिछले 7 दिनों में स्टार का बदलाव
  • LLM-RL-Visualized@changyeyu

    🌟100+ ओरिजिनल LLM / RL आर्किटेक्चर डायग्राम्स📚, 'Large Model Algorithms' के लेखक द्वारा प्रस्तुत!💥 (100+ LLM/RL एल्गोरिदम मैप्स)

    4,838+12पिछले 7 दिनों में स्टार का बदलाव
  • trlx@CarperAI

    ह्यूमन फीडबैक (RLHF) के माध्यम से रिइंफोर्समेंट लर्निंग के साथ लैङ्ग्वेज मॉडल के वितरित प्रशिक्षण के लिए एक रिपो

    4,754-1पिछले 7 दिनों में स्टार का बदलाव
  • RLinf@RLinf

    RLinf: एम्बेडेड और एजेंटिक AI के लिए सुदृढीकरण शिक्षण बुनियादी ढांचा

    4,705+31पिछले 7 दिनों में स्टार का बदलाव
  • dm_control@google-deepmind

    MuJoCo का उपयोग करके भौतिकी-आधारित सिमुलेशन और Reinforcement Learning वातावरण के लिए Google DeepMind का सॉफ्टवेयर स्टैक।

    4,681+6पिछले 7 दिनों में स्टार का बदलाव
  • DouZero@kwai

    [ICML 2021] DouZero: सेल्फ-प्ले डीप रीइन्फोर्समेंट लर्निंग के साथ DouDizhu (斗地主) में महारत हासिल करना।

    4,659+5पिछले 7 दिनों में स्टार का बदलाव
  • alpha-zero-general@suragnair

    किसी भी फ्रेमवर्क में किसी भी गेम के लिए AlphaZero पर आधारित एक स्वच्छ कार्यान्वयन + ट्यूटोरियल + Othello/Gobang/TicTacToe/Connect4 और बहुत कुछ

    4,512+5पिछले 7 दिनों में स्टार का बदलाव
  • awesome-RLHF@opendilab

    ह्यूमन फीडबैक के साथ रीइंफोर्समेंट लर्निंग संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)

    4,424+2पिछले 7 दिनों में स्टार का बदलाव
  • ElegantRL@AI4Finance-Foundation

    बड़े पैमाने पर समानांतर डीप रीइंफोर्समेंट लर्निंग। 🔥

    4,359+2पिछले 7 दिनों में स्टार का बदलाव
  • hands-on-modern-rl@walkinglabs

    🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।

    4,199+54पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस