reinforcement-learning
reinforcement-learning टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
- #31
Vowpal Wabbit एक मशीन लर्निंग सिस्टम है जो ऑनलाइन, हैशिंग, allreduce, रिडक्शन, learning2search, एक्टिव और इंटरैक्टिव लर्निंग जैसी तकनीकों के साथ मशीन लर्निंग की सीमाओं को आगे बढ़ाता है।
★ 8,708+2पिछले 7 दिनों में स्टार का बदलाव - #32★ 8,309+2पिछले 7 दिनों में स्टार का बदलाव
- #33
PaLM आर्किटेक्चर के ऊपर RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन। मूल रूप से PaLM के साथ ChatGPT जैसा।
★ 7,866-1पिछले 7 दिनों में स्टार का बदलाव - #34
गणित, कंप्यूटिंग और ML को अंतर्ज्ञान के साथ कवर करने वाली इस अपरंपरागत पाठ्यपुस्तक के साथ एक बेहतरीन AI/ML शोधकर्ता/इंजीनियर बनें।
★ 7,400+21पिछले 7 दिनों में स्टार का बदलाव - #35
मल्टीमॉडल machine learning में अनुसंधान विषयों के लिए रीडिंग लिस्ट
★ 6,926+1पिछले 7 दिनों में स्टार का बदलाव - #36
OpenAI o1 🍓 और रीज़निंग तकनीकों पर ध्यान केंद्रित करते हुए LLM पेपर्स, ब्लॉग्स और प्रोजेक्ट्स का एक संग्रह।
★ 6,902+3पिछले 7 दिनों में स्टार का बदलाव - #37
वास्तविक दुनिया में रीइंफोर्समेंट लर्निंग पर एक कोर्स
★ 6,566+0पिछले 7 दिनों में स्टार का बदलाव - #38
🔬 वित्तीय बाजार में शानदार LLMs और डीप लर्निंग रणनीतियों और उपकरणों की एक क्यूरेटेड सूची।
★ 6,475+23पिछले 7 दिनों में स्टार का बदलाव - #39
Mooncake, Kimi के लिए सर्विंग प्लेटफ़ॉर्म है, जो Moonshot AI द्वारा प्रदान की जाने वाली एक अग्रणी LLM सेवा है।
★ 6,470+40पिछले 7 दिनों में स्टार का बदलाव - #40
शानदार सेल्फ-सुपरवाइज्ड तरीकों की एक क्यूरेटेड सूची
★ 6,414+1पिछले 7 दिनों में स्टार का बदलाव - #41★ 6,321+8पिछले 7 दिनों में स्टार का बदलाव
- #42★ 6,018+4पिछले 7 दिनों में स्टार का बदलाव
- #43★ 5,813+5पिछले 7 दिनों में स्टार का बदलाव
- #44★ 5,712+9पिछले 7 दिनों में स्टार का बदलाव
- #45
OpenSpiel सामान्य सुदृढीकरण सीखने (reinforcement learning) और खेलों में खोज/योजना (search/planning) पर शोध के लिए वातावरण और एल्गोरिदम का एक संग्रह है।
★ 5,452+8पिछले 7 दिनों में स्टार का बदलाव - #46
STEM, कोडिंग और रोबोटिक्स शिक्षा, IoT रोबोटिक्स एप्लिकेशन, AI-संवर्धित रोबोटिक्स एप्लिकेशन सेवाओं, अनुसंधान और DIY रोबोटिक्स किट विकास के लिए एकदम सही Boston Dynamics-शैली के चार पैरों वाले रोबोट विकसित करने के लिए एक ओपन सोर्स चौपाया रोबोट पेट फ्रेमवर्क।
★ 5,246+15पिछले 7 दिनों में स्टार का बदलाव - #47★ 5,188+3पिछले 7 दिनों में स्टार का बदलाव
- #48
डीप रेनफोर्समेंट लर्निंग नैनोडग्री प्रोग्राम के लिए रिपॉजिटरी
★ 5,176+0पिछले 7 दिनों में स्टार का बदलाव - #49★ 5,141+5पिछले 7 दिनों में स्टार का बदलाव
- #50
PyTorch में शुरुआत से, चरण-दर-चरण एक रीज़निंग LLM लागू करें।
★ 5,138+49पिछले 7 दिनों में स्टार का बदलाव - #51
इस रिपॉजिटरी में Hugging Face डीप रीइन्फोर्समेंट लर्निंग कोर्स शामिल है।
★ 5,006+10पिछले 7 दिनों में स्टार का बदलाव - #52
🌟100+ ओरिजिनल LLM / RL आर्किटेक्चर डायग्राम्स📚, 'Large Model Algorithms' के लेखक द्वारा प्रस्तुत!💥 (100+ LLM/RL एल्गोरिदम मैप्स)
★ 4,838+12पिछले 7 दिनों में स्टार का बदलाव - #53
ह्यूमन फीडबैक (RLHF) के माध्यम से रिइंफोर्समेंट लर्निंग के साथ लैङ्ग्वेज मॉडल के वितरित प्रशिक्षण के लिए एक रिपो
★ 4,754-1पिछले 7 दिनों में स्टार का बदलाव - #54★ 4,705+31पिछले 7 दिनों में स्टार का बदलाव
- #55
MuJoCo का उपयोग करके भौतिकी-आधारित सिमुलेशन और Reinforcement Learning वातावरण के लिए Google DeepMind का सॉफ्टवेयर स्टैक।
★ 4,681+6पिछले 7 दिनों में स्टार का बदलाव - #56
[ICML 2021] DouZero: सेल्फ-प्ले डीप रीइन्फोर्समेंट लर्निंग के साथ DouDizhu (斗地主) में महारत हासिल करना।
★ 4,659+5पिछले 7 दिनों में स्टार का बदलाव - #57
किसी भी फ्रेमवर्क में किसी भी गेम के लिए AlphaZero पर आधारित एक स्वच्छ कार्यान्वयन + ट्यूटोरियल + Othello/Gobang/TicTacToe/Connect4 और बहुत कुछ
★ 4,512+5पिछले 7 दिनों में स्टार का बदलाव - #58
ह्यूमन फीडबैक के साथ रीइंफोर्समेंट लर्निंग संसाधनों की एक क्यूरेटेड सूची (लगातार अपडेट की जाती है)
★ 4,424+2पिछले 7 दिनों में स्टार का बदलाव - #59★ 4,359+2पिछले 7 दिनों में स्टार का बदलाव
- #60
🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।
★ 4,199+54पिछले 7 दिनों में स्टार का बदलाव