ppo
ppo टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर ppo के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और ppo टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
रिइनफोर्समेंट लर्निंग चीनी ट्यूटोरियल (मशरूम बुक 🍄), ऑनलाइन पढ़ने का पता: https://datawhalechina.github.io/easy-rl/
★ 14,600+8पिछले 7 दिनों में स्टार का बदलाव - #2★ 10,955+10पिछले 7 दिनों में स्टार का बदलाव
- #3
अनुसंधान-अनुकूल सुविधाओं (PPO, DQN, C51, DDPG, TD3, SAC, PPG) के साथ डीप रीइंफोर्समेंट लर्निंग एल्गोरिदम का उच्च-गुणवत्ता वाला सिंगल-फ़ाइल कार्यान्वयन
★ 10,358+19पिछले 7 दिनों में स्टार का बदलाव - #4
सरल सुदृढीकरण शिक्षण ट्यूटोरियल, मोफान पाइथन चीनी एआई शिक्षण
★ 9,508-2पिछले 7 दिनों में स्टार का बदलाव - #5
डीप रेनफोर्समेंट लर्निंग नैनोडग्री प्रोग्राम के लिए रिपॉजिटरी
★ 5,176+0पिछले 7 दिनों में स्टार का बदलाव - #6★ 4,359+2पिछले 7 दिनों में स्टार का बदलाव
- #7
🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।
★ 4,199+54पिछले 7 दिनों में स्टार का बदलाव - #8
FinRL-X: मात्रात्मक व्यापार के लिए एक AI-नेटिव मॉड्यूलर बुनियादी ढांचा
★ 3,657+50पिछले 7 दिनों में स्टार का बदलाव - #9★ 3,452+3पिछले 7 दिनों में स्टार का बदलाव
- #10
लोकप्रिय Deep Reinforcement Learning (DRL) एल्गोरिदम का स्वच्छ, मजबूत और एकीकृत PyTorch कार्यान्वयन (Q-learning, Duel DDQN, PER, C51, Noisy DQN, PPO, DDPG, TD3, SAC, ASL)
★ 3,440+3पिछले 7 दिनों में स्टार का बदलाव - #11
PyTorch में क्लिप्ड ऑब्जेक्टिव Proximal Policy Optimization (PPO) का न्यूनतम कार्यान्वयन
★ 2,381+6पिछले 7 दिनों में स्टार का बदलाव - #12★ 2,088+1पिछले 7 दिनों में स्टार का बदलाव
- #13
PyTorch में मॉड्यूलर डीप रिइंफोर्समेंट लर्निंग फ्रेमवर्क। पुस्तक "फाउंडेशन ऑफ डीप रिइंफोर्समेंट लर्निंग" की सह-पुस्तकालय (कंपैनियन लाइब्रेरी)।
★ 1,362+0पिछले 7 दिनों में स्टार का बदलाव - #14
एक सरल और अच्छी तरह से स्टाइल किया गया PPO कार्यान्वयन। मेरी Medium श्रृंखला पर आधारित: https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8
★ 1,269+1पिछले 7 दिनों में स्टार का बदलाव - #15
रीइंफोर्समेंट लर्निंग का उपयोग करके लोकोमोशन के लिए ह्यूमनॉइड रोबोट को प्रशिक्षित करना
★ 1,210+3पिछले 7 दिनों में स्टार का बदलाव - #16★ 1,102+2पिछले 7 दिनों में स्टार का बदलाव
- #17★ 1,083+2पिछले 7 दिनों में स्टार का बदलाव
- #18
DPO, KTO, PPO, ORPO और अन्य ह्यूमन-अवेयर लॉस फंक्शन्स (HALOs) के विस्तार योग्य कार्यान्वयन वाली एक लाइब्रेरी।
★ 909-1पिछले 7 दिनों में स्टार का बदलाव - #19
RL स्टार्टर फ़ाइलें ताकि बिना कोई कोड लिखे तुरंत एजेंट को ट्रेन, विज़ुअलाइज़ और इवैल्यूएट किया जा सके।
★ 728+0पिछले 7 दिनों में स्टार का बदलाव - #20
इस रिपॉजिटरी में क्लासिक डीप रीइन्फोर्समेंट लर्निंग एल्गोरिदम के अधिकांश PyTorch कार्यान्वयन शामिल हैं, जिनमें DQN, DDQN, Dueling Network, DDPG, SAC, A2C, PPO, TRPO शामिल हैं। (अन्य एल्गोरिदम पर काम जारी है)
★ 697+1पिछले 7 दिनों में स्टार का बदलाव - #21
🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।
★ 669-1पिछले 7 दिनों में स्टार का बदलाव - #22
डीप रीइन्फोर्समेंट लर्निंग एजेंट्स बनाने के लिए एक PyTorch लाइब्रेरी।
★ 657+0पिछले 7 दिनों में स्टार का बदलाव - #23
RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।
★ 632+9पिछले 7 दिनों में स्टार का बदलाव - #24
LLMs की आसान और कुशल फाइन-ट्यूनिंग। (LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon समर्थित)
★ 621+0पिछले 7 दिनों में स्टार का बदलाव - #25
वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची
★ 591+1पिछले 7 दिनों में स्टार का बदलाव - #26
ऑटोनॉमस ड्राइविंग (Carla) में डीप रीइन्फोर्समेंट लर्निंग (PPO) [शून्य से]
★ 563-1पिछले 7 दिनों में स्टार का बदलाव