grpo
grpo टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर grpo के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और grpo टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) और 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) के लिए PEFT या Full-parameter का उपयोग करके CPT/SFT/DPO/GRPO करें (AAAI 2025)।
★ 15,488+116पिछले 7 दिनों में स्टार का बदलाव - #2
किसी भी AI मॉडल के लिए AI अनुसंधान और इंजीनियरिंग कौशल की व्यापक ओपन-सोर्स लाइब्रेरी। कौशल को पैकेज करें और आपका claude code/codex/gemini एजेंट पूर्ण क्षमता के साथ एक AI अनुसंधान एजेंट बन जाएगा। Orchestra Research द्वारा अनुरक्षित।
★ 12,256+176पिछले 7 दिनों में स्टार का बदलाव - #3
Agent Reinforcement Trainer: GRPO का उपयोग करके वास्तविक दुनिया के कार्यों के लिए मल्टी-स्टेप एजेंटों को प्रशिक्षित करें। अपने एजेंटों को ऑन-द-जॉब ट्रेनिंग दें। Qwen3.6, GPT-OSS, Llama और अन्य के लिए रीइन्फोर्समेंट लर्निंग।
★ 10,689+24पिछले 7 दिनों में स्टार का बदलाव - #4
https://adongwanai.github.io/AgentGuide | AI एजेंट विकास गाइड | LangGraph व्यावहारिक | उन्नत RAG | बड़े मॉडल में करियर बदलना | बड़े मॉडल साक्षात्कार | एल्गोरिदम इंजीनियर | साक्षात्कार प्रश्न बैंक | सुदृढीकरण सीखना | डेटा संश्लेषण
★ 9,116+273पिछले 7 दिनों में स्टार का बदलाव - #5★ 6,018+3पिछले 7 दिनों में स्टार का बदलाव
- #6
OpenClaw-RL: बस बात करके किसी भी एजेंट को प्रशिक्षित करें
★ 5,665+10पिछले 7 दिनों में स्टार का बदलाव - #7
PyTorch में शुरुआत से, चरण-दर-चरण एक रीज़निंग LLM लागू करें।
★ 5,138+67पिछले 7 दिनों में स्टार का बदलाव - #8
🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।
★ 4,199+69पिछले 7 दिनों में स्टार का बदलाव - #9
Skywork-R1V, Skywork AI द्वारा विकसित एक उन्नत मल्टीमॉडल AI मॉडल श्रृंखला है, जो विजन-लैंग्वेज रीज़निंग में विशेषज्ञता रखती है।
★ 3,168+1पिछले 7 दिनों में स्टार का बदलाव - #10
verl-agent, veRL का एक विस्तार है, जिसे RL के माध्यम से LLM/VLM एजेंट्स को प्रशिक्षित करने के लिए डिज़ाइन किया गया है।
★ 2,274+18पिछले 7 दिनों में स्टार का बदलाव - #11
[ECCV 2026] MixGRPO: मिक्स्ड ODE-SDE के साथ फ्लो-आधारित GRPO दक्षता को अनलॉक करना
★ 1,177+0पिछले 7 दिनों में स्टार का बदलाव - #12
एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।
★ 1,060+1पिछले 7 दिनों में स्टार का बदलाव - #13★ 949+56पिछले 7 दिनों में स्टार का बदलाव
- #14
🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।
★ 669-1पिछले 7 दिनों में स्टार का बदलाव - #15
[NeurIPS 2025] AutoVLA: एडेप्टिव रीजनिंग और रीइन्फोर्समेंट फाइन-ट्यूनिंग के साथ एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक विजन-लैंग्वेज-एक्शन मॉडल
★ 639+5पिछले 7 दिनों में स्टार का बदलाव - #16
RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।
★ 632+7पिछले 7 दिनों में स्टार का बदलाव - #17
2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं
★ 623+0पिछले 7 दिनों में स्टार का बदलाव - #18
वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची
★ 591+2पिछले 7 दिनों में स्टार का बदलाव - #19
बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।
★ 587+7पिछले 7 दिनों में स्टार का बदलाव - #20
Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
★ 501—पिछले 7 दिनों में स्टार का बदलाव