मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · grpo

grpo

grpo टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
20
कुल स्टार
81,418
औसत स्टार
4,071
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर grpo के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और grpo टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • ms-swift@modelscope

    600+ LLM (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) और 300+ MLLM (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) के लिए PEFT या Full-parameter का उपयोग करके CPT/SFT/DPO/GRPO करें (AAAI 2025)।

    15,488+116पिछले 7 दिनों में स्टार का बदलाव
  • AI-Research-SKILLs@Orchestra-Research

    किसी भी AI मॉडल के लिए AI अनुसंधान और इंजीनियरिंग कौशल की व्यापक ओपन-सोर्स लाइब्रेरी। कौशल को पैकेज करें और आपका claude code/codex/gemini एजेंट पूर्ण क्षमता के साथ एक AI अनुसंधान एजेंट बन जाएगा। Orchestra Research द्वारा अनुरक्षित।

    12,256+176पिछले 7 दिनों में स्टार का बदलाव
  • ART@OpenPipe

    Agent Reinforcement Trainer: GRPO का उपयोग करके वास्तविक दुनिया के कार्यों के लिए मल्टी-स्टेप एजेंटों को प्रशिक्षित करें। अपने एजेंटों को ऑन-द-जॉब ट्रेनिंग दें। Qwen3.6, GPT-OSS, Llama और अन्य के लिए रीइन्फोर्समेंट लर्निंग।

    10,689+24पिछले 7 दिनों में स्टार का बदलाव
  • AgentGuide@adongwanai

    https://adongwanai.github.io/AgentGuide | AI एजेंट विकास गाइड | LangGraph व्यावहारिक | उन्नत RAG | बड़े मॉडल में करियर बदलना | बड़े मॉडल साक्षात्कार | एल्गोरिदम इंजीनियर | साक्षात्कार प्रश्न बैंक | सुदृढीकरण सीखना | डेटा संश्लेषण

    9,116+273पिछले 7 दिनों में स्टार का बदलाव
  • VLM-R1@om-ai-lab

    Reinforced VLM के साथ विजुअल अंडरस्टैंडिंग को हल करें

    6,018+3पिछले 7 दिनों में स्टार का बदलाव
  • OpenClaw-RL@Gen-Verse

    OpenClaw-RL: बस बात करके किसी भी एजेंट को प्रशिक्षित करें

    5,665+10पिछले 7 दिनों में स्टार का बदलाव
  • reasoning-from-scratch@rasbt

    PyTorch में शुरुआत से, चरण-दर-चरण एक रीज़निंग LLM लागू करें।

    5,138+67पिछले 7 दिनों में स्टार का बदलाव
  • hands-on-modern-rl@walkinglabs

    🚀 बुनियादी RL अवधारणाओं से LLM संरेखण, RLVR, और उन्नत एजेंटिक प्रणालियों के बीच की खाई को पाटने वाला एक ओपन-सोर्स, व्यावहारिक पाठ्यक्रम।

    4,199+69पिछले 7 दिनों में स्टार का बदलाव
  • Skywork-R1V@SkyworkAI

    Skywork-R1V, Skywork AI द्वारा विकसित एक उन्नत मल्टीमॉडल AI मॉडल श्रृंखला है, जो विजन-लैंग्वेज रीज़निंग में विशेषज्ञता रखती है।

    3,168+1पिछले 7 दिनों में स्टार का बदलाव
  • verl-agent@langfengQ

    verl-agent, veRL का एक विस्तार है, जिसे RL के माध्यम से LLM/VLM एजेंट्स को प्रशिक्षित करने के लिए डिज़ाइन किया गया है।

    2,274+18पिछले 7 दिनों में स्टार का बदलाव
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO: मिक्स्ड ODE-SDE के साथ फ्लो-आधारित GRPO दक्षता को अनलॉक करना

    1,177+0पिछले 7 दिनों में स्टार का बदलाव
  • judgeval@JudgmentLabs

    एजेंटों के लिए निरंतर-सुधार स्टैक। हमारा पर्यावरण डेटा और मूल्यांकन एजेंट सुधार और निगरानी को शक्ति प्रदान करते हैं।

    1,060+1पिछले 7 दिनों में स्टार का बदलाव
  • verl-omni@verl-project

    डिफ्यूजन और ओम्नी मॉडल के लिए मल्टीमॉडल RL प्रशिक्षण फ्रेमवर्क

    949+56पिछले 7 दिनों में स्टार का बदलाव
  • oat@sail-sg

    🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।

    669-1पिछले 7 दिनों में स्टार का बदलाव
  • AutoVLA@ucla-mobility

    [NeurIPS 2025] AutoVLA: एडेप्टिव रीजनिंग और रीइन्फोर्समेंट फाइन-ट्यूनिंग के साथ एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक विजन-लैंग्वेज-एक्शन मॉडल

    639+5पिछले 7 दिनों में स्टार का बदलाव
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।

    632+7पिछले 7 दिनों में स्टार का बदलाव
  • VisualThinker-R1-Zero@turningpoint-ai

    2B Model पर मल्टीमॉडल “आहा मोमेंट” का पता लगाएं

    623+0पिछले 7 दिनों में स्टार का बदलाव
  • वीडियो जनरेशन के लिए रीइन्फोर्समेंट लर्निंग पर शोध पत्रों की एक क्यूरेटेड सूची

    591+2पिछले 7 दिनों में स्टार का बदलाव
  • Relax@redai-studio

    बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।

    587+7पिछले 7 दिनों में स्टार का बदलाव
  • GDPO@NVlabs

    Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

    501पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस