मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · rlhf

rlhf

rlhf टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

44 रिपॉजिटरी
  • HALOs@ContextualAI

    DPO, KTO, PPO, ORPO और अन्य ह्यूमन-अवेयर लॉस फंक्शन्स (HALOs) के विस्तार योग्य कार्यान्वयन वाली एक लाइब्रेरी।

    909-1पिछले 7 दिनों में स्टार का बदलाव
  • OpenJudge@agentscope-ai

    OpenJudge: समग्र मूल्यांकन और गुणवत्ता पुरस्कारों के लिए एक एकीकृत ढांचा

    820+14पिछले 7 दिनों में स्टार का बदलाव
  • लार्ज लैंग्वेज मॉडल्स के ऑन-पॉलिसी डिस्टिलेशन (OPD) के लिए पेपर्स, तकनीकी रिपोर्ट्स, फ्रेमवर्क्स और टूल्स का एक क्यूरेटेड संग्रह

    794+31पिछले 7 दिनों में स्टार का बदलाव
  • reward-bench@allenai

    RewardBench: रिवॉर्ड मॉडल के लिए पहला मूल्यांकन उपकरण।

    735+2पिछले 7 दिनों में स्टार का बदलाव
  • Trinity-RFT@agentscope-ai

    Trinity-RFT लार्ज लैंग्वेज मॉडल्स (LLM) के रीइन्फोर्समेंट फाइन-ट्यूनिंग (RFT) के लिए डिज़ाइन किया गया एक सामान्य-उद्देश्य, लचीला और स्केलेबल फ्रेमवर्क है।

    698+2पिछले 7 दिनों में स्टार का बदलाव
  • oat@sail-sg

    🌾 OAT: LLM ऑनलाइन अलाइनमेंट के लिए एक शोध-अनुकूल फ़्रेमवर्क, जिसमें रीइन्फोर्समेंट लर्निंग, प्रेफरेंस लर्निंग आदि शामिल हैं।

    669-1पिछले 7 दिनों में स्टार का बदलाव
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) और AutoTool (ICML 2026), DemyAgent: LLMs और एजेंटिक परिदृश्यों के लिए ओपन-सोर्स RL।

    634+9पिछले 7 दिनों में स्टार का बदलाव
  • LLamaTuner@jianzhnie

    LLMs की आसान और कुशल फाइन-ट्यूनिंग। (LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon समर्थित)

    621+0पिछले 7 दिनों में स्टार का बदलाव
  • Relax@redai-studio

    बड़े पैमाने पर ऑम्नी-मोडल पोस्ट-ट्रेनिंग के लिए एक एसिंक्रोनस रिइंफोर्समेंट लर्निंग इंजन।

    592+11पिछले 7 दिनों में स्टार का बदलाव
  • SPPO@uclaml

    Self-Play Preference Optimization (SPPO) का आधिकारिक इम्प्लीमेंटेशन

    589+0पिछले 7 दिनों में स्टार का बदलाव
  • TextRL@voidful

    huggingface के ट्रांसफॉर्मर (blommz-176B/bloom/gpt/bart/T5/MetaICL) में किसी भी जनरेशन मॉडल पर ChatGPT RLHF (Reinforcement Learning with Human Feedback) का कार्यान्वयन

    564+0पिछले 7 दिनों में स्टार का बदलाव
  • Online-RLHF@RLHFlow

    ऑनलाइन RLHF और ऑनलाइन इटरेशन DPO के लिए एक रेसिपी।

    544+0पिछले 7 दिनों में स्टार का बदलाव
  • लार्ज लैंग्वेज मॉडल्स के लिए ऑन-पॉलिसी डिस्टिलेशन पर शोध पत्रों और संसाधनों का एक क्यूरेटेड संग्रह।

    535+10पिछले 7 दिनों में स्टार का बदलाव
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL के लिए आधिकारिक कोड: Diffusion LLMs के लिए पोस्ट-ट्रेनिंग में क्रांति, जो SOTA TraDo सीरीज़ को संचालित करता है।

    520+1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस