मुख्य सामग्री पर जाएँ
buildradar
Sign in
विषय · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।

रिपॉजिटरी
3
कुल स्टार
12,426
औसत स्टार
4,142
हिस्सा
0.00%

वे विषय जो अक्सर एक ही रिपॉजिटरी पर reinforcement-learning-from-human-feedback के साथ आते हैं।

हाल में उभरे

पिछले 90 दिनों में बनी और reinforcement-learning-from-human-feedback टैग वाली रिपॉजिटरी।

पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।

  • OpenRLHF@OpenRLHF

    Ray पर आधारित एक उपयोग में आसान, स्केलेबल और उच्च-प्रदर्शन वाला एजेंटिक RL फ्रेमवर्क (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray और Async RL)

    9,969+9पिछले 7 दिनों में स्टार का बदलाव
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Safe Reinforcement Learning from Human Feedback के माध्यम से प्रतिबंधित वैल्यू एलाइनमेंट

    1,613+1पिछले 7 दिनों में स्टार का बदलाव
  • alpaca_farm@tatsu-lab

    RLHF और विकल्पों के लिए एक सिमुलेशन फ्रेमवर्क। मानव डेटा एकत्र किए बिना अपनी RLHF विधि विकसित करें।

    844-1पिछले 7 दिनों में स्टार का बदलाव
← विषयों पर वापस