विषय · reinforcement-learning-from-human-feedback
reinforcement-learning-from-human-feedback
reinforcement-learning-from-human-feedback टैग वाली ट्रैक की गई ओपन सोर्स रिपॉजिटरी, स्टार के हिसाब से क्रमबद्ध।
रिपॉजिटरी
3
कुल स्टार
12,426
औसत स्टार
4,142
हिस्सा
0.00%
मिलते-जुलते विषय
वे विषय जो अक्सर एक ही रिपॉजिटरी पर reinforcement-learning-from-human-feedback के साथ आते हैं।
हाल में उभरे
पिछले 90 दिनों में बनी और reinforcement-learning-from-human-feedback टैग वाली रिपॉजिटरी।
पिछले 90 दिनों में इस विषय के टैग वाली कोई नई रिपॉजिटरी नहीं आई।
- #1
Ray पर आधारित एक उपयोग में आसान, स्केलेबल और उच्च-प्रदर्शन वाला एजेंटिक RL फ्रेमवर्क (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray और Async RL)
★ 9,969+9पिछले 7 दिनों में स्टार का बदलाव - #2
Safe RLHF: Safe Reinforcement Learning from Human Feedback के माध्यम से प्रतिबंधित वैल्यू एलाइनमेंट
★ 1,613+1पिछले 7 दिनों में स्टार का बदलाव - #3
RLHF और विकल्पों के लिए एक सिमुलेशन फ्रेमवर्क। मानव डेटा एकत्र किए बिना अपनी RLHF विधि विकसित करें।
★ 844-1पिछले 7 दिनों में स्टार का बदलाव