मुख्य सामग्री पर जाएँ
buildradar
Sign in

CarperAI/trlx

@CarperAI

ह्यूमन फीडबैक (RLHF) के माध्यम से रिइंफोर्समेंट लर्निंग के साथ लैङ्ग्वेज मॉडल के वितरित प्रशिक्षण के लिए एक रिपो

स्टार
4,754
फ़ोर्क
486
भाषा
Python
लाइसेंस
MIT
आख़िरी push
3 वर्ष पहले
Pythonmachine-learningpytorchreinforcement-learning

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।