CarperAI/trlx
@CarperAIह्यूमन फीडबैक (RLHF) के माध्यम से रिइंफोर्समेंट लर्निंग के साथ लैङ्ग्वेज मॉडल के वितरित प्रशिक्षण के लिए एक रिपो
स्टार
4,754
फ़ोर्क
486
भाषा
Python
लाइसेंस
MIT
आख़िरी push
3 वर्ष पहले
संबंधित intel (0)
अभी कोई संबंधित intel नहीं
यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।