मुख्य सामग्री पर जाएँ
buildradar
Sign in

PKU-Alignment/safe-rlhf

@PKU-Alignment

Safe RLHF: Safe Reinforcement Learning from Human Feedback के माध्यम से प्रतिबंधित वैल्यू एलाइनमेंट

स्टार
1,613
फ़ोर्क
134
भाषा
Python
लाइसेंस
Apache-2.0
आख़िरी push
9 माह पहले
Pythonllmgptlarge-language-modelstransformerllmsreinforcement-learningdeepspeedtransformersai-safetyllamadatasetsrlhfvicunasafetysafe-reinforcement-learningalpacareinforcement-learning-from-human-feedbackbeaversafe-reinforcement-learning-from-human-feedbacksafe-rlhf

अभी कोई संबंधित intel नहीं

यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।