NVlabs/GDPO
@NVlabsOfficial implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
स्टार
501
फ़ोर्क
36
भाषा
Python
लाइसेंस
Apache-2.0
आख़िरी push
4 माह पहले
संबंधित intel (0)
अभी कोई संबंधित intel नहीं
यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।