跳到主要內容
buildradar
登入

NVlabs/GDPO

@NVlabs

Official implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

星數
502
Fork 數
36
語言
Python
授權
Apache-2.0
最後推送
4 個月前
Pythonllmrlagentic-aireasoningverlgrpotrl

還沒有相關情報

radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。