NVlabs/GDPO
@NVlabsOfficial implementation of GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
スター
501
フォーク
36
言語
Python
ライセンス
Apache-2.0
最終プッシュ
4 か月前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。