policy-gradient/GRPO-Zero
@policy-gradient從頭實作 DeepSeek R1 的 GRPO 演算法
星數
1,898
Fork 數
99
語言
Python
授權
Apache-2.0
最後推送
1 年前
相關情報(0)
還沒有相關情報
radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。
從頭實作 DeepSeek R1 的 GRPO 演算法
radar 追蹤的來源裡還沒有出現過這個 repo。收集器照排程執行——等它涵蓋到這個 repo 再回來看看。