跳到主要内容
buildradar
Sign in

uclaml/SPPO

@uclaml

自我博弈偏好优化 (SPPO) 的官方实现

星数
589
Fork 数
48
语言
Python
许可
Apache-2.0
最后推送
2年前
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

还没有相关情报

radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。