Aller au contenu principal
buildradar
Sign in

uclaml/SPPO

@uclaml

L'implémentation officielle de Self-Play Preference Optimization (SPPO)

Étoiles
589
Bifurcations
48
Langage
Python
Licence
Apache-2.0
Dernier push
il y a 2 ans
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.