Aller au contenu principal
buildradar
Sign in

princeton-nlp/SimPO

@princeton-nlp

[NeurIPS 2024] SimPO : Optimisation simple des préférences avec une récompense sans référence

Étoiles
959
Bifurcations
78
Langage
Python
Licence
MIT
Dernier push
il y a 2 ans
Pythonlarge-language-modelsalignmentrlhfpreference-alignment

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.