Aller au contenu principal
buildradar
Se connecter

opendilab/awesome-RLHF

@opendilab

Une liste organisée de ressources sur l'apprentissage par renforcement à partir de rétroaction humaine (mise à jour continue).

Étoiles
4 424
Bifurcations
260
Langage
Licence
Apache-2.0
Dernier push
il y a 4 mois
deep-learninglarge-language-modelsdeep-reinforcement-learningreinforcement-learningrlhfhuman-feedback

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.