Aller au contenu principal
buildradar
Sign in

CarperAI/trlx

@CarperAI

Un dépôt pour l'entraînement distribué de modèles de langage avec RLHF (Reinforcement Learning via Human Feedback).

Étoiles
4 754
Bifurcations
486
Langage
Python
Licence
MIT
Dernier push
il y a 3 ans
Pythonmachine-learningpytorchreinforcement-learning

Aucune intel associée pour le moment

Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.