Aller au contenu principal
buildradar
Sign in
Sujet · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

Dépôts open source suivis étiquetés reinforcement-learning-from-human-feedback, triés par étoiles.

Dépôts
3
Total d'étoiles
12 426
Étoiles en moyenne
4 142
Part
0,00%

Sujets qui apparaissent souvent aux côtés de reinforcement-learning-from-human-feedback sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés reinforcement-learning-from-human-feedback.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • OpenRLHF@OpenRLHF

    Un framework d'apprentissage par renforcement agentique simple, évolutif et performant basé sur Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray et RL asynchrone)

    9 969+9Évolution des étoiles sur les 7 derniers jours
  • safe-rlhf@PKU-Alignment

    Safe RLHF : Alignement de valeur contraint via l'apprentissage par renforcement sécurisé à partir de la rétroaction humaine

    1 613+1Évolution des étoiles sur les 7 derniers jours
  • alpaca_farm@tatsu-lab

    Un framework de simulation pour le RLHF et ses alternatives. Développez votre méthode RLHF sans collecter de données humaines.

    844-1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets