reinforcement-learning-from-human-feedback
Dépôts open source suivis étiquetés reinforcement-learning-from-human-feedback, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de reinforcement-learning-from-human-feedback sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés reinforcement-learning-from-human-feedback.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Un framework d'apprentissage par renforcement agentique simple, évolutif et performant basé sur Ray (PPO, DAPO, REINFORCE++, VLM, TIS, vLLM, Ray et RL asynchrone)
★ 9 969+9Évolution des étoiles sur les 7 derniers jours - #2
Safe RLHF : Alignement de valeur contraint via l'apprentissage par renforcement sécurisé à partir de la rétroaction humaine
★ 1 613+1Évolution des étoiles sur les 7 derniers jours - #3
Un framework de simulation pour le RLHF et ses alternatives. Développez votre méthode RLHF sans collecter de données humaines.
★ 844-1Évolution des étoiles sur les 7 derniers jours