rlhf
Dépôts open source suivis étiquetés rlhf, triés par étoiles.
- #31
Une bibliothèque avec des implémentations extensibles de DPO, KTO, PPO, ORPO et d'autres fonctions de perte centrées sur l'humain (HALO).
★ 909-1Évolution des étoiles sur les 7 derniers jours - #32
OpenJudge : Un framework unifié pour l'évaluation holistique et les récompenses de qualité.
★ 819+12Évolution des étoiles sur les 7 derniers jours - #33
Collection organisée d'articles, de rapports techniques, de frameworks et d'outils pour la distillation on-policy (OPD) des grands modèles de langage
★ 791+26Évolution des étoiles sur les 7 derniers jours - #34
RewardBench : le premier outil d'évaluation pour les modèles de récompense.
★ 735+2Évolution des étoiles sur les 7 derniers jours - #35
Trinity-RFT est un framework polyvalent, flexible et évolutif conçu pour l'affinage par renforcement (RFT) des grands modèles de langage (LLM).
★ 698+2Évolution des étoiles sur les 7 derniers jours - #36
🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.
★ 669-1Évolution des étoiles sur les 7 derniers jours - #37
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent : RL open source pour les LLM et les scénarios d'agents
★ 632+9Évolution des étoiles sur les 7 derniers jours - #38
Fine-tuning simple et efficace de LLM (prise en charge de LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Entraînement et déploiement de quantification efficace pour grands modèles.
★ 621+0Évolution des étoiles sur les 7 derniers jours - #39
Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle
★ 591+10Évolution des étoiles sur les 7 derniers jours - #40★ 589+0Évolution des étoiles sur les 7 derniers jours
- #41
Implémentation de ChatGPT RLHF (Reinforcement Learning with Human Feedback) sur n'importe quel modèle de génération dans les transformers de Hugging Face (bloomz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Évolution des étoiles sur les 7 derniers jours - #42
Une recette pour le RLHF en ligne et le DPO itératif en ligne.
★ 544+0Évolution des étoiles sur les 7 derniers jours - #43
Une collection organisée d'articles et de ressources sur la distillation en politique (On-Policy Distillation) pour les grands modèles de langage.
★ 534+9Évolution des étoiles sur les 7 derniers jours - #44
[ICLR 2026] Code officiel pour TraceRL : révolutionner le post-entraînement pour les LLM de diffusion, propulsant la série SOTA TraDo.
★ 520+1Évolution des étoiles sur les 7 derniers jours