Aller au contenu principal
buildradar
Sign in
Sujet · rlhf

rlhf

Dépôts open source suivis étiquetés rlhf, triés par étoiles.

44 dépôts
  • HALOs@ContextualAI

    Une bibliothèque avec des implémentations extensibles de DPO, KTO, PPO, ORPO et d'autres fonctions de perte centrées sur l'humain (HALO).

    909-1Évolution des étoiles sur les 7 derniers jours
  • OpenJudge@agentscope-ai

    OpenJudge : Un framework unifié pour l'évaluation holistique et les récompenses de qualité.

    819+12Évolution des étoiles sur les 7 derniers jours
  • Collection organisée d'articles, de rapports techniques, de frameworks et d'outils pour la distillation on-policy (OPD) des grands modèles de langage

    791+26Évolution des étoiles sur les 7 derniers jours
  • reward-bench@allenai

    RewardBench : le premier outil d'évaluation pour les modèles de récompense.

    735+2Évolution des étoiles sur les 7 derniers jours
  • Trinity-RFT@agentscope-ai

    Trinity-RFT est un framework polyvalent, flexible et évolutif conçu pour l'affinage par renforcement (RFT) des grands modèles de langage (LLM).

    698+2Évolution des étoiles sur les 7 derniers jours
  • oat@sail-sg

    🌾 OAT : un cadre de recherche convivial pour l'alignement en ligne des LLM, incluant l'apprentissage par renforcement, l'apprentissage des préférences, etc.

    669-1Évolution des étoiles sur les 7 derniers jours
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent : RL open source pour les LLM et les scénarios d'agents

    632+9Évolution des étoiles sur les 7 derniers jours
  • LLamaTuner@jianzhnie

    Fine-tuning simple et efficace de LLM (prise en charge de LLaMA, LLaMA2, LLaMA3, Qwen, Baichuan, GLM, Falcon). Entraînement et déploiement de quantification efficace pour grands modèles.

    621+0Évolution des étoiles sur les 7 derniers jours
  • Relax@redai-studio

    Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle

    591+10Évolution des étoiles sur les 7 derniers jours
  • SPPO@uclaml

    L'implémentation officielle de Self-Play Preference Optimization (SPPO)

    589+0Évolution des étoiles sur les 7 derniers jours
  • TextRL@voidful

    Implémentation de ChatGPT RLHF (Reinforcement Learning with Human Feedback) sur n'importe quel modèle de génération dans les transformers de Hugging Face (bloomz-176B/bloom/gpt/bart/T5/MetaICL)

    564+0Évolution des étoiles sur les 7 derniers jours
  • Online-RLHF@RLHFlow

    Une recette pour le RLHF en ligne et le DPO itératif en ligne.

    544+0Évolution des étoiles sur les 7 derniers jours
  • Une collection organisée d'articles et de ressources sur la distillation en politique (On-Policy Distillation) pour les grands modèles de langage.

    534+9Évolution des étoiles sur les 7 derniers jours
  • dLLM-RL@Gen-Verse

    [ICLR 2026] Code officiel pour TraceRL : révolutionner le post-entraînement pour les LLM de diffusion, propulsant la série SOTA TraDo.

    520+1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets