Zum Hauptinhalt springen
buildradar
Sign in
Thema · rlhf

rlhf

Erfasste Open-Source-Repos mit dem Tag rlhf, sortiert nach Sternen.

44 Repos
  • HALOs@ContextualAI

    Eine Bibliothek mit erweiterbaren Implementierungen von DPO, KTO, PPO, ORPO und anderen menschzentrierten Verlustfunktionen (HALOs).

    909+0Sterne-Änderung der letzten 7 Tage
  • OpenJudge@agentscope-ai

    OpenJudge: Ein einheitliches Framework für ganzheitliche Evaluierung und Qualitätsbelohnungen

    817+10Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen

    786+18Sterne-Änderung der letzten 7 Tage
  • reward-bench@allenai

    RewardBench: Das erste Evaluierungstool für Reward-Modelle.

    735+2Sterne-Änderung der letzten 7 Tage
  • Trinity-RFT@agentscope-ai

    Trinity-RFT ist ein universelles, flexibles und skalierbares Framework für das Reinforcement Fine-Tuning (RFT) von Large Language Models (LLM).

    698+4Sterne-Änderung der letzten 7 Tage
  • oat@sail-sg

    OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.

    669-1Sterne-Änderung der letzten 7 Tage
  • Open-AgentRL@Gen-Verse

    RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: Open-Source-RL für LLMs und Agentenszenarien

    632+7Sterne-Änderung der letzten 7 Tage
  • LLamaTuner@jianzhnie

    Einfaches und effizientes Finetuning von LLMs. (Unterstützt LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)

    621+0Sterne-Änderung der letzten 7 Tage
  • Relax@redai-studio

    Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.

    590+7Sterne-Änderung der letzten 7 Tage
  • SPPO@uclaml

    Die offizielle Implementierung von Self-Play Preference Optimization (SPPO).

    589-1Sterne-Änderung der letzten 7 Tage
  • TextRL@voidful

    Implementierung von ChatGPT RLHF (Reinforcement Learning with Human Feedback) auf jedem Generierungsmodell in Huggingfaces Transformer (blommz-176B/bloom/gpt/bart/T5/MetaICL)

    564+0Sterne-Änderung der letzten 7 Tage
  • Online-RLHF@RLHFlow

    Ein Rezept für Online-RLHF und iteratives Online-DPO.

    544+0Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Sammlung von Papern und Ressourcen zu On-Policy Distillation für Large Language Models.

    533+5Sterne-Änderung der letzten 7 Tage
  • dLLM-RL@Gen-Verse

    [ICLR 2026] Offizieller Code für TraceRL: Revolutionierung des Post-Trainings für Diffusion LLMs, die Basis der SOTA TraDo-Serie.

    520+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen