rlhf
Erfasste Open-Source-Repos mit dem Tag rlhf, sortiert nach Sternen.
- #31
Eine Bibliothek mit erweiterbaren Implementierungen von DPO, KTO, PPO, ORPO und anderen menschzentrierten Verlustfunktionen (HALOs).
★ 909+0Sterne-Änderung der letzten 7 Tage - #32
OpenJudge: Ein einheitliches Framework für ganzheitliche Evaluierung und Qualitätsbelohnungen
★ 817+10Sterne-Änderung der letzten 7 Tage - #33
Eine kuratierte Sammlung von Artikeln, technischen Berichten, Frameworks und Tools zur On-Policy-Distillation (OPD) von großen Sprachmodellen
★ 786+18Sterne-Änderung der letzten 7 Tage - #34
RewardBench: Das erste Evaluierungstool für Reward-Modelle.
★ 735+2Sterne-Änderung der letzten 7 Tage - #35
Trinity-RFT ist ein universelles, flexibles und skalierbares Framework für das Reinforcement Fine-Tuning (RFT) von Large Language Models (LLM).
★ 698+4Sterne-Änderung der letzten 7 Tage - #36
OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.
★ 669-1Sterne-Änderung der letzten 7 Tage - #37
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: Open-Source-RL für LLMs und Agentenszenarien
★ 632+7Sterne-Änderung der letzten 7 Tage - #38
Einfaches und effizientes Finetuning von LLMs. (Unterstützt LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)
★ 621+0Sterne-Änderung der letzten 7 Tage - #39
Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.
★ 590+7Sterne-Änderung der letzten 7 Tage - #40★ 589-1Sterne-Änderung der letzten 7 Tage
- #41
Implementierung von ChatGPT RLHF (Reinforcement Learning with Human Feedback) auf jedem Generierungsmodell in Huggingfaces Transformer (blommz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Sterne-Änderung der letzten 7 Tage - #42
Ein Rezept für Online-RLHF und iteratives Online-DPO.
★ 544+0Sterne-Änderung der letzten 7 Tage - #43
Eine kuratierte Sammlung von Papern und Ressourcen zu On-Policy Distillation für Large Language Models.
★ 533+5Sterne-Änderung der letzten 7 Tage - #44
[ICLR 2026] Offizieller Code für TraceRL: Revolutionierung des Post-Trainings für Diffusion LLMs, die Basis der SOTA TraDo-Serie.
★ 520+1Sterne-Änderung der letzten 7 Tage