rlhf
Repositori open source terpantau bertanda rlhf, diurutkan berdasarkan bintang.
- #31
Pustaka dengan implementasi yang dapat diperluas dari DPO, KTO, PPO, ORPO, dan fungsi loss yang sadar manusia (HALO) lainnya.
★ 909-1Perubahan bintang dalam 7 hari terakhir - #32
OpenJudge: Kerangka Kerja Terpadu untuk Evaluasi Holistik dan Quality Rewards
★ 820+14Perubahan bintang dalam 7 hari terakhir - #33
Koleksi makalah, laporan teknis, framework, and alat pilihan untuk on-policy distillation (OPD) pada model bahasa besar
★ 794+31Perubahan bintang dalam 7 hari terakhir - #34
RewardBench: alat evaluasi pertama untuk model reward.
★ 735+2Perubahan bintang dalam 7 hari terakhir - #35
Trinity-RFT adalah kerangka kerja serbaguna, fleksibel, dan skalabel yang dirancang untuk reinforcement fine-tuning (RFT) pada large language models (LLM).
★ 698+2Perubahan bintang dalam 7 hari terakhir - #36
OAT: Framework yang ramah riset untuk penyelarasan daring LLM, mencakup reinforcement learning, preference learning, dan lainnya.
★ 669-1Perubahan bintang dalam 7 hari terakhir - #37
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL Open-Source untuk LLM dan Skenario Agen
★ 634+9Perubahan bintang dalam 7 hari terakhir - #38
Finetuning LLM yang mudah dan efisien. (Mendukung LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon) Pelatihan dan deployment kuantisasi efisien untuk model bahasa besar.
★ 621+0Perubahan bintang dalam 7 hari terakhir - #39
Mesin Reinforcement Learning Asinkron untuk Post-Training Omni-Modal berskala besar.
★ 592+11Perubahan bintang dalam 7 hari terakhir - #40★ 589+0Perubahan bintang dalam 7 hari terakhir
- #41
Implementasi ChatGPT RLHF (Reinforcement Learning with Human Feedback) pada model bangkitan apa pun di transformer huggingface (bloomz-176B/bloom/gpt/bart/T5/MetaICL)
★ 564+0Perubahan bintang dalam 7 hari terakhir - #42
Resep untuk RLHF online dan DPO iteratif online.
★ 544+0Perubahan bintang dalam 7 hari terakhir - #43
Koleksi pilihan makalah dan sumber daya tentang On-Policy Distillation untuk Large Language Models.
★ 535+10Perubahan bintang dalam 7 hari terakhir - #44
[ICLR 2026] Kode resmi untuk TraceRL: Revolusi pasca-pelatihan untuk Diffusion LLMs, yang mendukung seri SOTA TraDo.
★ 520+1Perubahan bintang dalam 7 hari terakhir