rlhf
Các kho mã nguồn mở đang theo dõi được gắn thẻ rlhf, sắp xếp theo số sao.
- #31
Thư viện cung cấp các cài đặt mở rộng cho DPO, KTO, PPO, ORPO và các hàm mất mát nhận thức con người (HALOs) khác.
★ 909-1Thay đổi số sao trong 7 ngày qua - #32
OpenJudge: Một khung thống nhất để đánh giá toàn diện và khen thưởng chất lượng
★ 817+12Thay đổi số sao trong 7 ngày qua - #33
Bộ sưu tập các bài báo, báo cáo kỹ thuật, khung làm việc và công cụ được tuyển chọn cho việc chưng cất theo chính sách (OPD) của các mô hình ngôn ngữ lớn
★ 786+26Thay đổi số sao trong 7 ngày qua - #34
RewardBench: công cụ đánh giá đầu tiên cho các mô hình phần thưởng.
★ 735+2Thay đổi số sao trong 7 ngày qua - #35
Trinity-RFT là một framework đa năng, linh hoạt và có khả năng mở rộng, được thiết kế để tinh chỉnh tăng cường (RFT) các mô hình ngôn ngữ lớn (LLM).
★ 698+2Thay đổi số sao trong 7 ngày qua - #36
🌾 OAT: Khung nghiên cứu thân thiện cho việc căn chỉnh trực tuyến LLM, bao gồm học tăng cường, học ưu tiên, v.v.
★ 669-1Thay đổi số sao trong 7 ngày qua - #37
RLAnything (ICML 2026) & AutoTool (ICML 2026), DemyAgent: RL mã nguồn mở cho LLM và các kịch bản tác nhân.
★ 632+9Thay đổi số sao trong 7 ngày qua - #38
Tinh chỉnh LLM dễ dàng và hiệu quả (Hỗ trợ LLama, LLama2, LLama3, Qwen, Baichuan, GLM, Falcon)
★ 621+0Thay đổi số sao trong 7 ngày qua - #39
Một công cụ học tăng cường bất đồng bộ cho đào tạo hậu kỳ đa phương thức ở quy mô lớn
★ 590+10Thay đổi số sao trong 7 ngày qua - #40★ 589+0Thay đổi số sao trong 7 ngày qua
- #41
Triển khai RLHF (Học tăng cường từ phản hồi của con người) của ChatGPT trên bất kỳ mô hình tạo nào trong thư viện transformer của Hugging Face (blommz-176B/bloom/gpt/bart/T5/MetaICL).
★ 564+0Thay đổi số sao trong 7 ngày qua - #42
Công thức cho RLHF trực tuyến và DPO lặp lại trực tuyến.
★ 544+0Thay đổi số sao trong 7 ngày qua - #43
Bộ sưu tập các bài báo và tài nguyên được tuyển chọn về On-Policy Distillation cho các mô hình ngôn ngữ lớn.
★ 534+9Thay đổi số sao trong 7 ngày qua - #44
[ICLR 2026] Mã nguồn chính thức cho TraceRL: Cách mạng hóa quá trình hậu huấn luyện cho Diffusion LLM, hỗ trợ dòng TraDo SOTA.
★ 520+1Thay đổi số sao trong 7 ngày qua