reinforcement-learning-from-human-feedback
Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning-from-human-feedback, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng reinforcement-learning-from-human-feedback trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ reinforcement-learning-from-human-feedback.
Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.
- #1
Một khung làm việc Agentic RL dễ sử dụng, có khả năng mở rộng và hiệu năng cao dựa trên Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
★ 9.969+9Thay đổi số sao trong 7 ngày qua - #2
Safe RLHF: Căn chỉnh giá trị có ràng buộc thông qua Học tăng cường an toàn từ phản hồi của con người
★ 1.613+1Thay đổi số sao trong 7 ngày qua - #3
Một khung mô phỏng cho RLHF và các phương pháp thay thế. Phát triển phương pháp RLHF của bạn mà không cần thu thập dữ liệu con người.
★ 844-1Thay đổi số sao trong 7 ngày qua