Chuyển tới nội dung chính
buildradar
Sign in
Chủ đề · reinforcement-learning-from-human-feedback

reinforcement-learning-from-human-feedback

Các kho mã nguồn mở đang theo dõi được gắn thẻ reinforcement-learning-from-human-feedback, sắp xếp theo số sao.

Kho mã
3
Tổng số sao
12.426
Số sao trung bình
4.142
Tỷ trọng
0,00%

Những chủ đề thường xuất hiện cùng reinforcement-learning-from-human-feedback trên cùng một kho mã.

Mới nổi gần đây

Các kho mã tạo trong 90 ngày qua và được gắn thẻ reinforcement-learning-from-human-feedback.

Không có kho mã mới nào gắn thẻ chủ đề này trong 90 ngày qua.

  • OpenRLHF@OpenRLHF

    Một khung làm việc Agentic RL dễ sử dụng, có khả năng mở rộng và hiệu năng cao dựa trên Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

    9.969+9Thay đổi số sao trong 7 ngày qua
  • safe-rlhf@PKU-Alignment

    Safe RLHF: Căn chỉnh giá trị có ràng buộc thông qua Học tăng cường an toàn từ phản hồi của con người

    1.613+1Thay đổi số sao trong 7 ngày qua
  • alpaca_farm@tatsu-lab

    Một khung mô phỏng cho RLHF và các phương pháp thay thế. Phát triển phương pháp RLHF của bạn mà không cần thu thập dữ liệu con người.

    844-1Thay đổi số sao trong 7 ngày qua
← Quay lại danh sách chủ đề