Chuyển tới nội dung chính
buildradar
Sign in

RLHFlow/RLHF-Reward-Modeling

@RLHFlow

Công thức huấn luyện mô hình phần thưởng (reward model) cho RLHF.

Sao
1.541
Fork
110
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
1 năm trước
Pythonllmllama3rlhfreward-models

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.