Chuyển tới nội dung chính
buildradar
Sign in

uclaml/SPPO

@uclaml

Triển khai chính thức của Self-Play Preference Optimization (SPPO).

Sao
589
Fork
48
Ngôn ngữ
Python
Giấy phép
Apache-2.0
Push gần nhất
2 năm trước
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Chưa có intel liên quan

Kho mã này chưa xuất hiện trong bất kỳ nguồn nào radar theo dõi. Bộ thu thập chạy theo lịch — hãy quay lại khi nó bao quát kho mã này.