Lompat ke konten utama
buildradar
Sign in

uclaml/SPPO

@uclaml

Implementasi resmi dari Self-Play Preference Optimization (SPPO)

Bintang
589
Fork
48
Bahasa
Python
Lisensi
Apache-2.0
Push terakhir
2 tahun yang lalu
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.