Lompat ke konten utama
buildradar
Sign in

princeton-nlp/SimPO

@princeton-nlp

[NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward

Bintang
958
Fork
78
Bahasa
Python
Lisensi
MIT
Push terakhir
2 tahun yang lalu
Pythonlarge-language-modelsalignmentrlhfpreference-alignment

Belum ada intel terkait

Repositori ini belum muncul di sumber mana pun yang dilacak radar. Kolektor berjalan sesuai jadwal — periksa kembali setelah mencakup repositori ini.