Pular para o conteúdo principal
buildradar
Sign in

uclaml/SPPO

@uclaml

A implementação oficial do Self-Play Preference Optimization (SPPO)

Estrelas
589
Bifurcações
48
Linguagem
Python
Licença
Apache-2.0
Último push
há 2 anos
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.