Saltar al contenido principal
buildradar
Sign in

uclaml/SPPO

@uclaml

La implementación oficial de Self-Play Preference Optimization (SPPO)

Estrellas
589
Bifurcaciones
48
Lenguaje
Python
Licencia
Apache-2.0
Último push
hace 2 años
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.