Saltar al contenido principal
buildradar
Sign in

princeton-nlp/SimPO

@princeton-nlp

[NeurIPS 2024] SimPO: Optimización de preferencias simple con recompensa sin referencia.

Estrellas
959
Bifurcaciones
78
Lenguaje
Python
Licencia
MIT
Último push
hace 2 años
Pythonlarge-language-modelsalignmentrlhfpreference-alignment

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.