Pular para o conteúdo principal
buildradar
Sign in

princeton-nlp/SimPO

@princeton-nlp

[NeurIPS 2024] SimPO: Simple Preference Optimization with a Reference-Free Reward

Estrelas
959
Bifurcações
78
Linguagem
Python
Licença
MIT
Último push
há 2 anos
Pythonlarge-language-modelsalignmentrlhfpreference-alignment

Ainda não há intel relacionado

Este repo ainda não apareceu em nenhuma das fontes que o radar rastreia. O coletor roda em um cronograma — volte quando ele cobrir este repo.