Saltar al contenido principal
buildradar
Sign in

RLHFlow/RLHF-Reward-Modeling

@RLHFlow

Recetas para entrenar modelos de recompensa para RLHF.

Estrellas
1541
Bifurcaciones
110
Lenguaje
Python
Licencia
Apache-2.0
Último push
hace 1 año
Pythonllmllama3rlhfreward-models

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.