Saltar al contenido principal
buildradar
Sign in

PKU-Alignment/safe-rlhf

@PKU-Alignment

Safe RLHF: Alineación de valores restringida mediante aprendizaje por refuerzo seguro a partir de retroalimentación humana

Estrellas
1613
Bifurcaciones
134
Lenguaje
Python
Licencia
Apache-2.0
Último push
hace 10 meses
Pythonllmgptlarge-language-modelstransformerllmsreinforcement-learningdeepspeedtransformersai-safetyllamadatasetsrlhfvicunasafetysafe-reinforcement-learningalpacareinforcement-learning-from-human-feedbackbeaversafe-reinforcement-learning-from-human-feedbacksafe-rlhf

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.