Saltar al contenido principal
buildradar
Sign in

voidful/TextRL

@voidful

Implementación de RLHF (aprendizaje por refuerzo con retroalimentación humana) de ChatGPT en cualquier modelo generativo de los transformers de huggingface (blommz-176B/bloom/gpt/bart/T5/MetaICL).

Estrellas
564
Bifurcaciones
61
Lenguaje
Python
Licencia
MIT
Último push
hace 4 meses
Pythonlanguage-modelpytorchchatgptreinforcement-learningnlpgpt-3rlhfgpt-2controlled-nlgnlg

Aún no hay intel relacionado

Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.