Zum Hauptinhalt springen
buildradar
Sign in

PKU-Alignment/safe-rlhf

@PKU-Alignment

Safe RLHF: Restriktive Werteausrichtung durch sicheres Reinforcement Learning aus menschlichem Feedback

Sterne
1.613
Forks
134
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 9 Monaten
Pythonllmgptlarge-language-modelstransformerllmsreinforcement-learningdeepspeedtransformersai-safetyllamadatasetsrlhfvicunasafetysafe-reinforcement-learningalpacareinforcement-learning-from-human-feedbackbeaversafe-reinforcement-learning-from-human-feedbacksafe-rlhf

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.