跳到主要内容
buildradar
登录

PKU-Alignment/safe-rlhf

@PKU-Alignment

Safe RLHF:通过来自人类反馈的安全强化学习进行受约束的价值对齐

星数
1,613
Fork 数
134
语言
Python
许可
Apache-2.0
最后推送
10个月前
Pythonllmgptlarge-language-modelstransformerllmsreinforcement-learningdeepspeedtransformersai-safetyllamadatasetsrlhfvicunasafetysafe-reinforcement-learningalpacareinforcement-learning-from-human-feedbackbeaversafe-reinforcement-learning-from-human-feedbacksafe-rlhf

还没有相关情报

radar 追踪的来源里还没有出现过这个 repo。收集器按计划运行——等它覆盖到这个 repo 再回来看看。