メインコンテンツへスキップ
buildradar
Sign in

PKU-Alignment/safe-rlhf

@PKU-Alignment

Safe RLHF: 人間からのフィードバックによる安全な強化学習を通じた制約付き価値アライメント

スター
1,613
フォーク
134
言語
Python
ライセンス
Apache-2.0
最終プッシュ
9 か月前
Pythonllmgptlarge-language-modelstransformerllmsreinforcement-learningdeepspeedtransformersai-safetyllamadatasetsrlhfvicunasafetysafe-reinforcement-learningalpacareinforcement-learning-from-human-feedbackbeaversafe-reinforcement-learning-from-human-feedbacksafe-rlhf

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。