メインコンテンツへスキップ
buildradar
ログイン

opendilab/awesome-RLHF

@opendilab

人間フィードバックによる強化学習(Reinforcement Learning with Human Feedback)のリソースを厳選したリスト(継続的に更新中)。

スター
4,424
フォーク
260
言語
ライセンス
Apache-2.0
最終プッシュ
4 か月前
deep-learninglarge-language-modelsdeep-reinforcement-learningreinforcement-learningrlhfhuman-feedback

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。