CarperAI/trlx
@CarperAI人間からのフィードバックによる強化学習 (RLHF) を用いた言語モデルの分散学習のためのリポジトリ
スター
4,754
フォーク
486
言語
Python
ライセンス
MIT
最終プッシュ
3 年前
関連 Intel(0)
関連 Intel はまだありません
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。
人間からのフィードバックによる強化学習 (RLHF) を用いた言語モデルの分散学習のためのリポジトリ
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。