メインコンテンツへスキップ
buildradar
Sign in

CarperAI/trlx

@CarperAI

人間からのフィードバックによる強化学習 (RLHF) を用いた言語モデルの分散学習のためのリポジトリ

スター
4,754
フォーク
486
言語
Python
ライセンス
MIT
最終プッシュ
3 年前
Pythonmachine-learningpytorchreinforcement-learning

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。