メインコンテンツへスキップ
buildradar
Sign in

uclaml/SPPO

@uclaml

Self-Play Preference Optimization (SPPO) の公式実装

スター
589
フォーク
48
言語
Python
ライセンス
Apache-2.0
最終プッシュ
2 年前
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。