Zum Hauptinhalt springen
buildradar
Sign in

uclaml/SPPO

@uclaml

Die offizielle Implementierung von Self-Play Preference Optimization (SPPO).

Sterne
589
Forks
48
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 2 Jahren
Pythondeep-learninglarge-language-modelsfine-tuningrlhfself-play

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.