Zum Hauptinhalt springen
buildradar
Sign in

sail-sg/oat

@sail-sg

OAT: Ein forschungsfreundliches Framework für das Online-Alignment von LLMs, einschließlich Reinforcement Learning, Präferenzlernen usw.

Sterne
669
Forks
63
Sprache
Python
Lizenz
Apache-2.0
Letzter Push
vor 7 Monaten
Pythonllmalignmentreasoningrlhfppodistributed-traininggrpodpor1-zerodistributed-rldueling-banditsllm-aligmentllm-explorationonline-alignmentonline-rlthompson-sampling

Noch keine verwandte Intel

Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.