mst272/LLM-Dojo
@mst272Leichtgewichtientes LLM-Post-Training-Framework mit Unterstützung für SFT, RLVR, On-Policy KD, Guide KD und hybrides Training; implementiert Single-/Multi-Turn-Guide-Distillation, Multi-Teacher-Distillation, Reward-Hybriddraining und automatisierte Datenaufteilung.
Sterne
939
Forks
85
Sprache
Python
Lizenz
—
Letzter Push
vor 6 Monaten
Verwandte Intel (0)
Noch keine verwandte Intel
Dieses Repo ist noch in keiner der vom Radar verfolgten Quellen aufgetaucht. Der Collector läuft nach Zeitplan — schau wieder vorbei, sobald er dieses Repo abdeckt.