mst272/LLM-Dojo
@mst272Framework de post-entraînement LLM léger prenant en charge SFT, RLVR, On-Policy KD, Guide KD et l'entraînement hybride ; implémente la distillation guidée multi-tours, la distillation multi-enseignants, l'entraînement par récompense hybride et le routage de données automatisé.
Étoiles
939
Bifurcations
85
Langage
Python
Licence
—
Dernier push
il y a 6 mois
Intel associée (0)
Aucune intel associée pour le moment
Ce dépôt n'est encore apparu dans aucune des sources que le radar suit. Le collecteur suit un calendrier — revenez une fois qu'il couvre ce dépôt.