mst272/LLM-Dojo
@mst272Framework ligero de post-entrenamiento para LLM, compatible con SFT, RLVR, On-Policy KD, Guide KD y entrenamiento mixto; implementa destilación Guide de una/múltiples rondas, destilación de múltiples profesores, entrenamiento mixto con Reward y distribución automatizada de datos
Estrellas
939
Bifurcaciones
85
Lenguaje
Python
Licencia
—
Último push
hace 6 meses
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.