yongliang-wu/DFT
@yongliang-wu[ICLR 2026] Sobre la generalización de SFT: una perspectiva de aprendizaje por refuerzo con rectificación de recompensas.
Estrellas
1035
Bifurcaciones
26
Lenguaje
Python
Licencia
—
Último push
hace 1 mes
Intel relacionado (0)
Aún no hay intel relacionado
Este repo no ha aparecido en ninguna de las fuentes que rastrea el radar. El recopilador funciona con un horario — vuelve cuando lo haya cubierto.