Erfasste Open-Source-Repos von yongliang-wu, sortiert nach Sternen.
[ICLR 2026] Zur Verallgemeinerung von SFT: Eine Reinforcement-Learning-Perspektive mit Belohnungskorrektur.