軽量なLLMポストトレーニングフレームワーク。SFT、RLVR、On-Policy KD、Guide KD、および混合トレーニングをサポート。シングル/マルチターンのGuide蒸留、マルチ教師蒸留、報酬混合トレーニング、自動データ分割を実現👩🎓👨🎓
このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。