SFT, RLVR, On-Policy KD, Guide KD 및 혼합 학습을 지원하는 경량 LLM 사후 학습 프레임워크; 단일/다중 턴 가이드 증류, 다중 교사 증류, 보상 혼합 학습 및 자동 데이터 분기 구현
이 저장소는 radar가 추적하는 어떤 소스에도 아직 등장하지 않았습니다. 수집기는 예약에 따라 실행됩니다——이 저장소를 다루게 되면 다시 확인하세요.