mst272/LLM-Dojo
@mst272हल्का LLM पोस्ट-ट्रेनिंग फ्रेमवर्क, जो SFT, RLVR, On-Policy KD, Guide KD और मिश्रित प्रशिक्षण का समर्थन करता है; सिंगल/मल्टी-टर्न गाइड डिस्टिलेशन, मल्टी-टीचर डिस्टिलेशन, रिवॉर्ड मिक्स ट्रेनिंग और स्वचालित डेटा शंटिंग को लागू करता है।
स्टार
939
फ़ोर्क
85
भाषा
Python
लाइसेंस
—
आख़िरी push
6 माह पहले
संबंधित intel (0)
अभी कोई संबंधित intel नहीं
यह रिपॉजिटरी radar द्वारा ट्रैक किए जाने वाले किसी भी स्रोत में अभी तक नहीं आई है। कलेक्टर एक शेड्यूल पर चलता है — जब यह इस रिपॉजिटरी को कवर करे तब वापस देखें।